返回首頁

代理評測

跨語言提示改變代理工具路徑,四款大型模型僅保留 71% 至 73% 行動策略

微軟研究團隊以 238 萬次 rollout 比較 41 種語言,發現相同任務換語言後,即使採貪婪解碼,代理仍會改走不同工具路徑。研究亦顯示非英語任務高度依賴先轉成英語,但目前工具只是符號化呼叫,尚未涵蓋真實 API 的錯誤與副作用。

miss_rogue on flickr, https://www.flickr.com/photos/missrogue/132777293/ · CC BY-SA 2.0 · Image source
zh-Hant

多語代理評測通常只比較最終答案,卻忽略真正決定延遲、成本及權限風險的中間行動。微軟研究團隊新提出的測量流程,把五個工具名稱構成共同的符號化行動空間,使用六套平行基準、41 種語言及八款模型產生 2,382,875 次 rollout,再比較同一任務在相同語言重跑與跨語言執行時的軌跡。

直接計算軌跡相似度容易被短軌跡、空軌跡、隨機重合及模型自身不穩定性污染。團隊因此排除空軌跡、匹配長度,並以跨語言一致度除以同語言重現度,得到「正規化策略保留率」。在溫度為零時,Gemma 3 27B、Sarvam-M、Qwen3-235B-A22B 與 Llama 4 Maverick 落在 71% 至 73%的窄區間;模型身分只解釋 5.7%的變異,基準差異反而解釋 26.9%。10B 參數以下則未呈現同樣規律,未校正偶然重合甚至會顛倒小模型排名。

軌跡顯示,非英語輸入普遍先經英語樞紐:改編基準中 Translate 是使用最多的工具,推理文字約 99%為 ASCII。移除翻譯工具會依原本使用程度降低跨語言一致性,直接要求模型不要翻譯的遵從率亦低於 1%。另一項警訊來自評測管線:一條不適合多語輸出的正規表示式曾製造假性失敗,加入兩個範例後,某模型的可解析準確率提高 26 倍,而人類可讀輸出幾乎沒變。

工程上,英語通過的工具政策、費用預估與安全測試不能直接外推至其他語言;應同時記錄行動序列、語言內重現率及解析失敗。限制是所有工具呼叫都沒有真正執行,尚未測量 API 回應、重試、狀態變更或權限後果;論文宣稱公開程式,但目前 GitHub 儲存庫仍是空的,只有 Hugging Face 基準資料可直接檢查。

來源

  1. Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
  2. agentic-tooluse-adapted-multilingual
  3. agent-actions-speak-louder-than-words