返回首頁

AI 代理與評測

Bench2Robust 注入九類工具故障,69/70 組代理測試出現性能倒退

Amazon 研究團隊把既有工具使用基準改造成可控制「重試、切換或停止」的故障環境。Qwen3-4B 加入結構化復原資訊後,受干擾零售任務通過率最高增加 16.8 個百分點,但系統尚未真正驗證不可解任務上的正確棄權。

Joe Ravi · CC BY-SA 3.0 · Image source
zh-Hant

工具代理在基準中通常面對永遠成功、格式正確而且資料新鮮的 API;真實服務卻會逾時、限流、變更 schema,甚至回傳看似正常的過期或錯誤資料。Amazon 團隊提出 [Bench2Robust](https://arxiv.org/abs/2608.11977),在代理與工具之間插入故障層,把每個 episode 明確分成三種可解性:S1 保留原路徑,重試即可恢復;S2 持續封鎖主要路徑,必須改用等價工具;S3 封鎖所有可行路徑,理想行為是停止並升級處理。

框架以 60% 機率回傳正常結果,其餘機率分配給九種故障,包括逾時、限流、驗證失敗、畸形回應、schema drift,以及不帶明顯錯誤訊號的部分資料、陳舊值與事實錯誤。研究把它接到 [τ²-bench](https://github.com/sierra-research/tau2-bench) 與 Berkeley Function-Calling Leaderboard 的多輪任務;七款模型、四個模型家族及十個任務切片共 70 組比較中,有 69 組在故障注入後退步,最大降幅達 46.7 個百分點。即使 Qwen3-235B,在 τ²-retail 仍下降 15.8 點。

團隊另為 Qwen3-4B-Thinking-2507 提供 Bayesian Tool Memory(BTM),把備援工具對應、驗證限制及從 rollout 估計的 Beta 後驗復原率寫入推論上下文。402 個保留零售任務中,未重新訓練的模型加入 BTM 後,無替代工具設定由 20.1%升至 36.9%;再結合 DAPO 強化學習,兩種故障設定達 40.8%及 45.5%。不過消融顯示,主要收益來自人工配置的備援圖與規則,而非後驗數值本身。

工程上的訊息是,代理 runtime 應顯式描述可替代工具、可重試錯誤及不可逆操作前的驗證要求,不能只靠通用「遇錯重試」提示。仍須留意:論文沒有公開 Bench2Robust 實作;S3 不可解任務亦沒有正向評分,因此結果只能支持重試與切換改善,不能證明模型已學會可靠棄權。

來源

  1. Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection
  2. τ²-bench:Tool-Agent-User Interaction Benchmark
  3. Berkeley Function-Calling Leaderboard