返回首頁

AI 代理訓練

EnvACE 讓單一模型同時扮演代理與環境,三項工具評測綜合分升至 32.91%

EnvACE 在訓練時自行模擬工具回應,再用任務成敗共同更新行動與環境角色。Qwen3-8B 實驗優於裸模型,但對最強環境合成基線的領先幅度僅 0.37 個百分點。

FUJIWARA SADANOBU · Public domain · Image source
zh-Hant

工具代理的強化學習通常需要可執行 API、資料庫與狀態轉移,建立和驗證這些訓練環境往往比產生提示更昂貴。EnvACE 改由同一個語言模型交替扮演兩種角色:Actor 先產生工具呼叫,Rehearsal 角色再預測該呼叫應引發的環境回應;預測結果被寫回軌跡,供下一步行動使用。兩種輸出共享模型參數,但以角色各自的獎勵基線計算 GRPO advantage,避免行動與模擬回應直接用同一分布比較。

主實驗以 Qwen3-8B 訓練 470 步,每個提示取四條 rollout,軌跡最多 30 回合,使用 16 張 NVIDIA H20;任務獎勵部分來自可驗證評分器,部分使用 Qwen3-30B-A3B 裁判。EnvACE 在 BFCL-v4、τ²-Bench 與 VitaBench 的平均綜合分為 32.91%,高於未訓練 Qwen3-8B 的 28.48%、EnvScaler-8B 的 31.92%及 AWM-14B 的 32.54%。FinMCP-Bench 的工具 F1 為 46.78%,較 EnvScaler-8B 高 3.10 點,但工具召回率並非最高。

內化的環境模型也被用於測試時預演:先私下模擬候選軌跡,再把摘要交給一次真正執行。兩次平行預演令指定兩項評測的綜合分由 36.7%升至 40.9%;增加至三次反而退步,作者推測是上下文膨脹所致。

工程上的關鍵疑問是「自行想像工具輸出」能否在陌生或快速變動的 API 上保持校準。模型可能同時產生錯誤行動與迎合該行動的虛構回應,而現有結果仍依賴作者配置、有限模型家族及部分 LLM 裁判。程式碼已公開,但儲存庫剛建立,尚缺少廣泛獨立重現。

來源

  1. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
  2. Within-yao/EnvACE