返回首頁

代理訓練研究

Environment Evolution 離策略提升終端訓練難度,兩款 Qwen 代理增加 14.4、18.0 個百分點

騰訊混元等研究者讓終端環境依情境新穎度、技能稀有度與執行長度逐代變難,無須持續以受訓模型的 rollout 尋找弱點。200 步強化學習實驗優於共演化基線,但目前只有作者結果,且尚未公開完整重現套件。

Iain Macaulay · CC BY-SA 2.0 · Image source
zh-Hant

騰訊混元與合作研究者提出 Environment Evolution,嘗試解決終端代理訓練中的環境飽和問題。現有共演化方法通常先讓目標模型在任務中 rollout,再根據失敗案例產生更難環境;模型逐漸變強後,失敗訊號會變少,而且生成出的難度容易綁定特定模型。新方法改從多輪學習目標推導離策略難度,將影響因素拆成情境新穎度、技能稀有度與預期執行長度,不必依賴目前受訓代理的通過率。

實作採用多代理、雙回饋迴圈。第一個迴圈提出並審查環境演化計畫,第二個迴圈依計畫修改環境,再反覆修復至通過可解性與品質檢查。每個被接受的環境成為下一代起點,形成逐代加難的 lineage;若某個方向耗盡修復預算,系統會切換至其他難度方向。這與單次合成大量任務不同,重點是讓訓練過程持續取得仍有區辨力的可驗證互動環境。

作者以 Hy4 preview、Claude Opus 5 與 GPT-5.6 Sol 執行 rollout,稱不同模型都會隨世代感受到難度上升。接著對 Qwen3.6-27B 與 Qwen3.6-35B-A3B進行 200 步長時程強化學習;兩者在 Terminal-Bench 2.1 分別提升 14.4 與 18.0 個百分點,峰值為 71.5% 和 64.9%,並高於論文中的共演化與環境組合基線。

這些數字尚不能直接外推至一般軟體工程代理。論文是未經同儕審查的預印本,附錄也承認更多細節及「同一模型生成並學習環境」的實驗仍待後續版本;目前亦未見完整程式、環境映像與訓練資料發布。值得觀察的是跨模型、跨基準重現,以及逐代合成與驗證所增加的推論及運算成本。

來源

  1. Environment Evolution for Terminal Agents
  2. Environment Evolution for Terminal Agents — paper page