代理訓練/開源框架
EnvHarness 不改驗證器即可重塑代理訓練環境,ALFWorld 域外成績提高 9 點
Google Cloud AI Research 等團隊把代理 harness 的概念套到環境端,以可組合介面層改變起始狀態、可見資訊及任務流程。開源實驗涵蓋五套基準,最高提升 9 個百分點,但重現完整結果仍需要多種外部環境與商用模型 API。

Google Cloud AI Research、華盛頓大學聖路易分校等團隊公開 [EnvHarness](https://arxiv.org/abs/2608.19880),試圖解決代理訓練環境建置昂貴、內容固定,而且很快被模型「學完」的問題。它不重新生成整套模擬器,而是在既有環境的 `reset`、`step`、觀察及評分介面外加一層可程式化包裝;底層狀態轉移與人工撰寫的驗證器維持不變。
[開源實作](https://github.com/google-research/envharness)將元件分為 Setup、Rules 與 Link:Setup 重播動作以改變初始狀態;Rules 過濾動作、轉移結果或觀察;Link 則把另一環境的任務串入同一回合。論文使用 Stage、Contract、Chain 等名稱,兩者概念相同但命名已有差異。LLM 產生的 Rules 是可執行 Python,框架會放進隔離子程序,避免錯誤變更直接中止整批實驗。
自動化部分 EnvRigger 把受訓代理視為黑箱,讀取成功及失敗軌跡、診斷缺失,再產生環境元件並以新 rollout 檢驗是否仍可解且確實針對弱點。這保留原評分器,比同時生成任務與驗證器更容易維持結果可比性。
團隊在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA 與 SpreadsheetBench 測試。由 EnvHarness 環境歸納技能後,ALFWorld 域外成功率由原環境技能的 61.4% 升至 70.4%;SWE-bench Verified 由 49.88% 升至 52.58%,平均步數由 55.01 降至 49.61。各表為三次獨立執行平均,但絕對數字來自 Gemini,儲存的技能也依賴特定嵌入空間。工程團隊下一步應觀察跨模型重現、生成程式碼的沙盒邊界,以及經包裝環境學到的策略是否會利用介面捷徑。