AI 代理與強化學習
Harness-R1 從代理失敗軌跡學習修改執行框架,Qwen3.5-9B 成功率提高 9.3 點
Harness-R1 不調整目標代理的模型權重,而是訓練另一個 9B 模型修改其上下文、工具與驗證程式。三個環境的平均成功率由 44.3% 升至 53.6%,但尚無公開程式碼可供檢查補丁安全性。

多數 AI 代理部署後會累積大量失敗軌跡,但改善方式通常仍是重新微調模型或由工程師手動修改提示與工具程式。Harness-R1 把代理的「harness」本身變成可學習對象:這層可執行程式負責組裝上下文、介接工具、驗證動作及錯誤復原,而目標代理的權重可以保持凍結。
系統另訓練一個 9B「harness engineer」,讀取一批目標代理的失敗軌跡後,產生可執行的框架補丁。補丁先經驗證,再用同一批任務重新執行凍結的目標代理;實際任務是否成功成為獎勵訊號。訓練先以監督式微調冷啟動,之後採用 group-relative policy optimization,讓編輯策略針對補丁造成的最終效果更新,而不只學習模仿人工修改。
研究在 WebShop、ALFWorld 與 DBBench 測試,以 Qwen3.5-9B 作為目標代理時,未微調模型的平均成功率從 44.3% 提高至 53.6%,增加 9.3 個百分點。即使先對目標代理做任務微調,再使用專屬 harness engineer,平均分仍由 59.2% 升至 64.2%。這表示模型權重與代理執行框架可能是兩條互補的最佳化軸,也為持續部署中的「從事故自動修復代理」提供具體路徑。
風險同樣明顯:可自動改寫工具驗證與復原邏輯的模型,也可能移除安全檢查、過度配合同一批測試,或產生難以審核的行為漂移。同批失敗案例同時用於產生補丁與回饋,亦可能放大過度擬合。論文目前未提供公開程式碼、補丁資料集或獨立重現結果;工程團隊應關注後續是否加入權限沙箱、差異審核、保留測試集與回滾機制。