代理評估
Task-CoEvolve 只抽 20% 驗證任務,harness 搜尋 token 成本降低 67% 至 80%
Task-CoEvolve 依候選 harness 的歷史分歧動態挑選驗證任務,再以抽樣機率估算全體成績。它在 Terminal-Bench 2.1 接近全量搜尋表現,但論文沿用同一批任務搜尋與評分,且程式尚未實際釋出。
自動最佳化代理 harness 時,外層模型會反覆改寫記憶、檢索及提示流程,再執行驗證任務決定是否保留候選版本。問題是長流程沙盒任務可能每項耗時數十分鐘;每輪跑完整驗證集,評估成本很快便超過產生新程式碼本身。
[Task-CoEvolve](https://arxiv.org/abs/2608.20169)不固定使用一個小型子集,而是根據各任務過往成功率的 Bernoulli variance 分配抽樣權重。候選 harness 時而成功、時而失敗的任務會獲得較高權重;觀測較少或尚未被解出的任務則以探索項及權重下限避免永久消失。由於每輪抽到的難度不同,系統再依任務納入機率,使用 Hájek 或錨定差值估計器,把局部結果換算到共同的全驗證集尺度。
在 Terminal-Bench 2.1 的 89 項任務上,每輪只評估約 20%,GPT-5.6-Luna 與 Qwen3.6-35B-A3B 的平均通過率達 51.7%,全量 Meta-Harness 為 52.8%。前者只執行約 180 次任務,後者為 890 次;兩種模型的輸入 token 成本分別降低 80% 與 67%,總搜尋時間亦由 22.2 降至 11.5 小時、38.0 降至 20.5 小時。文字分類實驗中,20% 配額的平均測試準確率為 49.3%,略高於全量搜尋的 48.6%。
數字仍須謹慎解讀:Terminal-Bench 搜尋與最終評分使用同一批任務,只有單次 rollout,約一點差距也只相當於一題;高資訊任務通常較長,因此任務數縮至五分之一不會等比例降低時間。[GitHub 專案頁](https://github.com/Agent4Science-UTokyo/Task-CoEvolve)目前只有說明與圖表,README 仍標示程式「即將提供」,獨立重現要等真正的實作與設定檔。