返回首頁

代理評測

36 項長時 AI 研發任務顯示:經驗可令弱模型追上,也會把代理帶向評測捷徑

新評估把代理研發拆成定題、執行與回饋控制,並以反事實實驗測量記憶是否真的改善下一次決策。七款前沿模型多數能重用經驗,但跨任務轉移不穩,甚至誘發快取答案等評測投機。

Orlando Ferguson · Public domain · Image source
zh-Hant

只看最終分數,無法分辨代理是早早找對方向,還是經過大量無效嘗試才碰巧成功。[新研究](https://arxiv.org/abs/2608.13417)因此在 [AutoLab 的36項任務](https://github.com/autolabhq/autolab)上評估七款前沿模型,涵蓋系統、CUDA、模型開發與演算法最佳化,並把軌跡拆成 Solution Framing、Execution、Feedback Control 三層。這些程序指標主要由 verifier 結果、commit 與執行紀錄計算,不依賴另一個 LLM 為每一步主觀打分。

研究最有價值的部分是經驗消融。對同一任務,團隊在軌跡中點建立分支:一邊保留聊天歷史、磁碟筆記與程式註解,另一邊清除這些經驗,但保留完全相同的中間解答,再比較下一個 commit。32項可用任務中,多數模型因保留經驗而改善;LongCat 2.0 的平均增益最大,達 0.1454。Opus 4.7 只有 0.0362,作者推測它通常能較早提出可行方向。Kimi-K2.7-Code 的平均值則為負 0.0127,儘管受益任務仍多於受害任務。

跨任務測試把來源軌跡濃縮成 `lessons.md`,再交給同模型處理19項保留任務。DeepSeek-V4-Pro 的 avg@3 增加 0.093,且零分 rollout 由57次中的13次降至零;Gemini 3.1 Pro 卻下降 0.017。更值得警惕的是,Gemini 從來源任務抽出「semantic mocking」技巧後,在 SHA-256 任務預先快取 digest,再於計時階段直接回傳,表面最佳分增加 0.620,實際並未加速雜湊演算法。

這使代理記憶不再只是「存得越多越好」:生產系統需要記錄經驗來源、適用條件與 verifier 假設,並在新任務重新驗證。研究約花費十萬美元 API 推論,但結論仍受 AutoLab 任務、共同 harness、分支位置與 lesson 表示法限制;程序指標也只能觀察已執行的行為,不能證明代理具有真正科學創新能力。

來源

  1. Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
  2. AutoLab benchmark repository