返回首頁

AI 代理與自動化研究

全域除錯記憶讓 AutoResearch 代理避免重踩錯誤,AIDE 金牌執行由 22 次增至 38 次

研究者在固定 GPT‑5‑mini 與兩小時預算下,讓除錯顧問跨搜尋分支共享執行環境限制,使 AIDE 的 90 次執行全部產生有效提交。成果顯示代理外殼仍有大量可回收算力,但實驗只涵蓋九項表格預測競賽。

Earthpig · CC BY-SA 3.0 · Image source
zh-Hant

自動研究代理未必缺少模型能力,算力也可能耗在反覆修復同一個錯誤。8 月 11 日公開的[研究](https://arxiv.org/abs/2608.10424)檢查 AIDE、ML‑Master 與 MLEvolve 的搜尋流程,發現不同程式分支彼此隔離:一條分支已查明套件版本、欄位格式或執行環境限制,其他分支仍會重新踩雷。

團隊加入「全域除錯顧問」,把已確認的執行期限制與修補經驗寫入跨分支記憶,並在代理產生下一段程式前注入相關資訊。九項 MLE‑bench/Kaggle 表格任務各跑十個種子後,AIDE 的有效提交由 73/90 升至 90/90,達到人類排行榜前 10% 的金牌執行由 22 次增至 38 次;ML‑Master 金牌數亦由 18 增至 29。AIDE 搜尋日誌中的重複錯誤比例從 46% 降至 7.8%,可正常執行的節點比例則由 54.7% 升至 79.0%。

研究也測試明確要求超參數調校,以及以 Thompson sampling 配合回溯取代較僵硬的節點選擇;另一方面,刻意植入錯誤的探索式資料分析結論,往往沒有改變後續模型選擇,顯示代理可能只是在表面模仿分析流程。

這對 AutoML 與研究代理工程的啟示,是錯誤記憶、搜尋政策及預算控制應被視為一級系統元件。[公開程式](https://github.com/tingtang2/autoresearch-compute-recovery/tree/main)包含處理與對照組命令,但維護者註明部分流程只完成語法及接線驗證,尚未在該 checkout 端到端重跑。所有主要實驗也僅使用 GPT‑5‑mini、表格資料與固定 CPU 時限,不能直接外推至深度學習訓練、科學模擬或更強模型。

來源

  1. Recovering Wasted Compute in Autoresearch Agents
  2. autoresearch-compute-recovery:論文實驗程式