AI 代理與自動化研究
全域除錯記憶讓 AutoResearch 代理避免重踩錯誤,AIDE 金牌執行由 22 次增至 38 次
研究者在固定 GPT‑5‑mini 與兩小時預算下,讓除錯顧問跨搜尋分支共享執行環境限制,使 AIDE 的 90 次執行全部產生有效提交。成果顯示代理外殼仍有大量可回收算力,但實驗只涵蓋九項表格預測競賽。

自動研究代理未必缺少模型能力,算力也可能耗在反覆修復同一個錯誤。8 月 11 日公開的[研究](https://arxiv.org/abs/2608.10424)檢查 AIDE、ML‑Master 與 MLEvolve 的搜尋流程,發現不同程式分支彼此隔離:一條分支已查明套件版本、欄位格式或執行環境限制,其他分支仍會重新踩雷。
團隊加入「全域除錯顧問」,把已確認的執行期限制與修補經驗寫入跨分支記憶,並在代理產生下一段程式前注入相關資訊。九項 MLE‑bench/Kaggle 表格任務各跑十個種子後,AIDE 的有效提交由 73/90 升至 90/90,達到人類排行榜前 10% 的金牌執行由 22 次增至 38 次;ML‑Master 金牌數亦由 18 增至 29。AIDE 搜尋日誌中的重複錯誤比例從 46% 降至 7.8%,可正常執行的節點比例則由 54.7% 升至 79.0%。
研究也測試明確要求超參數調校,以及以 Thompson sampling 配合回溯取代較僵硬的節點選擇;另一方面,刻意植入錯誤的探索式資料分析結論,往往沒有改變後續模型選擇,顯示代理可能只是在表面模仿分析流程。
這對 AutoML 與研究代理工程的啟示,是錯誤記憶、搜尋政策及預算控制應被視為一級系統元件。[公開程式](https://github.com/tingtang2/autoresearch-compute-recovery/tree/main)包含處理與對照組命令,但維護者註明部分流程只完成語法及接線驗證,尚未在該 checkout 端到端重跑。所有主要實驗也僅使用 GPT‑5‑mini、表格資料與固定 CPU 時限,不能直接外推至深度學習訓練、科學模擬或更強模型。