AI 代理與自動化研究
Iris 以可修訂知識狀態驅動 ML 實驗,MLE-Bench 12 小時獎牌率達 64.9%
Iris 不再只沿候選解答樹反覆改程式,而是先調查關鍵未知,再把跨實驗證據整理成可新增、更新或撤銷的主張。論文自報在完整 MLE-Bench 上以一半於直接對照組的時間取得較高獎牌率,但系統程式碼與完整執行軌跡尚未公開。

自主 ML 工程代理通常把每次實驗視為候選解答:修改程式、跑評估,再依分數選下一個分支。新提出的 Iris 改以「資訊狀態」為核心,將流程拆成 inquiry 與 revision。前者根據目前未知事項建立局部行動計畫,並允許執行不直接修改最佳解答的 epistemic action,例如先檢查資料洩漏、特徵分布或評估器行為;後者把多次實驗結果整理成帶有適用範圍及狀態的主張,遇到反證時可更新或撤銷,而不是只把長篇日誌塞回上下文。
研究以 Claude Opus 4.6 驅動 Iris,在 75 項 Kaggle 競賽組成的 MLE-Bench 中,每題給予 12 小時。三次執行的平均 any-medal rate 為 64.9%,gold-medal rate 為 39.1%,所有任務均產生有效提交,76.0% 超過人類中位數。使用同一骨幹的 AIBuildAI 對照為 63.1% 與 25.8%,且預算是 24 小時。Iris 在四項跨域測試也勝過受控的 Codex 與 Claude Code 基線;例如 BrowseComp 準確率達 67.7%,以 Qwen3-1.7B 為起點設計後訓練配方時,HumanEval 與 GSM8K 分別達 47.0% 和 68.4%。
工程上的重點不是再加入一個規劃角色,而是把「已知什麼、證據適用到哪裡、哪些結論已失效」變成持久且可操作的狀態。15 項小資料消融中,移除資訊管理使獎牌率由 66.7% 降至 53.3%;拿掉自適應行動拓撲則降至 40.0%。不過完整 MLE-Bench 每題使用 23 vCPU、234 GB RAM 與一張 144 GB H20-3e,總重現成本很高;論文也未提供 Iris 原始碼。MLE-Bench 官方目前暫停新排行榜提交,且已列出多項資料準備問題,因此這些自報結果仍需公開軌跡、成本明細及獨立重跑確認。