AI 代理評測
AI4AI-Bench 要代理重寫十類訓練演算法,最佳系統平均僅達 0.250
AI4AI-Bench 讓程式代理在單張 B300 上修改完整研究程式庫,再由隔離評估器從頭訓練及評分。六套系統共 290 次實驗中,逾四成結果不如原始演算法,多數提交甚至沒有改變模型如何學習。

現有「AI 做 AI 研究」評測常把資料蒐集、超參數搜尋與程式最佳化混在一起,難以判斷代理是否真的設計出新的學習方法。AI4AI-Bench 因此凍結十個研究程式庫,分別涵蓋監督微調、多輪代理強化學習、在線蒸餾、獎勵模型、DPO、擴散模型 RL、機器遺忘、離散圖擴散、權重平均與一次性剪枝,要求代理直接修改目標函數、更新規則、資料流程或訓練迴圈。
每項任務給代理四小時及一張 NVIDIA B300,期間可反覆使用便宜的代理指標,但最後只能提交原始碼,不能帶走權重、快取或執行狀態。主辦方隨後在乾淨容器中從頭執行最多十二小時,使用代理無法存取的固定評估器打分。為合併不同指標,評測把無資訊模型設為 0、原始程式庫演算法設為 0.1、理論最佳值設為 1.0。
研究測試 GPT-5.6、Claude 5 與 Kimi K3 等六套模型—代理框架組合,共形成 29 種設定、290 個實驗格。所有實驗平均分為 0.166;按系統彙總時 Claude Opus 5 最高,平均 0.250,而單一最佳設定為中等推理強度的 Opus 5,平均 0.288。290 次嘗試中有 124 次低於原始演算法的 0.1。263 個實際修改程式碼的提交裡,141 個只調整預算、checkpoint、容量或超參數,沒有改變學習程序;真正觸及演算法層的提交平均得分 0.226,其餘僅 0.126。
這使「代理會寫訓練程式」與「代理能提出有效訓練演算法」首次有較清楚的操作性區分,也暴露高推理預算主要增加嘗試深層修改的意願,並不保證成功。限制是評測極度昂貴、每項任務只有單張 B300 與固定時間窗,分數尺度亦依研究者設定的無資訊點和最佳值。它沒有提供人類研究員基線,因此不能用來主張代理已接近或遠離人類演算法研究能力。