AI 研究
RECLAIM 以百篇論文測試研究代理,完整材料組最高重現率 41%
基準要求代理自行安裝、除錯與執行實驗,再由獨立模型查核執行證據。公開程式碼與紀錄讓開發者能追查失敗環節,但結果仍受模型範圍與單次測試限制。

RECLAIM 研究團隊於 9 月 23 日提交新預印本,將研究代理的測試目標設定為重現論文中的指定實驗結果。基準涵蓋 100 篇 NeurIPS 2025 論文,要求代理從安裝套件、排除依賴衝突到執行實驗自行完成,並留下可查核的證據。[論文](https://arxiv.org/abs/2609.28850)、[專案說明](https://github.com/mithils3/reclaim)
任務依原作者公開的材料分三組:Run 提供程式、資料與權重;Retrain 缺少權重,必須重新訓練;Reimplement 缺少程式,須從論文重建方法。每題固定目標指標、適用範圍與判定方式,GPU 預算最高為 96 個 H100 等效小時。代理看得到目標數值,但不會直接取得產生該數值的實驗配置,因此仍須閱讀論文並設計實驗。[任務規格](https://github.com/mithils3/reclaim#match-target-and-tolerance)
評分流程把代理的自我宣告與驗收分開。固定的 Claude Sonnet 5 審核模型閱讀執行證據及逐輪紀錄,給出零至十分,八分以上才算重現;嚴重的證據完整性問題會使分數歸零。公開紀錄保留工具命令、標準輸出與錯誤訊息,讀者可追查數值如何產生,也能查看審核理由。[紀錄檢視器](https://reclaim-traces.vercel.app/)
論文報告,DeepSeek-V4-Flash 在 Run 組成功 14/34 題,約 41%;在 Retrain 組為 9/33 題,約 27%。Reimplement 組最佳者則是 Muse Spark 1.2,成功 5/33 題,約 15%。由於三組包含不同論文,這些差距不能直接視為移除同一份程式或權重後的因果效果。[結果與方法](https://arxiv.org/html/2609.28850v1)
對研究工具開發者而言,工程上的啟示是讓驗收條件落到實際產物:目標值必須連回測量證據,實驗也須符合指定範圍。資料欄位記錄比較方向、容許誤差與證據所在檔案,讓另一位審查者重新核對判定;部分重現、無法驗證與失格也各有標記。儲存庫提供凍結的資料切分、提示、評分規則與執行工具,可作為改良代理流程的測試起點。[公開實作](https://github.com/mithils3/reclaim)
結果仍有明確邊界:各模型與論文組合至多測一次,且未納入 Claude、GPT、Gemini 作為受測代理;研究也沒有在同一叢集完成全面人工重現,因此無法把所有偏差都歸因於代理。後續應補上重複測試與人工基線,確認改善能否穩定轉化為可驗證的研究成果。[研究限制](https://arxiv.org/html/2609.28850v1#S6)