返回首頁

AI 代理與研究自動化

Faraday 以 27B 外層代理調度 GPT-5.5,論文圖表重現評測勝過單獨前沿模型

Inherent 公開以長程強化學習訓練的 Faraday,讓 27B 模型負責研究決策,再把程式工作交給 GPT-5.5。它在 Replica 保留題勝過 Claude Opus 4.8 與 GPT-5.5,但結果不能解讀為 27B 模型獨力超越前沿模型。

aphrodite-in-nyc · CC BY 2.0 · Image source
zh-Hant

Inherent 近日正式介紹 Faraday:它不是取代大型編碼模型,而是在其上增加一個經研究任務後訓練的「科學家」代理。團隊以 Qwen3.6-27B 為底座,使用 LoRA、128K 上下文及改造版 GRPO 訓練;Faraday 負責提出假設、安排實驗和判斷下一步,實際撰寫及執行程式則呼叫 Codex GPT-5.5。

配套的 Replica 包含從 100 篇機器學習及 AI for Science 論文建立的 310 個圖表重現任務。代理只能看到移除目標圖表的論文,須在 containerd 容器、一小時及七分之一張 H200 MIG 的限制下重建結果。Claude Opus 4.7 先為每題產生 rubric,再由多個 Codex judge 樣本檢查輸出圖、程式碼和執行軌跡;逐回合 credit assignment 用於避免長軌跡 GRPO 訓練崩潰。

在相同時間與 GPU 預算、每題八次 rollout 的比較中,Faraday 在 73% 同分布任務及 60% 未見 AI-for-science 任務上同時勝過 Claude Opus 4.8 和 GPT-5.5,測試集平均分別高 6% 和 8%。這個結果的重要性在於:研究判斷可被訓練成一層可調度更強工具的控制策略,模型尺寸未必需要與工具模型相當。

限制同樣明顯。評分器、rubric 生成器和程式工具都依賴閉源前沿模型;人工研究只驗證部分由自動評分器判定 Faraday 佔優的軌跡。Replica 亦集中於重現既有圖表,尚未證明代理能可靠發現不可重現結果或完成開放式科研。工程團隊下一步應留意任務與權重是否公開,以及換用其他編碼代理後能否保持增益。

來源

  1. Training AI Scientists to Replicate Research
  2. Inherent says its AI teammate outperformed Anthropic and OpenAI at replicating research