返回首頁

AI 代理/自動化研究

1,338 條後訓練軌跡顯示,AI 代理僅 2.1% 相鄰實驗改變策略

研究發現,代理雖能自行訓練、除錯及評估模型,卻會在首次參數更新前鎖定訓練策略。加入實驗日誌、技能庫與評估代理可提高下游分數,仍未促使系統在證據不利時改換方法。

shankar s. from Dubai, united arab emirates · CC BY 2.0 · Image source
zh-Hant

一項新研究把 AI 自動後訓練拆成兩種能力:在既定方案內調整資料、學習率與輸出格式的「執行能力」,以及根據實驗證據改換 SFT、PEFT、RL 或多階段流程的「策略能力」。研究者分析 [PostTrainBench 公開的 1,338 條完整軌跡](https://posttrainbench.com/),涵蓋七項評測、四款 1.7B 至 4B 基礎模型及五種代理介面;每次原始執行可使用一張 H100、最長十小時。

結果顯示,代理平均每條軌跡啟動 3.82 次訓練及 13.8 次評估,整體分數亦由基礎模型的 10.41% 提高至 23.0%,證明它們確實可以組裝資料、修正程式及交付 checkpoint。然而在 3,557 組相鄰訓練實驗中,只有 74 組、即 2.1% 改變訓練範式、資料來源類型或階段結構。Claude Code 軌跡有 80.7% 從完整參數 SFT 起步;Codex CLI 則有 89.6% 選擇 PEFT,顯示策略更像由代理預設偏好決定,而非由任務決定。[論文](https://arxiv.org/abs/2608.19072)於 8 月 19 日公開。

團隊另以實驗日誌、後訓練技能庫及獨立評估代理強化 Claude Code。在固定 Qwen3-1.7B-Base、三次重跑及每次四張 A800、十小時的條件下,GSM8K 較自主基線增加 12.6 點,HumanEval 增加 40.8 點;但主代理即使收到改用 RL 或加入 SFT 暖身的建議,仍只採納獎勵塑形、格式與超參數等局部修改。增加二至八倍推論 token 對較簡單任務有幫助,對 AIME 2025 幾乎沒有收益。

這不等於頻繁換策略必然較佳:切換本身耗費算力,而 AIME 僅有 30 題,細小分差亦落在變異範圍。工程團隊更值得加入明確的策略檢查點、替代假設與剩餘預算重分配規則,並分開量測「把方案做完」及「知道何時放棄方案」。下一步要看的是這種鎖定能否在不同硬體預算、模型規模及非後訓練研究任務中重現。

來源

  1. What is Missing from AI Post-Training AI: An Empirical Analysis
  2. PostTrainBench leaderboard and public trajectories
  3. PostTrainBench source repository