返回首頁

代理訓練

GRSD 對照代理自身成敗軌跡分配獎勵,ALFWorld 未見任務成功率達 83.6%

Group-Reflective Self-Distillation 不再從外部教師擷取固定技能,而是比較同一策略成功與失敗的 rollout,再把差異轉成逐回合訓練訊號。它在三種代理環境取得整體改善,但訓練時間較 GRPO 增加 17%,且仍須呼叫外部模型評分反思文字。

Rufus Sarsaparilla on wikipédia en · Public domain · Image source
zh-Hant

以可驗證獎勵訓練代理時,GRPO 等方法通常只知道整條軌跡最後成功或失敗。這種 terminal reward 無法指出哪一步真正推進任務,也會把偶然動作與關鍵決策綁在同一個 advantage。既有自我蒸餾方法會加入外部技能庫或由較強模型解析單條軌跡,但產生的建議可能超出目前策略能力,或過度貼合某一次路徑。

7 月 30 日提交的 Group-Reflective Self-Distillation(GRSD)改從策略自己的 on-policy rollout 建立指導。每道題產生八條軌跡,先由驗證器標示結果,再讓策略分別反思成功與失敗案例;一份停止梯度的策略快照比較兩組反思,合成群組層級的 privileged guidance。自我教師接著依該指導重估每個 turn,調整原本由結果決定的 advantage,但不反轉驗證器所判定的整體學習方向。反思 token 另有獨立損失,實際任務 token 與反思 token 因此接受不同監督。

研究以 Qwen3-1.7B、4B、8B 在 ALFWorld、七套搜尋問答資料及 WebShop 測試。相較各 backbone 上較強的 Skill-SD 或 SDAR,GRSD 的 ALFWorld 整體成功率平均提高 4.2 點,WebShop 成功率提高 5.5 點;在 ALFWorld unseen split 平均達 83.6%,較 GRPO 與 SDAR分別高 8.2、6.0 點。收益並非每個子任務都一致,但跨三種模型的彙總結果較穩定。

代價出現在訓練端:每個 prompt 要生成八份反思、一次群組摘要,並呼叫外部評審為反思打分。作者在八張 H100、Qwen3-1.7B 的 ALFWorld 實驗中量得每次更新 333.4 秒,GRPO 為 284.1 秒,相對成本為 1.17 倍。額外流程不進入部署推論,但程式碼與檢查點尚未公開;外部評審也意味著結果可能受到評分模型偏差影響。下一步應比較不使用外部 judge 的版本,以及在長軌跡、真實工具錯誤和不同 verifier 品質下是否仍能正確分配 credit。

來源

  1. Group-Reflective Self-Distillation 論文
  2. ALFWorld 官方實作與環境