返回首頁

代理訓練

AgentOPSD 以遞迴信念分配代理獎勵,Qwen2.5-7B 在 ALFWorld 達 89.1%

AgentOPSD 將教師與學生的機率差異累積成逐回合信念更新,用來辨識真正左右任務成敗的決策。作者報告它在三類代理環境優於 GRPO 與多種自我蒸餾基線,但公開儲存庫目前仍未提供訓練程式。

Rufus Sarsaparilla on wikipédia en · Public domain · Image source
zh-Hant

長時程代理通常只在任務結束時取得成功或失敗訊號。GRPO 等方法會把軌跡層級的 advantage 廣播至所有回合,因而可能同時獎勵關鍵操作、無關步驟甚至補救前的錯誤。AgentOPSD 嘗試把這個 credit assignment 問題改寫成遞迴的信念更新,而不另訓練 critic。

訓練時,系統先計算具額外技能資訊的「教師」與原代理在各 token 上的 log-probability 差,再聚合成回合證據。這些證據以 log-odds 形式更新「軌跡最終成功」的貝葉斯信念;相鄰回合造成的信念修正量,經最終驗證結果校正正負方向後,用來重塑原本的 advantage。方法不增加 rollout,也不引入獨立蒸餾損失,訊號只透過修改後的 policy objective 生效。

作者以 Qwen2.5-3B、7B 在 ALFWorld、WebShop 及七套 Search-QA 資料上測試。7B 版本在 ALFWorld 平均成功率為 89.1%,高於同一實驗中的 GRPO 及多種自我蒸餾基線;每增加一個互動回合,成功率的迴歸降幅為 0.54 點,GRPO 與 RLSD 分別為 2.91、3.59 點。消融實驗把遞迴修正換成孤立的局部差異後,成功率由 89.1% 降至 82.8%,移除結果方向或初始成功率先驗則降至 80.5% 與 78.9%。

這項設計對訓練搜尋、瀏覽及具身代理特別有意義:終局驗證器仍可維持簡單,訓練端則不必假設每一步同等重要。不過,實驗只涵蓋兩種 Qwen2.5 規模與模擬環境,教師訊號也依賴訓練時的特權技能;更重要的是,GitHub 儲存庫目前只有說明文件並標示程式「即將公開」。在完整程式、資料處理與多次獨立重跑出現前,89.1% 應視為作者報告結果,而非已完成外部重現的紀錄。

來源

  1. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
  2. AgentOPSD official repository