返回首頁

AI 研究與代理訓練

PlanPhys 拆解長程代理訓練:稀疏獎勵下,on-policy 蒸餾比 GRPO 更穩定

PlanPhys 以可控制的合成環境,分別檢驗預訓練、GRPO、單教師及多教師蒸餾如何形成長程規劃能力。實驗指出少量長軌跡與顯式狀態轉移有助泛化,但教師知識或規劃模式不相容時,蒸餾反而會破壞既有能力。

Gennady Grachev from Moscow, Russia · CC BY 2.0 · Image source
zh-Hant

研究團隊發表 PlanPhys,試圖把代理的長程規劃能力從難以追溯的網路預訓練資料中拆開研究。其可控制環境涵蓋三個領域、每領域五個難度層級,任務要求模型依 AND/OR 合成規則,把基礎物件逐步組成目標;研究者可獨立調整軌跡長度、錯誤比例、規劃知識與策略模式。學生模型使用 12 億 token 語料訓練,相關模型權重則以 Apache 2.0 授權公開。

預訓練結果顯示,只學會個別原子技能,不代表模型能自行組合出未見過的長流程;加入少量長程範例後才出現較好的組合泛化。要求模型先描述狀態轉移規則、再選擇動作,也明顯優於直接預測下一步:在最高難度設定,內部世界模型版本的 avg@8 與 pass@8 分別提升 45.8 與 42.9 個百分點。不過,次佳或帶錯誤的軌跡會沿長序列放大失誤,資料品質因而比短任務更敏感。

後訓練部分比較 GRPO 與 on-policy distillation(OPD)。當基礎模型已足夠強時,兩者可能沒有必要;當任務較長、預訓練軌跡品質較差時,OPD 因教師能提供較一致的 token 級更新方向,有效區域比依賴稀疏終局獎勵的 GRPO 更廣。但這不等於蒸餾總是較好:若教師掌握學生未具備且不相容的程序知識,即使教師成功率為 100%,學生仍可能既學不會新流程,又損傷原有世界模型。

多教師 OPD 也呈現類似邊界。教師共享規劃模式時,學生可跨環境泛化;完全衝突時,舊領域分數曾從 90.00 跌至 15.62。這些結論來自受控合成任務與小型研究模型,尚不能直接外推至瀏覽器或程式代理。後續值得觀察的是程式碼、資料與完整訓練配方是否公開,以及相同現象能否在真實工具錯誤、非理想教師及不同模型規模下重現。

來源

  1. The Physics of Multi-Turn Long-Horizon Planning
  2. TianyiMen_PlanPhys_Models