ホームへ戻る

AI 研究與代理訓練

PlanPhysが長期エージェント訓練を分解:疎な報酬下ではon-policy蒸留がGRPOより安定

PlanPhysは制御可能な合成環境を用い、事前学習、GRPO、単一教師蒸留、マルチ教師蒸留が長期計画能力をどのように形成するかを個別に検証した。実験では、少量の長い軌跡と明示的な状態遷移が汎化に有効である一方、教師の知識や計画パターンに互換性がない場合、蒸留が既存能力をかえって損なうことが示された。

Gennady Grachev from Moscow, Russia · CC BY 2.0 · Image source
zh-Hant

研究チームは、エージェントの長期計画能力を、追跡が困難なWeb事前学習データから切り離して研究するため、PlanPhysを発表した。その制御可能な環境は3つのドメインと、各ドメイン5段階の難易度で構成される。タスクでは、モデルがAND/OR合成ルールに従い、基本オブジェクトを段階的に組み合わせて目標を作ることが求められる。研究者は、軌跡の長さ、誤りの割合、計画知識、戦略パターンを独立して調整できる。学生モデルは12億tokenのコーパスで訓練され、関連するモデルの重みはApache 2.0ライセンスで公開されている。

事前学習の結果からは、個々のアトミックスキルを習得しただけでは、モデルが未見の長いプロセスを自力で組み立てられるとは限らないことが分かった。少量の長期的な例を追加して初めて、より優れた構成的汎化が現れた。また、モデルに状態遷移ルールを先に記述させてから行動を選択させる方式は、次のステップを直接予測させる方式を明確に上回った。最高難易度の設定では、内部世界モデルを用いるバージョンのavg@8とpass@8が、それぞれ45.8ポイントと42.9ポイント向上した。ただし、準最適な軌跡や誤りを含む軌跡では、長いシーケンスに沿ってミスが増幅されるため、短いタスクよりもデータ品質の影響を受けやすい。

後学習では、GRPOとon-policy distillation(OPD)を比較した。基盤モデルがすでに十分強力な場合、いずれも不要となる可能性がある。一方、タスクが長く、事前学習用の軌跡の品質が低い場合、教師がtokenレベルでより一貫した更新方向を提供できるOPDは、疎な終端報酬に依存するGRPOよりも有効領域が広かった。しかし、これは蒸留が常に優れていることを意味しない。教師が、学生には備わっておらず、かつ互換性のない手続き的知識を持つ場合、教師の成功率が100%であっても、学生は新しいプロセスを習得できないばかりか、既存の世界モデルまで損なう可能性がある。

マルチ教師OPDにも同様の限界が見られた。教師間で計画パターンが共有されている場合、学生は環境をまたいで汎化できたが、完全に衝突する場合、既存ドメインのスコアが90.00から15.62まで低下した例もあった。これらの結論は、制御された合成タスクと小規模な研究用モデルから得られたものであり、ブラウザエージェントやコーディングエージェントへ直接一般化することはできない。今後の焦点は、コード、データ、完全な訓練レシピが公開されるかどうか、そして同様の現象が、実環境のツールエラー、不完全な教師、異なるモデル規模でも再現されるかどうかである。

出典

  1. The Physics of Multi-Turn Long-Horizon Planning
  2. TianyiMen_PlanPhys_Models