ホームへ戻る

AI 代理研究

PILOT、監督エージェントがタスク実行中に進路を修正し、実行経験を永続スキルへリアルタイムで反映

PILOTは双方向チャネルでsupervisorとworkerエージェントを接続し、長時間タスクが完了する前でも、前者が指示を与えたり、誤った経路を中止したりできるようにする。著者らは3つのエージェント・ベンチマークで精度とtoken効率の向上を報告しているが、「自己改善」が更新するのはharness、スキル、メモリのみで、モデルのパラメータは変更しない。

Łukasz Golowanow, Maciej Hypś, Konflikty.pl · Attribution · Image source
zh-Hant

香港理工大学などの研究者らは、一般的な事後リフレクションをタスク実行中の閉ループ監督へと変えるPILOTを提案した。システムは独立したsupervisorとworkerで構成される。workerはツールの出力、試行錯誤の過程、実装の詳細を保持する一方、supervisorはより整理された目標中心の視点を維持し、進捗通知、質問、完了結果、実行エラー、アイドル状態のアラートを受け取る。supervisorはworkerの次のターンが始まる前にsteering指示を挿入でき、継続する価値がなくなった分岐を直接abortすることもできる。

もう一つの仕組みがlive self-evolutionである。supervisorが軌跡の中から再利用可能な手順、プロジェクトの慣例、繰り返し発生する失敗パターンを特定すると、それらを永続スキルストアまたはメモリへ即座に書き込める。その後、同じタスク内または将来のタスクで起動するworkerは、更新済みのharnessを読み込む。したがって、ここでいう「自己改善」はコンテキストと実行フレームワークの進化を意味する。モデルの重みは終始凍結されており、オンライン・ファインチューニングや再帰的トレーニングとは異なる。

研究では、GLM-5.1とKimi-K2.6にそれぞれ両方の役割を同時に担わせ、Terminal-Bench 2.0、SWE-bench Multilingual、SWE-bench Proで評価した。PILOTは6つのモデル–ベンチマーク構成のうち5つで首位となった。Terminal-Bench 2.0では、両モデルの平均合格率が71.6%に達し、最も強力な単一エージェントの平均ベースラインを5.3ポイント上回った。イテレーションをまたぐ自己改善設定では、著者らは両モデルでそれぞれ14.6ポイントと12.4ポイントの向上を報告しており、平均出力token数はそれぞれ42.9%と47.4%減少した。人手による分析でも、監督介入は困難なタスクに集中し、簡単なタスクの成功軌跡はsteeringに依存していなかったことが示された。

ただし、デュアルエージェント構成は追加の遅延と推論コストをもたらす。また、論文で検証されたのは2つのオープンウェイトモデルと3つのcoding/terminalベンチマークのみである。同一モデルが同一モデルを監督する構成では、「高価なsupervisorと安価なworker」の組み合わせに費用対効果があるかという疑問にも答えられていない。現在公開されている論文には、完全に再実行可能な実装も含まれていない。そのため、エンジニアリングチームは次の段階で、コストの内訳、誤った監督による負の転移、永続スキルが汚染された場合のロールバックおよび監査メカニズムに注目すべきだ。

出典

  1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
  2. PILOT in the Loop paper discussion
  3. PILOT technical analysis