ホームへ戻る

代理系統

MANTA、推論中にマルチエージェント・トポロジーを再構成し、5つのベンチマークで平均5.8ポイント向上

MANTAはタスクに応じてエージェント通信グラフを構築し、実行トレースから協調上の異常を検出して、役割、接続、検証順序を限定的に書き換える。Gemma 4 31Bを用いたテストでは、5つのベンチマークにおける平均スコアが74.0に達したが、実験のサンプル数と反復回数は依然として少ない。

Cayambe · CC BY-SA 3.0 · Image source
zh-Hant

マルチエージェントシステムでは通常、役割と通信フローをデプロイ前に固定する。これに対し、新たに提案されたMANTAは、トポロジー自体を推論時の制御対象に組み込む。まずTopology Plannerが、問題とタスク横断型playbookに基づいてエージェント数、役割、グループ、情報の可視範囲を選択し、1ラウンドの協調処理を実行する。Trace Auditorは回答の正誤を直接判定するのではなく、ツール障害、未検証の証拠、早すぎる合意、分岐の過負荷、操作の重複といった観測可能な異常を検査する。リスクが十分に高い場合、コントローラーは、検証役の追加、接続の変更、実行順序の調整、分岐の拡張など、制約付きの再構成を1回だけ許可する。

この設計におけるエンジニアリング上の要点は、決定論的なプログラムによるトポロジーの検証、エージェント予算の制限、重複するツール呼び出しの排除、append-only ledgerによる証拠の保存にある。長期playbookが読み取るのはプロセスシグナルのみで、ベンチマークの正解にはアクセスしない。そのため理論上は、モデルの重みを更新せずに、タスクをまたいで組織的な経験を蓄積できる。

研究ではGemma 4 31Bを用い、BrowseComp、StableToolBench、PlanCraft、WorkBench、MATHからそれぞれ30問を抽出し、各実験を3回反復した。MANTAの平均スコアは74.0で、次点のADASの68.2を5.8ポイント上回った。一方、WorkBenchでは43.3にとどまり、ADASの66.7を下回った。アブレーション実験では、完全なシステムの4項目平均成功率は71.7%だったが、初期トポロジー計画を除去すると57.5%に、推論途中の再構成を無効にすると60.8%に低下した。これは、主な改善が単なるエージェント数の増加だけによるものではないことを示している。

制約も明確だ。完全なMANTAは1回あたり平均約10万tokenを使用しており、「マルチエージェント方式の中で最も低コスト」であっても、デプロイが安価であることを意味しない。評価問題数は多くなく、使用した基盤モデルも1種類に限られる。また、論文には公式リポジトリも付属していない。今後は、トポロジーに関する意思決定を異なるモデル、実際のツール障害、より長いワークフローでも再現できるか、さらにプロセス監査機構が誤判定した際に、本来は実行可能だった協調構造を損なわないかを検証する必要がある。

出典

  1. MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
  2. Plancraft:LLM 代理規劃評測