ホームへ戻る

多代理系統

StateBridge、閉形式の回転アライメントでエージェントの隠れ状態を整合し、訓練なしでテキスト通信のボトルネックを回避

StateBridgeは、送信側エージェントの最終層のhidden stateを受信側のembedding空間に整合させ、連続的なprefixとして直接注入する。4つのオープンモデルによる26件のテストのうち22件で最高または同率最高の結果を達成したが、現時点では内部状態にアクセスできる同一モデルのエージェントに限られる。

Clayton B. Fraser · Public domain · Image source
zh-Hant

マルチエージェントシステムでは通常、計画、批評、修正の結果をテキストとして書き出し、次のエージェントに渡す。しかし、tokenとしてサンプリングする際、送信側のhidden stateに含まれる確信度や代替経路も圧縮によって失われる。StateBridgeは代わりに、メッセージ末尾64 tokenの最終層のhidden stateを抽出して点群として扱い、中心化、白色化、直交Procrustesアライメントを通じて、角度と距離を保持する閉形式の回転を求める。続いてベクトルのノルムを再較正し、各ベクトルを最も近い語彙embeddingの方向へわずかに寄せたうえで、連続的なprefixとして受信側エージェントの入力前に追加する。このプロセスではモデルの重みを一切更新しない。[論文](https://arxiv.org/abs/2608.13317)は[COLM 2026](https://colmweb.org/AcceptedPapers.html)に採択されており、実装も[GitHub](https://github.com/YanwenPneg/StateBridge)で公開されている。

著者らは、Planner、Critic、Refiner、Judgerの4エージェントからなるパイプラインを用い、Qwen3 4B、8B、32BおよびOLMo3-7B-Thinkを対象に、数学、質問応答、コード生成のタスクで評価した。StateBridgeは26件のモデル–タスク組み合わせのうち22件で最高または同率最高となり、各モデルの平均では最強のベースラインを2.4~2.9ポイント上回った。顕著な例として、Qwen3-8BのGPQAは最強ベースラインの45.5%から52.5%へ、AIME24は56.7%から63.3%へ向上した。Qwen3-32BのGPQAも58.3%から64.1%へ上昇した。層をまたいでKV cacheを移送する手法と異なり、StateBridgeは入力embeddingインターフェースのみを操作するため、OLMoへのアーキテクチャ変更後も同程度の性能崩壊は生じなかった。

制約も明確だ。実験ではエージェントが同一のモデル重みを共有しており、異なるモデルファミリー間でlatent表現を直接伝送できることはまだ実証されていない。また、この手法ではforward hookを使ってhidden stateを取得する必要があるため、クローズドAPIでは基本的に利用できない。アライメントには約O(d³)の分解処理とO(KVd)の語彙探索も含まれるが、本番環境でのスループットやマシン間転送は検証されていない。一部のGSM8K構成では、出力形式などの問題によりテキストベースラインを下回った。エンジニアリング上の注目点は、連続表現によるメッセージが量子化、tensor parallelism、異種モデルをまたいでも意味を保持できるか、そして人間が読めないエージェント間通信がデバッグ、監査、セキュリティ監視をより困難にしないかという点だ。

出典

  1. StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems
  2. StateBridge source code
  3. COLM 2026 Accepted Papers