ホームへ戻る

模型合併與多模態代理

AgentPatch、学習不要でマルチモーダルエージェントのマージを修復――6ベンチマークの平均スコアが54.5から56.6へ

AgentPatchは、モデルのマージ後に生じた弱点を特定し、エキスパートモデル固有の残差と重要なFFNニューロンのみを復元する。出力は単一の静的checkpointで、ルーティングや推論時のエージェントを必要としないが、完全な評価adapterとモデルweightsはまだ公開されていない。

The Wolverine · CC BY 3.0 · Image source
zh-Hant

検索、GUI操作、視覚推論の各エキスパートを1つの汎用マルチモーダルエージェントに統合する作業は、通常、weightsを単純に平均するだけでは実現できない。インタラクションチェーンが長い能力ほど希薄化しやすく、成否を左右する少数のアクションが失われると、軌跡全体が失敗してしまう。8月7日に公開されたAgentPatchは、この問題を「弱いタスクのシグナル喪失」と「重要な挙動の忘却」に分解し、勾配学習を必要としない2段階の修復プロセスを提案している。

システムはまず、既存の複数のマージ結果を比較して、比較的安定したrecipient checkpointを選択し、その最も弱いタスクを特定する。続いてWeak-Task Unique Residual Recoveryが、弱いタスクのエキスパートに固有で、ほかのエキスパートにはないパラメータ更新を見つけ、その残差部分だけをrecipientへ戻す。第2段階のDiagnoser–Guardian–Compilerプロセスでは、recipientとエキスパートのエージェント軌跡から、復元すべき挙動断片と保護すべき挙動断片を抽出し、activation値と出力への寄与に基づいてFFNニューロンを特定する。Guardianは既存の強みを支えるニューロンを除外し、ある能力の修復によって別の能力が損なわれるリスクを低減する。

著者らは、MMSearch、FactualVQA、AndroidWorld、OSWorld、V*Bench、HR-Bench 8Kの6つのベンチマークを用いて、検索、デスクトップ/モバイル操作、視覚処理を評価した。論文とrepositoryによると、AgentPatchはTSVM recipientの総合平均スコアを54.5から56.6へ引き上げ、ほかのマージbackboneにも適用できる。デプロイ時には引き続き単一の静的checkpointとして動作し、エキスパートルーティング、ensemble、追加の分析エージェントを必要としないため、同種の推論分岐コストは増加しない。

ただし、現在GitHubで公開されているのは、主要な修復operator、設定例、入力contract、CPUテストのみである。完全なcheckpoint構築pipeline、benchmark adapters、軌跡、モデルweights、直接再実行可能な評価コマンドは、いずれも今後公開予定とされている。エンジニアリングチームは現時点で、これを完全に再現可能なモデルリリースではなく、検証可能なアルゴリズムの骨格として扱うべきだ。今後は、全アセットの公開後も、平均2.1ポイントの改善が異なるエキスパート構成やrandom seedで維持されるかを見極める必要がある。

出典

  1. AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models
  2. ziboshao/AgentPatch