ホームへ戻る

代理執行期與推論系統

Speculative Macro Commit:エージェントのツールチェーンを先行実行し、AppWorldの実時間を44.9%短縮

新たな研究では、小型のドラフトモデルが隔離された環境スナップショット内で複数ステップのツール操作を先行実行し、大型の権威モデルが最初のステップを確認した後、一連の結果をまとめてコミットする。2つのエージェントベンチマークでレイテンシを削減した一方、3基のGPUを必要とし、AppWorldのタスク完了率は41.67%から40.48%に低下した。

Copyleft · CC0 · Image source
zh-Hant

ツール利用型エージェントのレイテンシは、モデルによるtoken生成だけでなく、「判断、ツール呼び出し、観測結果の待機、再判断」という逐次的な依存関係からも生じる。Speculative Macro Commit(SMC)は、speculative decodingの概念をエージェントの実行段階へ移したものだ。大型のactorが正式な意思決定権を保持し、小型のdrafterは隔離された環境スナップショット上で将来のアクションチェーンを予測して実行する。

システムはまず、成功した訓練軌跡から繰り返し現れる複数ステップのツール操作の骨格を抽出する。タスク固有のユーザーID、ドキュメントID、タイムスタンプなどをslotに置き換え、macro libraryを構築する。実行時にactorの次のツール呼び出しがドラフトチェーンの最初のステップと一致すると、システムはパラメータ、状態、最小深度を検証したうえで、すでに実行済みの後続ステップとその観測結果を正式な軌跡へまとめて書き込める。actorには追加のmacroツールが提示されないため、新たなアクションインターフェースを学習し直す必要はない。

研究では、INT4のQwen3.5-27Bをactor、Qwen3.5-4Bをdrafterとして使用した。τ²-Bench Telecomの2,285件の結果では、SMCと逐次ベースラインはいずれも99.52%の精度を達成し、1件当たりの平均レイテンシは27.60秒から22.47秒へ短縮された。単一ステップのみを再利用するSpeculative Actionsと比べても10.23%高速だった。AppWorldの平均実行時間は355.7秒から195.9秒へ短縮された一方、目標を完了したタスク数は70/168から68/168へ減少した。

実用化には、依然としてコストと安全性の境界が制約となる。逐次ベースラインが使用するGPUは1基のみだが、2種類の投機的構成では、actor、投機リクエスト用レプリカ、drafterに合計3基のGPUを使用する。このため、wall-clock timeの短縮が総計算コストの削減を意味するわけではない。macroマッチング自体のフィルタリング前precisionはわずか34.6%だった。完全なルールセットは、100件のholdoutタスクにおいて実際にコミットされた全イベントの結果を維持したものの、これは一般的な安全性の証明ではない。今後は、コーディングエージェント、不可逆な副作用を伴うAPI、異なるモデル構成、同一のハードウェア予算という条件で再現性を検証し、誤ったコミット、rollback、スナップショット作成のコストも測定する必要がある。

出典

  1. Speculative Macro Commit for Faster Tool-Using Agents
  2. The Gradient — 2026-09-05