ホームへ戻る

多模態模型與推論

Mage-VL、動画の符号化情報を直接利用して視覚トークンを選択、ストリーミング・マルチモーダル推論を最大3.5倍高速化

MicrosoftのMage-VLは、動画フレームを均等にサンプリングする代わりに、I/P frame、motion vector、residual energyを利用し、変化の大きい領域だけをエンコードする。4Bモデルでは、静的タスクの能力を維持しながら視覚トークンを75%以上削減できるとしているが、速度と品質の比較は依然として主に公式テストに基づく。

Coolcaesar · CC BY-SA 4.0 · Image source
zh-Hant

多くの動画言語モデルは、まずデコーダーで完全なフレームを復元し、固定頻度でサンプリングして視覚patchに分割する。このパイプラインでは、動画codecがすでに算出した時間的変化の情報が失われるうえ、ほとんど静止している背景を繰り返しエンコードすることになる。Microsoftが公開したMage-VLは、ストリーミング動画を「codec-native」方式で処理する。Mage-ViTは、疎に配置されたアンカーI-frameと予測P-frameを読み込み、motion vectorとresidual energyを利用して、どの16×16領域により多くの新しい情報が含まれているかを判定し、選択的に視覚トークンへ変換する。

論文によると、この手法は空間的・時間的コンテキストを維持しながら、視覚トークンを75%以上削減できる。Mage-ViTは、約5億6,000万枚のラベルなし画像と1億フレームのラベルなし動画データを用いて学習を開始した。完全なMage-VLはデュアルシステム・アーキテクチャで動作する。軽量なSystem 1イベントゲートがストリームを継続的に監視し、推論に値する変化を検出した場合にのみ、因果的なSystem 2デコーダーを起動する。これは、すべてのフレームを大規模言語モデルへ送る方式よりも、イベント駆動型のリアルタイムシステムに近い。

公式結果によれば、Mage-VL-4Bは静的ベンチマークでQwen3-VL-4Bに迫り、動画理解および2D・3D空間推論ではより高いスコアを記録した。エンドツーエンドのwall-clock推論は最大3.5倍高速化され、15BのPhi-4-reasoning-visionベースラインも上回った。チームはコード、約5Bパラメータのモデルweight、オンラインデモを公開している。GitHubプロジェクトは公開後すぐに1,000 starsを超え、このアーキテクチャを外部から初期検証できる環境が整いつつある。

エンジニアは今後、高速化の測定に動画デコード、tokenizer、メインモデルの全コストが含まれているかを確認し、異なるcodec、bitrate、カメラワーク、マルチストリーム環境で再評価する必要がある。motionとresidualに依存するセレクターは、動きが少なくても意味的に重要な細部を見落とす可能性もある。例えば、計器の数値がゆっくり変化する場合や、遠方にある小さな物体などだ。したがって、75%のトークン削減は、あらゆる監視、ロボティクス、リアルタイムアシスタントのユースケースで同じ圧縮率を安全に採用できることを直接意味するものではない。

出典

  1. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
  2. Microsoft Mage source repository
  3. Mage project page
  4. Mage-VL model card