多模態模型與推論
Mage-VL 直接利用影片編碼資訊選取視覺 token,串流多模態推論最高加速 3.5 倍
微軟的 Mage-VL 不再均勻抽取影片影格,而是利用 I/P frame、運動向量與殘差能量,只編碼變化較大的區域。4B 模型宣稱可減少逾 75% 視覺 token 並維持靜態任務能力,但速度與品質比較仍主要來自官方測試。

多數影片語言模型先由解碼器還原完整影格,再依固定頻率抽樣並切成視覺 patch。這條管線既丟掉影片 codec 已計算好的時間變化資訊,也會反覆編碼幾乎靜止的背景。微軟公開的 Mage-VL 改以「codec-native」方式處理串流影片:Mage-ViT 讀取稀疏的錨點 I-frame 與預測 P-frame,利用運動向量和殘差能量判斷哪些 16×16 區域包含較多新資訊,再選擇性轉成視覺 token。
論文稱這套方法可削減逾 75% 視覺 token,同時保留空間與時間脈絡。Mage-ViT 從約 5.6 億張未標註圖片及 1 億個未標註影片影格開始訓練;完整 Mage-VL 則以雙系統架構運作:輕量的 System 1 事件閘門持續監看串流,只有偵測到值得推理的變化時,才喚起因果式 System 2 解碼器。這與把每一幀都送入大型語言模型相比,更接近事件驅動的即時系統。
官方結果顯示,Mage-VL-4B 在靜態評測可接近 Qwen3-VL-4B,在影片理解及二、三維空間推理上取得較高成績,端到端壁鐘推論最高加速 3.5 倍,並超過 15B 的 Phi-4-reasoning-vision 基線。團隊已公開程式碼、約 5B 參數的模型權重與線上示範,GitHub 專案在發布後迅速累積逾千顆星,使架構具備初步外部檢驗條件。
工程師接下來應檢查加速是否包含影片解碼、tokenizer 與主模型全部成本,並在不同 codec、位元率、鏡頭運動和多路串流下重測。依賴運動與殘差的選擇器也可能漏掉低動態但語意關鍵的細節,例如儀表數字緩慢變化或遠處小物體;因此 75% token 節省不能直接等同於所有監控、機器人或即時助理場景都能安全採用相同壓縮率。