返回首頁

多模態推論

ReToken 用單一可學習 token 篩選視覺 KV cache,長影片問答提高 8.0 點

ReToken 不把所有影像 token 一次送入模型,而是從預先填入的視覺 KV cache 中取回與問題相關的稀疏區塊。其凍結骨幹、只訓練檢索 token 的做法可在單張 H100 上完成,但成果仍主要來自兩款 8B 模型。

Leicestershire County Council, Wendy Scott, 2011-05-06 14:29:32 · CC BY-SA 4.0 · Image source
zh-Hant

ReToken 針對長影片與大量圖片輸入的核心瓶頸提出一個很小的改動:在視覺語言模型中加入單一可學習 embedding,把它訓練成明確的檢索目標。影片或圖片集合先編碼成可持續使用的視覺 KV cache;收到問題後,ReToken 從快取挑出少量相關 token 區塊,再交由凍結的語言模型解碼,不必讓完整視覺上下文反覆進入注意力計算。

作者指出,標準 attention 權重未必是可靠的畫面檢索訊號,因為相關資訊可能存在 value space。ReToken 因此利用學習後的 token 讀取該訊號,並以跨層 voting 選擇區塊。這種設計也讓同一段影片面對多個問題時只需編碼一次,每個新問題主要支付檢索與解碼成本。

在 Visual Haystacks 上,ReToken 令 Qwen3-VL-8B 提高 13.4 點、InternVL3.5-8B 提高 12.4 點,兩者相對增幅均超過 20%;只用小型 image-QA 資料訓練後,方法也零樣本轉移至長影片,在 LVBench 令 Qwen3-VL-8B 提高 8.0 點。骨幹保持凍結,訓練與長影片推論均可放入單張 H100。

程式碼、MIT 授權實作與兩個 Hugging Face 檢查點已公開,並固定 PyTorch、CUDA、FlashAttention 和 Transformers 版本;這有利重現,也暴露目前相依套件相當脆弱。工程團隊接下來應關注端到端首答延遲、KV cache 容量、不同取回數量下的準確率,以及在更大或不同架構 VLM 上是否仍能轉移。現有數字不能直接證明它在開放式影片理解或即時串流中同樣有效。

來源

  1. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
  2. avaxiao/ReToken