多模態推論
ReMo 跨音訊與文字重分配視覺資訊,Omni-LLM 輸入 token 減少 54%
KAIST 團隊提出免訓練的 ReMo,在輸入端移除可由音訊解釋的畫面 token,並以文字代理保留物件語義。作者自測在 Qwen Omni 系列壓縮逾半輸入且未降低平均分數,但程式與獨立重現結果尚未公開。

KAIST 與牛津大學研究人員提出 ReMo,嘗試處理 Omni-LLM 同時讀取影片、音訊與文字時的序列膨脹問題。這類模型的輸入可達數萬 token,其中視覺串流占大多數;序列拉長後,attention 的計算與記憶體成本會迅速成為推論瓶頸。ReMo 不修改模型權重,而是在進入語言模型前重新分配跨模態資訊。
方法包含兩條路徑。首先,系統把音訊與視覺 embedding 投影至共同空間,若某段畫面的高階語義已由聲音表達,例如演奏中的小提琴,便刪除對應視覺 token。其次,對無法由音訊涵蓋的物件,ReMo 使用 3.4M 參數的 YOLOv8n-seg 偵測器,將物件名稱與位置改寫成較短的文字代理;局部細節及無法替代的視覺資訊則繼續保留。共同空間以 VGGSound 的 5,000 組音訊—影像 embedding 離線建立,因而雖稱「免訓練」,仍需額外的資料校準、偵測器與前處理。
作者在 Qwen2.5-Omni 3B、7B 上報告平均壓縮 54% 輸入 token,五項評測的正規化平均分數分別達完整輸入的 101.2% 與 101.3%。在單張 RTX A6000 上,3B 推論時間由 7.35 秒降至 4.78 秒,7B 則由 10.30 秒降至 5.92 秒;30B Qwen3-Omni 測試也維持相似趨勢。對影片客服、會議理解及長影音搜尋而言,這顯示跨模態重複資訊可在模型外先行消除。不過分數略升可能來自刪除雜訊,不能解讀為普遍提升;現有實驗集中於 Qwen Omni、固定基準與單一硬體,且尚無公開程式,因此跨模型、串流輸入及真實延遲收益仍待驗證。