多模態檢索與 RAG
騰訊 EVIE 以可截斷多向量與 token 聚類,壓低視覺文件檢索索引成本
騰訊發布 EVIE-8B 與 EVIE-4.5B,直接以頁面影像建立逐 token 表徵,避免先做 OCR 再檢索。4.5B 版可在執行期調整向量維度並將每頁壓至 32 個向量,但領先成績目前仍主要來自團隊自己的評測。

騰訊在 Hugging Face 發布 EVIE-8B、EVIE-4.5B 權重,並公開推論、訓練及 138 項評測流程。這套視覺文件檢索器不先把 PDF、表格或掃描頁轉成純文字,而是以 Qwen3.5 視覺語言骨幹產生逐 token 多向量,再用 MaxSim 比對文字查詢與頁面中的局部圖像表徵;對字體、版面、圖表和表格位置敏感的 RAG,因而不必把所有資訊壓進單一 dense embedding。
8.41B 參數的 EVIE-8B 使用 4096 維表徵,主要充當高容量教師。較適合部署的 EVIE-4.5B 則以 Prefix-MRL 訓練單一 2048 維投影,執行時可截斷成 64、128、256、512、1024 或 2048 維,不必保存多組檢查點。另一個無需再訓練的 HAC 流程,會依特徵與空間距離聚合視覺 token;官方範例把約 750 個向量壓成每頁 32 個,估算一百萬頁的 BF16 原始索引可降至 3.81 GiB。工程團隊仍須把向量資料庫的結構、MaxSim 計算及召回品質一起測量,不能只比較模型檔大小。
騰訊報告 EVIE-8B 與 4.5B 在 ViDoRe V3 分別取得 66.75、66.02 nDCG@10。不過這些數字由發布者用自帶流程產生,正式論文與架構消融尚未公布;模型卡自己的表格也顯示 EVIE-8B 在 ViDoRe V1 並非第一。8B 檢查點還是兩條訓練分支的權重混合結果。下一步應觀察第三方能否重現成績,以及 HAC 在中文財報、低解析掃描件與大規模近似向量索引下是否仍能維持召回率。