多模態檢索
NeoMME 以單一雙向 Transformer 編碼圖文,將視覺文件索引壓縮至每頁 6 kB
Hcompany 開源 2.6 億與 8 億參數的 NeoMME,讓文字 token 和原始影像 patch 共用同一個編碼器,不再附掛視覺塔或因果解碼器。其檢索版本同時輸出 dense 與 late-interaction 表徵,但效率與準確率數字目前主要來自作者評測。

Hcompany 釋出 NeoMME-260M 與 NeoMME-800M,以及針對視覺文件搜尋微調的 Retriever 版本。它不是把 SigLIP 一類視覺塔接到生成式語言模型,而是將文字 token 與原始影像切成的 32×32 patch,經各自投影後送入同一個雙向 Transformer。兩種尺寸均支援 16,384 token;多數層使用對稱滑動視窗注意力,每六層及最後一層配置全域注意力,以控制高解析頁面的計算量。
預訓練也不同於一般自回歸 VLM。模型從頭訓練,使用 masked discrete-diffusion 文字目標:文件影像的 patch 保持可見,模型在影像條件下恢復被遮蔽的文字,沒有像素重建損失。因此它輸出的是上下文化表徵,而非直接產生答案;基礎權重仍須接上檢索、分類或資訊擷取任務頭。
NeoMME-Retriever 在一次前向傳遞中同時產生單向量 dense embedding,以及保留 token/patch 粒度的 late-interaction embedding。後者通常能保存版面細節,卻會造成龐大索引。團隊結合階層式 token pooling 與非對稱量化,把 NeoMME-260M 在 ViDoRe v3 的每頁表徵由約 1.5 MB 壓至 6 kB,即縮小 255 倍,同時保留超過 95% 的原始 nDCG@10。
作者報告 260M 與 800M 版本在 ViDoRe v3 分別取得 0.523、0.556 nDCG@10;260M 在 NVIDIA L40S、2048×2048 輸入下每秒編碼 51.3 頁,是 ColModernVBERT 的 1.97 倍。這對中文 PDF RAG 的意義不只是更小模型:若直接以頁面影像建立索引,表格、欄位與掃描版面可在 OCR 之前參與搜尋,而 6 kB 級表徵也使大量文件的 late-interaction 索引較可部署。
所有檢查點採 Apache 2.0,並已接入 Transformers 與 Sentence Transformers。不過比較模型的部分分數取自 MTEB,NeoMME 則由作者自行執行;速度也只展示單一 GPU 與解析度。模型卡明載尚未完成全面安全、偏誤與隱私評估,基礎模型不能直接當成生成式助手。下一步應關注第三方重跑、繁體中文掃描文件、不同解析度,以及壓縮索引在真實混合語言資料上的召回率。