返回首頁

多模態檢索

騰訊開放 WeMM-Embedding:2B 模型在多模態檢索評測超越部分 8B 基線

WeMM-Embedding 以同一向量空間處理文字、圖像、影片、視覺文件及交錯輸入,並提供 2B、4B、9B 三種尺寸。官方成績領先多個公開基線,但模型不支援音訊,部分產品效果也只能由騰訊內部 A/B 測試佐證。

N509FZ · CC BY-SA 4.0 · Image source
zh-Hant

騰訊微信視覺團隊於 8 月 25 日發布 WeMM-Embedding,將原本常需分開處理的文字、圖像、影片與掃描文件映射到同一向量空間。三款模型建立於 Qwen3.5,利用大型多模態對齊及精煉兩階段訓練;第二階段加入整理過的資料、細粒度相關性監督與跨尺寸知識轉移。模型從專用 `<embedding>` token 的最後一層狀態取值,再作 L2 正規化。

另一項實用設計是 Matryoshka 表徵。9B 完整輸出為 4,096 維,部署者亦可截短至 64、128、256 等指定維度,重新正規化後建立較小的向量索引。官方報告稱,2B 模型在 MMEB-v2 的 78 個資料集平均取得 77.9 分,高於 Qwen3-VL-Embedding 8B 的 77.8;9B 則達 80.6。2B 在 256 維時,圖像及影片項目仍保留完整維度成績的 98.7%,顯示儲存量與召回品質可在同一模型內調節。

程式碼已提供 Transformers、SentenceTransformers、vLLM 及 SGLang 路徑;官方為重現結果固定建議 `transformers==5.2.0`,並只列出 vLLM 0.27.0、SGLang 0.5.9 為已測版本。這對混合媒體 RAG、商品搜尋及文件代理有價值,因為工程團隊毋須維護多套互不相容的 embedding 空間。

不過,80.6 分屬作者自行執行的公開基準結果,尚待獨立重現;論文所述 14 組線上 A/B 測試及微信內部 26 任務基準也未公開。MMEB-v3 會把不支援的音訊任務記作零分,而模型載入範例使用 `trust_remote_code=True`,正式部署前仍應固定 revision、審核遠端程式碼並逐項驗證授權。

來源

  1. WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
  2. Tencent/WeMM-Embedding
  3. WeMM-Embedding-9B Model Card