返回首頁

檢索與推論

NVIDIA 發布 Nemotron 3 Embed,並提供 1B 模型的 NVFP4 檢查點

Nemotron 3 Embed 提供 8B、1B BF16 與 1B NVFP4 等文字嵌入模型。低精度版本把檢索模型的記憶體與吞吐效率納入第一級設計目標,但品質仍需在目標語料上驗證。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 在 7 月中旬公開 Nemotron 3 Embed 系列,其中包括 8B BF16、1B BF16,以及約十億參數的 NVFP4 檢查點。模型採雙向注意力遮罩,將 token 表徵平均池化為向量,並支援最長 32,768 token 的文字輸入。NVIDIA 同時提供 Hugging Face 權重、微調配方與 NeMo Retriever NIM 的部署支援,使模型可直接進入語意搜尋、RAG、重排序前召回及資料探勘管線。

NVFP4 的意義在於嵌入服務通常是高流量、低延遲工作負載;每次文件寫入、查詢或重新索引都可能呼叫模型。把權重壓到四位元可降低記憶體頻寬與服務成本,並提高單 GPU 併發量。不過,量化後的向量幾何若出現微小漂移,可能在最近鄰邊界造成召回差異,尤其對多語、短查詢、專有名詞及高度相似文件更敏感。排行榜平均分無法完整反映這些失敗模式。

採用者應同時比較 BF16 與 NVFP4 的 Recall@k、nDCG、索引建置速度、批次吞吐、P99 延遲與實際顯存占用,並固定向量正規化及 pooling 設定。由於新的 embedding 會改變向量分布,通常不能與舊索引混用,升級可能需要完整重算。NVIDIA 文件列出的硬體與 NIM 支援矩陣也顯示,最佳 NVFP4 kernel 並非在所有 GPU 上都等效;跨硬體部署前應確認是否會回退到較慢路徑。

來源

  1. Nemotron-3-Embed-1B-NVFP4 model card
  2. NeMo Retriever Embedding NIM support matrix