返回首頁

RAG/資訊檢索

LAMAR 重排器把查詢語言納入排序,修正多語 RAG 偏向語意而忽略語言一致性的問題

高麗大學團隊開放 6 億參數 LAMAR,讓多語搜尋在文件同樣相關時,優先保留與查詢相同語言的內容。模型在專門設計的語言一致性測試領先比較對象,但一般重排基準只達競爭水準,不能視為全面取代大型 reranker。

zh-Hant

多語 RAG 的第一階段通常會從不同語言取回相關文件,再由 cross-encoder 重排;問題是現有重排器主要判斷語意相關性,當中文、英文或其他語言文件表達相同資訊時,不一定優先選擇與查詢相同語言的版本。這會把翻譯需求、專有名詞差異與回答語言漂移傳到生成模型。

高麗大學 NLP & AI Lab 釋出的 LAMAR-600m,將排序目標拆成「相關性」與「語言一致性」。模型以 BGE-M3 RetroMAE 為起點,先使用 Qwen3-Reranker-4B 的分數做英文錨定知識蒸餾,使 51 種訓練語言的相關性尺度較一致;第二階段再加入偏好對齊,當候選文件語意相當時,提高查詢與文件語言一致的排序機率。模型採 MIT 授權、最大輸入長度 8,192 token,可直接透過 Sentence Transformers 或 Transformers 輸出單一 relevance logit。

在由 XQuAD 與 BELEBELE 平行文件建立的控制測試中,LAMAR 的 nDCG@1 分別為 96.89 與 94.66,高於受測的 0.3B 至 4B 重排器;但這項測試刻意把同一正確文件翻成多種語言,衡量的是能否把同語言版本排第一,而非一般搜尋的完整準確率。在 MIRACL、XGLUE、HUME、MLDR 與 Wikipedia 重排測試上,LAMAR 平均 nDCG@10 為 86.84,略低於 Qwen3-Reranker-4B 的 87.34。

工程團隊可把它視為多語檢索的可部署基線,尤其適合中文查詢經常混入英文文件的企業知識庫。不過,強制偏好同語言也可能壓低更完整或更新的跨語言來源;正式部署應把語言一致性設為可調訊號,並以最終答案正確率、引用覆蓋率和延遲共同評估。

來源

  1. LAMAR: An Open Language-Aware Multilingual Alignment Reranker
  2. nlpai-lab/LAMAR-600m model card