返回首頁

模型評測

TriviaRoomQA 測試六語言日常知識,30 個開放模型在流行文化與新聞題出現系統性缺口

新基準以 3,300 道六語言平行題及 5,340 道法文題,檢查模型能否跨語言取用相同的日常與長尾知識。較大模型整體更準,卻仍無法消除流行文化、近期事件及語言切換造成的落差。

Rama · CC BY-SA 2.0 fr · Image source
zh-Hant

INRIA Paris 研究者提出 TriviaRoomQA,用真人編寫的益智問答檢查開放權重模型在日常、文化及長尾知識上的表現。資料包含 3,300 道平行選擇題,每題都有英文、法文、義大利文、西班牙文、德文與荷蘭文版本;另有 5,340 道法文題。完整集合涵蓋 288 個主題、24 個大類、三種難度,以及時間和地理標記,比只給總分的學術考試基準更適合定位知識缺口。

研究以答案候選的對數似然評測 30 個、規模介於 7B 至 70B 的歐洲、亞洲與北美模型。模型在歷史、地理、數學及其他百科型題目較強,卻明顯落後於名人、音樂、電影和新聞等日常文化題。小於 20B 的模型準確率介於 0.35 至 0.64,較大模型介於 0.41 至 0.72;增加參數雖提高平均成績,仍沒有消除跨語言不一致。研究亦發現,真人通常會隨題目難度逐步失分,模型在陌生主題上則可能從入門到專家題都接近低檔,顯示問題更像整個知識區域缺失,而非推理深度不足。

這對多語 RAG、在地搜尋和區域客服尤其重要:英文評測過關不能證明模型以中文或其他語言提問時能取回同一事實。工程上可把平行題差值用於檢查 tokenizer、訓練語料、檢索索引及提示語言造成的偏差。不過基準只測選擇題與開放權重模型,且六語言集合限於歐洲語言,不能直接外推到中文生成、工具代理或閉源前沿模型。下一步應加入中文等非拉丁文字語言,並比較純參數記憶、RAG 與即時搜尋是否真正縮小差距。

來源

  1. When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs
  2. When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs — review