返回首頁

評測與 RAG

FinMMEval 公布多語金融 QA 隱藏測試:選擇題近滿分,短答題首名僅 31.18%

CLEF 2026 的 FinMMEval 公開兩項多語金融問答結果,顯示模型在封閉選項上可達 92% 至 97.5%,面對跨語證據的短答生成卻明顯失速。短答榜前四名差距不到一個百分點,也暴露 ROUGE 排名難以區分事實正確性。

Manchesterunited1234 · CC BY-SA 4.0 · Image source
zh-Hant

FinMMEval 2026 在 7 月 22 日公開 Task 1 與 Task 2 技術報告及最終榜單,提供一組頗具對照性的金融 AI 壓力測試。Task 1 是英文、中文、阿拉伯文與印地文的金融選擇題,每種語言各有 200 題隱藏測試;領先準確率介於印地文的 92% 與英文、阿拉伯文的 97.5%。參賽系統使用搜尋或 FAISS 檢索、語言路由、直接選項評分、自洽抽樣、信心檢查及多模型覆核等組合。

Task 2 把問題改為英文,證據則散布於英文、中文、日文、西班牙文及希臘文的財報與新聞。256 題隱藏測試要求輸出精簡答案,第一名 Calibrated Signals 的 macro ROUGE-1 F1 只有 31.18%,前四名僅差 0.79 個百分點。參賽架構從固定提示、BM25 和版面感知切塊,到 LangGraph、Weaviate、重排序、Python 數值工具與 judging agent 都有,卻沒有形成壓倒性的共同方案。

兩項結果的落差值得工程團隊注意。選擇題把答案空間限制為標籤,輸出驗證和直接選項打分便能消除大量格式錯誤;短答題還要完成跨語檢索、時間與實體對齊、財務計算及答案壓縮,任一階段失真都會傳遞到最後文字。這也解釋了為何較複雜的 agentic RAG 不必然勝過確定性提示與一次受限重試。

但 31.18% 不能直接解讀為事實正確率。ROUGE-1 衡量與單一參考答案的詞彙重疊,可能懲罰正確同義表達,也可能獎勵包含關鍵詞但推論錯誤的答案。後續更需要證據引用、數值容差、實體與日期一致性,以及人工或可執行驗證。對中文金融 RAG 團隊而言,這套結果更適合用來拆解檢索、計算與生成失敗,而不是拿單一總分宣稱系統已可投入高風險決策。

來源

  1. Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering
  2. FinMMEval 2026 Final Leaderboards
  3. Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering