RAG 與金融 AI
FinRank 用 6,021 個混淆段落測金融 RAG,7B 嵌入模型 Recall@10 僅 44.8%
FinRank 要求系統從 SEC 文件找出公司、期間及披露語境都正確的證據,而不只產生數值正確的答案。資料集與評測程式已公開,但非商業授權及標註限制會影響採用方式。

FinRank 將金融問答的評測焦點從「答案是否正確」移到「答案是否來自正確披露」。同一家公司可能在不同季度重複相似數字,不同公司也會使用近乎相同的會計或風險文字;模型即使輸出合理答案,仍可能引用錯誤年度、表單或法人。新基準因此把檢索、重排及困難負例辨識拆成獨立任務,讓證據來源錯置不再被最終答案掩蓋。
公開資料包含 1,185 筆人工撰寫的問答,取自 22 家美國公司在 2024 至 2025 年提交的 10-K 與 10-Q,涵蓋製藥、油氣及汽車業。每筆資料附參考答案、平均 1.96 個支持段落,以及從同份文件、同公司其他期間或同業文件挑出的負例;合計 6,021 個困難負例。全域檢索語料則是 5,230 個去重後的支持或干擾段落,並非完整 SEC 文件庫,因此結果衡量的是受控的段落排序,而不是端到端文件擷取能力。
基線結果顯示,擴大嵌入模型不會自動解決來源混淆。實驗中最好的 7B 指令微調嵌入模型,在合併語料上的 Recall@10 只有 44.8%;十億參數以下的編碼器最多僅比 BM25 高 3.5 點,金融領域調適模型反而落後 BM25 9.7 點。把隨機負例換成人工挑選的混淆負例後,各方法的成對判別準確率下降 13.0 至 20.5 個百分點,說明許多既有 RAG 分數主要受惠於容易排除的干擾內容。
儲存庫提供 JSONL、固定資料切分、驗證器、基線程式與可追溯修補紀錄,適合測試混合檢索、cross-encoder 重排及帶 metadata 約束的查詢規劃。不過 442 個負例與其他題目的支持段落文字完全相同,使用者需依標記決定是否濾除;每筆資料只有單一主要標註者,也沒有正式的標註者一致性分析。資料採 CC BY-NC 4.0,商業金融系統不能直接把它視為無限制可用的訓練集。