RAG 與文件工程
READ 讓代理直接搜尋結構化長文件,51 題準確率達 58.8%,但未顯著勝過 BM25
READ 以詞彙搜尋、結構導覽及區段讀取取代固定分塊與向量 Top-K,讓每次取證都可重播。它在一份 780 頁財務報告上大幅領先密集檢索,但樣本小、成本較高,且證據不足以宣稱代理搜尋優於傳統詞彙索引。

對財報、稽核報告等表格密集文件,傳統 RAG 的問題可能不是 embedding 模型不夠強,而是離線分塊先破壞了數字的語境。新研究檢查印度古吉拉特邦一份 [780 頁財務報告](https://cag.gov.in/uploads/state_accounts_report/account-report-FA-VOL-I-2024-25-069c52aa2b34bf9-63690940.pdf):86.8% 的內容行是表格,58,791 個數字 token 只有 15,960 個相異值;金額單位標頭與數值列的中位距離為 13 行,而 lakh 與 crore 相差 100 倍。
作者提出 [READ](https://arxiv.org/abs/2608.06305),不建立向量索引,而是透過 MCP 暴露三類確定性操作:正規化詞彙搜尋、文件 outline 導覽,以及按行號讀取有限連續區段。代理可以先尋找欄位名稱,再向上擴張讀取範圍以納入年度與單位標頭;每個工具輸入、回傳行號及最終引用都能重播。這套設計符合 [MCP 工具介面](https://modelcontextprotocol.io/specification/2025-06-18/server/tools) 的 schema 化呼叫方式,但重點是工具語意,而非協定本身。
在 51 道人工核實問題上,READ 準確率為 58.8%,相同代理改用向量 Top-K 工具只有 27.5%;固定 dense RAG 在匹配設定下為 15.7%,調高檢索深度後最佳可達 35.3%,仍落後 23.5 個百分點。差距主要來自單一數值查找:READ 為 70.8%,dense retrieval 僅 12.5%。
但研究沒有證明「代理搜尋全面勝出」。BM25 得到 51.0%,與 READ 的差距在這個小樣本上不顯著,成本與延遲則約只有 READ 的三分之一;READ 的完整操作集也未顯著優於移除 outline 的版本。此外,PDF 轉換會拆散小數點與表格儲存格,任何檢索器都無法恢復已消失的資訊。工程團隊應先比較 BM25、結構感知解析及可審計區段讀取,再決定是否需要昂貴的代理迴圈。