返回首頁

RAG/文件理解

DocMemo 以貝氏頁面記憶重查長文件,MMLongBench 準確率達 71.3%

DocMemo 不把首次檢索的 top-k 頁面視為定案,而是把推理回饋寫回頁面相關性分布並重新取樣。三層記憶在長文件問答帶來增益,但評分依賴 GPT-4.1,公開儲存庫也仍相當精簡。

Mktsn · CC BY-SA 4.0 · Image source
zh-Hant

長PDF問答常在推理開始前一次選定若干頁面;若第一輪漏掉表格或跨頁線索,後續模型即使推理能力更強也無從修正。DocMemo 把檢索改成最多三輪的狀態式探索,並將記憶拆成三層:Document Schema Memory 保存章節與頁面摘要等文件結構;Page Belief Memory 維護每頁與當前問題相關的機率;Question Episodic Memory 記錄已找到的證據、未解線索及查詢改寫歷程。

每輪系統以視覺嵌入取得候選頁,再用 Thompson sampling 在高信心頁面與尚未充分檢查的頁面間取捨。推理模型對證據的判斷會透過貝氏更新寫回頁面信念,附近兩頁亦按衰減係數獲得相關性傳播;遇到資訊密集表格時,系統可額外裁切局部視覺區域,而非只把整頁縮圖交給模型。

在含1,082題、文件最長112頁的 MMLongBench-Doc 上,DocMemo取得71.3%準確率,高於DocLens的67.6%;表格題與不可回答題分別達73.3%及78.8%。控制相同Qwen3.5-9B、ColQwen2.5、頁面預算與三輪上限後,它仍以71.3%領先SimpleDoc的69.3%。移除全部記憶後分數降至68.47%,拿掉貝氏更新為68.80%;將Thompson sampling換成只選後驗平均最高頁面的貪婪策略,則由71.28%降至68.62%。

不過,正確性主要由GPT-4.1作二元裁判,可能把回答風格差異混入結果;多項基線數字亦取自各自論文或排行榜。公開程式目前只有兩次提交,提供頁面嵌入、摘要、vLLM服務與問答管線,但未附資料及完整重現產物。實務採用前仍應測量離線摘要成本、長文件更新失效問題,以及頁面信念能否跨不同版面與語言穩定校準。

來源

  1. DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding
  2. Harrygof/DocMemo