文件 AI/推論最佳化
兩段式表格壓縮先以 64 個視覺 token 找表,再用原解析度推理
愛丁堡大學研究顯示,低解析度表格雖不適合直接讀數,仍足以供 VLM 判斷相關性。訓練-free 的兩段式流程在長文件測試中節省 41% decoder token,準確率比全表原解析度單次推理高 7.1 個百分點。

愛丁堡大學團隊提出「先辨識、後推理」的多表格文件問答流程:第一階段把每張表縮至最低 64 個視覺 token,要求模型只回傳相關表格編號;第二階段再送回被選中的原解析度表格,讓模型讀取數值並計算答案。方法不需訓練,也不修改 VLM 架構。
研究涵蓋 Gemma 4 E4B、Gemma 4 26B-A4B、Qwen 3 VL-8B 與 Qwen 3.5-9B 等五種配置,並以 MultiHiertt 及 FinLongDocQA 測試。後者每份文件典型包含約 100 頁、80 張表,HTML 最長達 127,816 token。實驗發現,直接縮圖會令儲存格難以辨識,模型反而產生更長且無效的推理軌跡;但表格相關性判斷對解析度較不敏感。64-token 圖像相較只保留表格位置的控制組,讓兩款主要模型的找表 F1 分別增加 16 與 10 點。
在 FinLongDocQA 上,兩段式方法平均比原解析度單次問答少用 40.6% token,準確率增加 7.1 點;相較準確率相若的最佳壓縮單次配置,也少用 14.9%。這提供文件 RAG 一個實用設計:低成本表徵負責路由,高保真內容只供最後推理。不過計量僅涵蓋語言 decoder 的輸入與輸出 token,未計視覺編碼、兩次請求延遲或 API 定價;FinLongDocQA 也只抽樣 400 題。程式碼與資料尚稱要待正式發表才公開,現階段結果仍不能獨立重現。