推論系統
PaDoc 以版面分支並行解析文件,單張 A800 吞吐量最高提高 118%
PaDoc 讓版面序列與各區域內容共享頁面 KV prefix 後並行解碼,不再把整頁壓成單一長序列。作者在 OmniDocBench 報告品質接近領先系統,P95 延遲較同骨幹循序基線降低 39.2% 至 54.9%。

端到端文件模型通常先讀取整頁圖片,再依序生成區塊座標、文字、表格與公式。即使兩個區域彼此獨立,自回歸解碼器仍必須完成前一區內容才能處理下一區;另一種先裁切再辨識的兩階段方案可以平行執行,卻要為每個裁切區重做視覺 prefill,也會失去部分整頁上下文。
PaDoc 將模型預測的版面視為一棵分支結構。主序列持續生成下一個版面區域,每遇到 learned fork token,便從相同的圖片與版面 prefix 啟動一條內容分支。各分支保留完整頁面影像,但看不到兄弟分支已生成的內容。訓練時,packed variable-length ancestor attention 實作這種可見性,仍沿用標準 next-token objective,不需要額外偵測頭或草稿模型;推論時則複製分叉點的 KV cache,讓主序列和內容分支並行前進。
研究以 Qwen3-VL-2B 為起點進行持續預訓練與監督微調。OmniDocBench Full 上,PaDoc 的版面 Overall F1 為 91.1,端到端 Overall 分數為 94.24,Text Edit 為 0.038、Formula CDM 為 95.59。效率測試使用 384 頁子集與單張 A800;相較同骨幹的 Sequential SFT,五種並行度下有效頁面吞吐量提高 67.4% 至 118%,P95 延遲降低 39.2% 至 54.9%。其關鍵並非減少全部輸出 token,而是把關鍵路徑從所有區域內容長度總和,縮短為最長的版面—內容分支。
開源實作提供 Transformers 與 vLLM 兩條路徑:前者在同一 GPU batch 內同步推進分支,後者把分支送成獨立請求並利用 prefix caching。工程上仍須注意分支數、總生成 token 與逾時限制,否則密集頁面可能放大排程與記憶體壓力。另一項根本限制是「給定整頁影像與區域版面後,各區內容可獨立辨識」的假設;跨欄閱讀順序、表格續頁或圖說引用可能違反它。速度結果目前也只涵蓋特定模型、A800 與作者選定子集,仍需在不同 GPU、長文件及批次服務負載下驗證。