返回首頁

推論系統

HPD-Parsing 將文件生成拆成並行分支,1B 模型峰值吞吐達每秒 4,752 token

PaddlePaddle 開放 1B 參數 HPD-Parsing,以全域版面分支協調多個區塊解碼器,避開整頁逐 token 生成的序列瓶頸。官方測試顯示吞吐是既有最快比較模型的 2.62 倍,但目前依賴客製 vLLM 套件,峰值數字也不能直接等同端到端 PDF 處理速度。

Balzac · GFDL · Image source
zh-Hant

PaddlePaddle 近日公開 HPD-Parsing 權重、模型卡與部署文件,嘗試改寫視覺語言模型解析文件的解碼方式。傳統端到端文件模型先理解整頁影像,再沿單一自回歸序列輸出文字、表格與公式;頁面愈長,後面的 token 就必須等待前面完成。HPD-Parsing 則讓主分支只負責全域版面與閱讀順序,遇到區塊時輸出特殊分派訊號,由執行環境動態建立多個子請求,同時生成各區域內容,最後再依主分支結構組裝。

模型另加入 Progressive Multi-Token Prediction,逐步增加單次預測的 token 數,進一步減少解碼輪次。論文在公開文件資料上報告峰值 4,752 token/s,為最快比較模型的 2.62 倍、一般自回歸基線的 3.06 倍;Hugging Face 模型卡列出的 OmniDocBench v1.6 整體成績為 94.91%。模型本體約 1B 參數,以 InternVL3.5-1B 系列為基礎,權重採 Apache-2.0 授權。

技術價值不只在 OCR 分數,而是把文件的天然區塊結構直接映射到推論排程。對大量發票、論文或 RAG 索引工作,區塊並行可能提高 GPU 利用率並縮短長頁面的尾端延遲。不過目前部署需安裝客製的 `vllm-0.17.1+hpdparsing`,代表它尚非標準 vLLM 能力;動態分支亦會增加排程、記憶體與結果重組成本。工程團隊下一步應比較真實 PDF 的每頁延遲、批次吞吐、VRAM 峰值及複雜閱讀順序錯誤,而不能只採用 token 峰值。

來源

  1. HPD-Parsing: Hierarchical Parallel Document Parsing
  2. PaddlePaddle/HPD-Parsing model card
  3. HPD-Parsing deployment guide