LLM 推論系統
xPress 為擴散式草稿補回因果關係,Qwen3-8B 解碼吞吐量平均提高約 1.3 倍
xPress 在區塊擴散草稿與目標 LLM 之間加入一次並行因果修整,減少「單字合理、整段不合理」造成的提前拒絕。研究報告草稿接受長度平均增加約 30%,但目前尚無公開實作可供獨立重現。

推測式解碼先由較小的 drafter 提出一批 token,再讓目標模型一次驗證;只要草稿分布正確,便能在不改變目標模型輸出的前提下加速解碼。DFlash 等區塊擴散方法進一步把整段草稿放進單次前向傳播,但其最後一次去噪會在各位置獨立取樣。這些 token 各自可能具有高機率,組合後卻未必符合自回歸目標模型的條件分布,導致驗證在前幾個位置便拒絕後續草稿。
8 月 3 日公開的 xPress 在擴散 drafter 後加入輕量級 causal refiner。它不逐 token 重跑自回歸迴圈,而是一次並行處理整個草稿區塊,傳播前序位置對後序位置的依賴,再把修整後序列送給目標模型驗證。換言之,新增模組試圖補回區塊擴散最後取樣階段遺失的聯合分布結構,同時保留平行產生草稿的主要速度優勢。
作者以 Qwen3-8B 在數學、程式與對話等七項基準測試,宣稱相較原始 DFlash,平均接受長度提高約 30%,最高 56%;端到端解碼吞吐量平均約為 1.3 倍,最高達 1.7 倍。這也說明改善草稿模型的局部速度並不足夠:真正影響系統收益的是目標模型能連續接受多少 token,以及新增修整層的成本能否由較少的驗證回合攤平。
現階段結果只涵蓋單一 8B 目標模型,論文頁面亦未連結 xPress 程式或權重,因此尚無法檢查不同批次、長上下文、量化模型及服務併發下的收益。工程團隊應特別等待與 SGLang、vLLM 或 llama.cpp 的整合數據;若 causal refiner 需要為每個目標模型重新訓練,部署與模型版本管理成本也可能抵銷部分加速價值。