GitHub Repo
vLLM 公開 Qwen3.8-2.4T 分離式推論測試,每 GPU 總吞吐量約五千 token/秒
團隊以 GB300 NVL72 測量預填充與解碼分離配置,並提供版本資訊及配置庫。最高吞吐量與每人每秒約 180 個生成 token 來自不同配置,仍須依實際負載驗證。

vLLM 團隊於 9 月 21 日公開 Qwen3.8-2.4T 的預填充與解碼分離測試,在 GB300 NVL72 叢集上,最高每 GPU 每秒處理約五千個輸入與輸出 token;低延遲配置則達每位使用者每秒生成約一百八十個 token。兩者位於不同配置的效能取捨曲線,不能合併成同一服務的保證。[測試報告](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
這類部署把讀取提示與逐步生成分派給不同執行個體,再透過連接器傳送快取。工程價值是分別調整首字延遲與後續輸出間隔,減少新提示插入解碼時造成的尾端延遲。官方文件仍將功能標示為實驗性,也明言分離本身不會提高吞吐量;本次成績應視為整套硬體與配置的結果。[分離式預填充文件](https://docs.vllm.ai/en/latest/features/disagg_prefill/)
快取估算是調校關鍵。模型的九十二層包含六十九層 Gated DeltaNet 與二十三層完整注意力,前者保存每個請求的循環狀態,後者的鍵值快取則隨 token 增長。這種混合結構使容量不能只按上下文長度估算;模型卡也列出多步預測支援,啟用推測解碼時還須另留空間。[模型卡](https://huggingface.co/Inferact/Qwen3.8-2.4T-A95B-NVFP4)、[快取分析](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
實驗固定輸入八千一百九十二、輸出一千零二十四個 token,掃描一至二千五百六十個併發請求,使用 NVFP4 權重與指定的 vLLM 開發版映像。團隊先分別測量兩階段,再組合配置;所選配置的 GSM8K 準確率均為百分之九十五,但單一數學基準不足以驗證量化後的中文、程式與長任務品質。[實驗設定](https://vllm.ai/blog/2026-09-21-qwen38-pd-serving)
重現材料採用 NVIDIA 的 srt-slurm 配置庫,依模型、GPU 與框架管理掃描設定。該庫保存可重用設定,實際執行邏輯由 srt-slurm 專案負責,因此兩者版本都屬於實驗條件,而非僅固定模型權重。部署者應固定程式與模型版本,核對兩端快取區塊是否相容,並將預填充設備一起納入成本。接下來更有價值的驗證,是以真實請求長度、到達率與延遲門檻重測,觀察每次成功回應的成本,也須檢查失敗與重試比例;目前公開峰值仍不能直接換算成正式服務容量。[配置庫](https://github.com/NVIDIA/srt-slurm-recipes)