GitHub Repo
vLLM 社群回報 SM120 推測解碼異常,GLM 草稿 token 接受率降至零
八張 RTX PRO 6000 的測試顯示,vLLM 夜間版搭配原生 SM120 注意力後端時,MTP 草稿全部遭拒,解碼速度明顯下降。問題仍待上游確認,現有對照也同時更換軟體依賴,尚不能鎖定單一成因。

vLLM 社群於 10 月 2 日提出一項推測解碼異常:在八張 RTX PRO 6000、FP8 GLM-5.3-Flash 與八路張量平行配置下,當天的夜間版持續產生 MTP 草稿 token,接受率卻為零。回報中的一次測試產生 822 個草稿,沒有任何一個獲接受;解碼速度約每秒 80 token。問題回報
MTP 利用模型的多 token 預測能力提出候選,再由驗證流程決定接受哪些 token,以減少逐步解碼成本。vLLM 官方文件將推測解碼定位為降低中低請求量、受記憶體頻寬限制工作負載的 token 間延遲,並提醒收益取決於模型、硬體、流量與採樣設定。因此,服務能正常生成文字,並不足以證明加速路徑有效。官方文件
回報者分別測試預設 CUDA Graph、強制 eager 執行,以及把草稿數從三個降為一個,接受率仍為零。這些結果縮小了排查範圍,但尚不足以完全排除執行模式或草稿流程的影響。日誌顯示系統自動選用 FLASHINFER_MLA_SPARSE_SM120,並將舊的注意力後端環境變數標為未知設定;回報者因此懷疑草稿推論路徑存在異常。測試與日誌
同一硬體與模型的社群映像,使用回移植的 SM90 稀疏 MLA 路徑,回報約六成草稿接受率及每秒 163 至 190 token。不過,對照同時更換 vLLM 組建與 FlashInfer 版本,速度差距不能直接歸因於 SM120 核心,也不能推廣為所有部署的退化幅度。對照配置
對採用夜間版的工程團隊,這個案例提示升級驗收應同時查看草稿接受率、實際注意力後端與 token 間延遲,並保留關閉推測解碼的基準。下一步須等待上游以固定依賴版本重現、確認草稿輸出與驗證流程,再判斷修補及正式版影響範圍。截至查核,議題仍開放,頁面未列出關聯修補。