返回首頁

推論與模型服務

SGLang 0.5.16 以信心動態調整推測驗證長度,並重整混合架構快取

SGLang 新版加入 DSpark,依草稿模型信心改變每輪驗證窗口,並把 UnifiedRadixTree 設為滑動窗口、Mamba 與稀疏注意力模型的預設快取。版本也移除數條量化後端及更改 rollout 傳輸格式,升級現有服務前必須檢查相容性。

Brian Robert Marshall · CC BY-SA 2.0 · Image source
zh-Hant

SGLang 0.5.16 的核心新增功能是 DSpark:草稿模型先以半自回歸方式分塊產生候選 token,再根據自身信心動態決定送往目標模型的驗證窗口,不再固定每輪草稿長度。官方在單請求、TP8 的 B300 上測試 DeepSeek-V4-Pro,報告接受長度約 5 時達 383.7 token/s;部署時需選用 `DSPARK` 演算法、開啟 compact ragged verification,並按模型調整 block size。這是特定硬體與批次設定的結果,不能直接外推至多租戶吞吐或尾端延遲。

新版亦把 UnifiedRadixTree 設為滑動窗口注意力、Mamba 及 DSA 模型的預設快取結構,讓前綴命中與狀態空間模型的 recurrent state 使用同一套管理路徑。GLM-5.2 在 context-parallel prefill 下可按 rank 分割 DSA 的 KV 與 indexer cache 層;官方以 8,192 token、78 層及 `cp_size=4` 測得每 rank 快取由 0.77 GB 降至 0.20 GB,約減少 74%。ReplaySSM 的環形推測驗證則取消每個草稿的完整 SSM snapshot,在 Qwen3.5-35B-A3B、TP1 測試中把暫存空間由 11.5 GB 壓至 1.8 GB。

模型支援涵蓋 Inkling、LongCat 2.0、Mellum v2、Pi0.5 與 LongLive 2.0;其中 975B 參數、百萬 token 上下文的 Inkling 已在 Blackwell、H200 和 MI350X/MI355X 驗證。不過 MiniMax-M3 雖已合併必要程式,官方仍標示尚未端到端可用。

升級風險同樣重要:QServe W4A8、FBGEMM FP8、部分 CUTLASS 路徑及內建 NVFP4 JIT 核心被移除,NVFP4 GEMM 轉而依賴 FlashInfer;擴散模型 RL rollout 回應也由 JSON/base64 改成 MsgPack 原始位元組。另有已知的 temperature-0 非決定性及被撤回的 Mamba 修正。工程團隊應以自身批次、GPU、模型和相同提示重跑正確性與延遲測試,不能只依官方微基準升級。

來源

  1. SGLang v0.5.16 release notes
  2. DSpark in SGLang: Speculative Decoding with Confidence-Driven, Variable-Length Verification
  3. SGLang documentation