返回首頁

推論系統

SGLang 0.5.19 加入 Beam Search,並重整跨 NVIDIA、AMD 的推論路徑

SGLang 新版可在同一服務中以 `beam_width` 回傳多條候選序列,並將統一 radix tree 設為所有模型的預設快取。更新同時擴充 MoE、長上下文及 ROCm 核心,但包含依賴與設定行為變更,升級前須重新驗證。

Steroid Maximus · CC BY-SA 3.0 · Image source
zh-Hant

SGLang 0.5.19 的直接可見變化,是推論伺服器原生支援 Beam Search:請求可傳入 `beam_width`,取得分數較高的多條候選序列,而且能與一般取樣請求並存。這對語音辨識、翻譯、程式生成與需要後置驗證器重排的工作流很實用;限制是目前不能與 speculative decoding、prefill/decode 分離、DP attention 或 HiCache 混用。

執行期方面,統一 radix tree 現在成為所有組態的預設 KV cache,不再只服務混合架構。它讓滑動視窗模型的 decode worker 重用前綴,並支援在伺服器運行期間掛載或卸載 L3 儲存層。MoE 路徑則新增 DeepEP v2 ElasticBuffer,使 DeepSeek-V3/V4、Qwen3-MoE 的 FP8 跨節點通訊可在固定緩衝區下配合 CUDA Graph;Hopper 上的 W4A8 MoE,官方測得 DeepSeek-V4-Flash 輸出吞吐提高約 12%,但數字尚缺獨立重現。

硬體最佳化不只針對 NVIDIA。MI300X、MI355X 新增 persistent Lean Attention,把長度不均的 decode 工作重新分散至閒置 compute units;發布資料宣稱 MI355X 最多提升 1.52 倍吞吐、降低 3.62 倍 token 間延遲。Blackwell 的 MLA 路徑也加入 decode context parallelism,主攻 128K 等長上下文。

升級風險同樣具體:FlashInfer 0.6.18 成為部分功能的必要依賴;自行建立 `ServerArgs` 的程式必須顯式呼叫 `resolve_once()`;Spark3 的模型與工具解析器名稱改成 Spark2.5。團隊還替 stop string 與正規表示式設定數量、長度上限。生產環境應分開重跑準確率、快取命中率、TTFT、TPOT 與混合請求測試,不能只依官方單一硬體基準判斷收益。

來源

  1. Release v0.5.19
  2. sglang 0.5.19