返回首頁

推論基礎設施

SGLang 將零 GPU 模擬器納入正式文件,以延遲預測重播推論流量

SGLang Simulator 以 CPU 攔截執行期元件,模擬排程、批次與多層 KV cache,而不真正載入模型或執行 GPU 核心。團隊宣稱兩款 Qwen3 在 H20 的主要指標誤差低於 5%,但硬體與模型覆蓋仍有限。

Theatrical Artwork by Laura Fiorucci. Picture by Wilfredor · CC0 · Image source
zh-Hant

SGLang 於 9 月 5 日更新文件,把此前沿著公開 roadmap 開發的 Simulator 列為進階功能。它並非縮小模型或用 CPU 慢速推論,而是在啟動時透過類別與模組 hook,替換 Scheduler、ModelRunner、TokenizerManager、RadixCache、HiCacheController、儲存後端及 GPU kernel 載入流程;真正的矩陣計算則交由 AIConfigurator,根據硬體規格與預先量測的算子資料預測每個 batch 的耗時。

模擬器保留 SGLang 的 HTTP 介面及 `bench_serving` 指標格式,並以 mock memory pool 追蹤 KV 配額,因此既有壓測客戶端與生產流量 trace 可直接重播。現有模式涵蓋無快取、HBM L1、DRAM L2 與磁碟 L3,也提供依真實時間等待的 blocking 模式,以及官方所稱可快 10 至 1,000 倍的 offline 模式。實務上,平台團隊可先掃描請求率、batch、RadixAttention 與 HiCache 組合,再把少數候選設定交給昂貴的實機測試。

公開驗證以 H20 上的 Qwen3-8B、Qwen3-32B-FP8 為主;官方表格顯示平均 TTFT、TPOT、ITL、吞吐量及總時間的 MAPE 均低於 5%。這些數字仍由開發團隊提供,而且預測器依賴算子 profiling:換成 MoE、多模態模型、新 GPU、跨節點通訊或 prefill/decode 分離後,誤差不能直接外推。roadmap 也仍列出多實例路由、HybridRadixCache、並行資料傳輸及更複雜 L2 writeback/eviction 等待辦項目。工程師下一步應關注是否公布跨硬體校正資料,並用自身 trace 比較模擬排序與實機結果;目前它較適合作為配置搜尋器,而不是容量承諾或採購依據。

來源

  1. SGLang Simulator roadmap and architecture
  2. SGLang release and documentation tracker