GitHub Repo
ServingStudio 公開推論效能工作台,串接模擬、代理修改與 GPU 驗證
系統以實測 GPU 核心時間預測服務瓶頸,再由代理把候選優化落實到推論框架。團隊已公開程式碼與測試案例,但收益受模型和負載限制,部分修補仍待上游審查。

華盛頓大學 SyFI 實驗室於 9 月 24 日介紹 ServingStudio,將 LLM 推論服務的效能模擬、程式修改與硬體驗證串成一套流程。工程師先指定模型、請求分布、GPU 配置與效能目標,代理再建立基準、探索設定,把候選方案落實到推論框架。[官方介紹](https://syfi.cs.washington.edu/blog/2026-09-24-introducing-servingstudio/)
工作台分為模擬器、代理與視覺化介面。模擬器使用實測 GPU 核心時間預測服務表現;代理比較預測與執行追蹤,調查差距來自核心、通訊或閒置時間,再修改程式。修改須先通過正確性檢查,最後以完整負載量測吞吐量及延遲,決定保留或重做。從工程角度看,這有助縮小昂貴硬體實驗的搜尋範圍,收益仍需實測確認。[專案說明](https://github.com/SyFI-ServingStudio/ServingStudio)
公開案例揭露了 SGLang 的一個細節:啟動時完成自動調校,不代表預填充 CUDA graph 內的 MoE 核心也已調校。圖模式使用不同形狀的輸出占位張量,產生不同調校鍵值,因而可能退回備用策略。修補在圖擷取前,沿實際執行路徑補做調校,避免只優化到一般即時執行路徑。[修補提案](https://github.com/sgl-project/sglang/pull/38560)
作者以四張 B200、四路張量平行執行 GLM-5.2 NVFP4,測試 240 筆請求、併發 24,每筆輸入 4,096、輸出 8 個 token。暖機後重複量測三次,中位耗時由 44.873 秒降至 42.503 秒,輸入吞吐量增加 5.58%。這是長輸入、短輸出的特定負載;兩組測試使用同一主機的不同 GPU 群組,並未互換。首次圖路徑調校另花約 91 秒,快取重用後才大幅縮短。[測試條件與結果](https://github.com/sgl-project/sglang/pull/38560)
截至查核,該修補仍是草稿 PR;64 題 GSM8K 的總分相同,也不能證明逐題輸出一致。[驗證限制](https://github.com/sgl-project/sglang/pull/38560) 導入時宜固定模型與軟體版本,重測自己的輸入長度、併發及尾端延遲。工作台以子模組固定元件版本,需要 Linux 與多種建置工具;核心剖析和真實框架測試仍需 NVIDIA GPU 與相容 CUDA 環境。[部署需求](https://github.com/SyFI-ServingStudio/ServingStudio)
團隊也規劃擴充跨 GPU、主機記憶體與遠端儲存的前綴快取模擬,並釋出公共核心效能資料庫。目前這些仍列為後續工作。評估者應確認現有時間資料是否涵蓋自己的模型、精度與硬體組合,再追蹤上游審查及不同負載下的預測誤差。[後續計畫](https://syfi.cs.washington.edu/blog/2026-09-24-introducing-servingstudio/)