AI 研究
GPU 拓撲研究調整記憶體配置,H200 解碼吞吐量測得提升 14.3%
研究將運算單元位置與記憶體分區納入推論配置,在特定 Qwen3-8B 負載下改善解碼吞吐量。原型需要修改驅動,結果仍待程式公開與跨環境重現。

9 月 21 日提交的 GPU 排程研究指出,同樣數量的串流多處理器(SM),可能因實體位置與記憶體距離而產生不同效能。作者把拓撲與非均勻記憶體存取(NUMA)納入配置,在特定 Qwen3-8B 測試中,將 H200 解碼吞吐量提高 14.3%。[論文紀錄](https://arxiv.org/abs/2609.24270)
研究以微型測試探查運算與記憶體的對應關係,讓預填充和解碼的私有狀態留在各自分區,共享權重與 KV 快取則跨區配置。原型整合進 mini-SGLang,預填充批次為 4、序列長度為 4K;解碼批次為 128、平均 KV 長度為 512。相較已考慮叢集相容性的基準,H200 與 B200 解碼分別提升 14.3% 和 10.4%,預填充改善有限。[方法與實驗](https://arxiv.org/html/2609.24270v1)
這項原型需要修改 CUDA 驅動,讓兩個 MIG 實例共享映射的記憶體,不能視為現成部署選項。論文將程式碼列為後續開源項目,因此目前可核對方法與測試條件,尚不能藉公開原型獨立驗證數字。[實作限制](https://arxiv.org/html/2609.24270v1)
現行 CUDA 文件提供理解結果的另一個依據:Green Contexts 可切分 SM,但使用 Thread Block Clusters 時,還須描述共同排程需求,不能只填運算單元數量。文件也指出,即使 SM 與工作佇列分開,仍不保證工作一定並行。因此,資源切分、運算叢集相容性及實際重疊執行,是需要分別檢查的條件。[CUDA 官方說明](https://docs.nvidia.com/cuda/cuda-programming-guide/04-special-topics/green-contexts.html)
驗證工具的計量方式也需一致。Nsight Compute 文件說明,較新版本會將可歸屬的指標按 Green Context 使用的 SM 數量縮放;若配置重疊,部分指標可能包含其他 Context 的貢獻。比較利用率時,應一併記錄分析工具、驅動與資源配置。[效能分析文件](https://docs.nvidia.com/nsight-compute/ProfilingGuide/)
對推論服務團隊而言,這提供了新的診斷方向。工程上的下一步,是固定模型、批次及上下文長度,分別量測解碼吞吐量、首個 token 延遲及尾端延遲,再比較配置差異。只看單一階段變快,仍無法判斷整體服務是否多完成了請求。
後續值得追蹤的是原型公開後的跨卡重現,以及正式介面能否重現同等配置與效益。在此之前,部署者應將結果視為作者的條件式測量,保留硬體拓撲及軟體版本紀錄,避免直接外推到整個機群。