AI 基礎設施
AIPerf 以多程序重建 LLM 測速流程,串流指標仍須核對計數方式
NVIDIA 詳解 GenAI-Perf 後繼工具 AIPerf,將負載產生、結果處理與流量重播納入多程序架構。它提供更完整的服務量測,但遷移相容性與串流 token 計數仍影響結果解讀。

NVIDIA 在 9 月 18 日詳解 AIPerf 的架構與部署測試方法,將它定位為 GenAI-Perf 的後繼工具。核心變更是拆除對 Perf Analyzer 的依賴,改由多個程序產生請求、處理結果,再透過 ZMQ 協調,降低高併發測試先撞上客戶端處理上限的機會。[技術文章](https://developer.nvidia.com/blog/benchmarking-llm-inference-at-scale-with-aiperf/)
這項設計影響的是量測可信度:若負載產生器無法持續送出預定流量,觀察到的吞吐上限可能反映客戶端能力。AIPerf 將工作分散至獨立服務,並提供併發數、請求速率及軌跡重播模式。公開程式庫亦支援自訂資料與端點擴充,讓相同測量流程可用於不同推論服務。[專案文件](https://github.com/ai-dynamo/aiperf)
流量形狀是另一個重點。除了固定間隔,工具可產生 Poisson 與 gamma 到達分布,調整突發程度、逐步升載及輸入輸出長度,也能重播既有服務軌跡。從工程角度看,這有助於揭露批次排程、長短提示混合與快取競爭造成的尾端延遲;單一平均每秒 token 數無法呈現這些差異。[負載配置說明](https://developer.nvidia.com/blog/benchmarking-llm-inference-at-scale-with-aiperf/)
指標仍須按定義解讀。首 token 延遲包含網路、排隊及提示處理;預設 ITL 則以首段之後的耗時除以輸出長度減一,並非逐個 token 的時間戳。若伺服器把多個 token 包在首段回應,單一使用者吞吐量可能被高估。文件提供逐區塊用量修正,但需要相容端點、串流模式及伺服器回報的 token 計數。[指標定義](https://github.com/ai-dynamo/aiperf/blob/main/docs/metrics-reference.md)
既有 GenAI-Perf 腳本也需要檢查。遷移指南以 `--workers-max` 提供工作程序控制,取消舊的透傳參數分隔符,並註明部分 `analyze` 功能尚未支援。團隊應先以固定版本、相同資料及停止條件建立對照,再加入真實流量重播;本次文章沒有提供跨工具誤差驗證,不能據此認定所有工作負載都已排除客戶端瓶頸。[遷移指南](https://github.com/ai-dynamo/aiperf/blob/main/docs/migrating.md)