基準與基礎設施
MLPerf Endpoints v0.7 上線,為代理推論加入持續提交與可比較結果管線
MLCommons 發布 Endpoints v0.7,把推論測試從固定批次提交改造成可自動審核、持續更新的端點基準基礎設施。即將納入的多輪代理負載會同時衡量單一使用者進度與整體吞吐量,而非只計算孤立請求的 tokens/s。

MLCommons 7 月 28 日發布 MLPerf Endpoints v0.7,完成自動化提交管線、持續審核工具與動態結果視覺化。它不是另一份靜態排行榜,而是要讓推論服務以端點形式接受同一套負載與規則,為稍後的 v1.0 滾動提交及代理型工作負載鋪路。參考實作以公開 GitHub 儲存庫提供,服務端只要暴露相容介面,便能接入負載產生器與結果封裝流程。
這項基礎設施更新重要,是因為傳統單輪 tokens/s 很難描述代理。代理的每一輪都依賴前一輪,對話歷史持續增長,會同時施壓 prefill、KV cache 容量、前綴重用與對話感知路由。MLCommons 已為後續 Agentic Inference 測試定義雙軸 Pareto 曲線:一軸計算整套系統的輸出吞吐量,另一軸計算每名使用者或每條軌跡的進展速度,直接顯示提高併發後,總吞吐與單一代理完成時間如何交換。
相關代理負載還加入固定 session ID、cache salting、確定性重建提示,以及同一效能配置上的行內準確率檢查,避免提交者靠跨任務快取、截短回答或改變輸出分布取得虛假加速。這對 vLLM、SGLang、TensorRT-LLM 與模型閘道開發者尤其實用:排程器是否維持對話的 KV locality,將成為可量測的系統能力。
目前 v0.7 仍屬基礎版本,買方導向的正規化規則、完整代理結果及開放式滾動提交要等 v1.0。工程團隊應先關注測試設定是否鎖定模型版本、量化與準確率門檻,否則跨供應商的 Pareto 曲線仍可能比較到不同品質的輸出。