返回首頁

AI 基礎設施

MLPerf Endpoints 0.7 將雲端推論改成持續投稿,首版仍缺成本正規化

MLCommons 推出面向託管推論服務的 Endpoints 0.7,以自動投稿、持續審查及互動圖表取代半年一次的靜態比較。首版涵蓋五家供應商與三項基準,但成本正規化、代理工作負載及廣泛投稿要等 1.0 才會加入。

Kigsz · CC BY-SA 3.0 · Image source
zh-Hant

MLCommons 於 7 月 28 日發布 [MLPerf Endpoints 0.7](https://mlcommons.org/2026/07/mlperf-endpoints-v0-7-release/),把評測對象從可自行控制的伺服器,延伸至企業實際購買的雲端與託管推論端點。傳統 MLPerf 採固定輪次公布結果,難以跟上模型、加速器與服務方案的更新速度;Endpoints 因而加入自動化投稿管線、持續審查工具及可動態篩選的結果介面,目標是比較不同供應商在延遲、吞吐與服務設定上的取捨。

0.7 的初始結果來自 CoreWeave、Google、Intel、KRAI 與 NVIDIA,橫跨三項基準,原始框架與規則則放在 [MLCommons Endpoints 儲存庫](https://github.com/mlcommons/endpoints)。這套設計的重要性不在於產生另一張「最快 GPU」排行榜,而是嘗試把完整端點納入測量:同一硬體搭配不同批次策略、推論引擎、量化及服務限制,可能形成完全不同的可用效能。持續投稿若能維持相同審查標準,也較適合用於採購時比較新雲、超大規模雲與專用服務商。

不過 0.7 明確仍是基礎版本。MLCommons 尚未提供完整的成本或功耗正規化,參與者也只占市場一小部分;因此現有結果不能直接回答每美元 token、尖峰流量穩定性或跨區域延遲等營運問題。組織預計在今年稍後推出 1.0,擴充代理型工作負載並向更多會員開放滾動投稿。工程團隊接下來應關注代理測試如何界定工具延遲、成功率與重試成本,以及供應商是否公開足以重現結果的模型版本、參數與限流設定。

來源

  1. MLPerf Endpoints v0.7: A Foundation Release
  2. MLCommons Inference Endpoints repository
  3. MLPerf Endpoints interactive results