推論系統與基準
MLPerf Inference 6.1 新增端到端 RAG 與邊緣代理測試,基準開始計入完整推論管線
MLCommons 不再只測單一模型,把檢索、重排、生成及多輪代理工作納入 Inference 6.1。新版同時導入 API 型 client/server harness,預示資料中心評測將轉向更接近正式服務的 Endpoints 套件。

MLCommons 於 9 月 16 日發布 MLPerf Inference 6.1,最重要的變化不是某張加速卡刷新紀錄,而是評測單位由單一模型向完整應用管線移動。新的端到端 RAG 測試分開量測文件匯入與線上問答:前者涵蓋 embedding、向量資料庫建立,後者依序執行查詢嵌入、檢索、重排及一個或多個 LLM 的推理。這讓向量索引、資料搬移及元件間排程首次成為標準成績的一部分,較能暴露只優化生成核心卻被檢索層拖慢的系統。
另一項 Edge Agentic Inference 測試模擬單一使用者的 coding-agent 工作負載。上下文會隨多輪互動增加,模型必須交替蒐集證據與推理;評測同時包含限時準確率及內建正確性檢查的確定性工作。GPT-OSS 項目的互動情境也正式容許 speculative decoding,使草稿模型與驗證模型的整體實作可以合規比較。
6.1 共收到 30 個組織提交,涵蓋 512 顆加速器叢集、跨廠牌異質系統,以及橫跨太平洋的分散式系統。超過一半提交採用新的 API 型 harness,由真正的 client/server 介面傳送請求;MLCommons 表示,未來 MLPerf Endpoints 將取代資料中心版 Inference。這會迫使供應商同時處理序列化、佇列、網路與服務端排程,而不能只展示程序內 kernel 吞吐量。
不過,新測試仍是受控工作負載,不等同真實 RAG 的資料品質、召回率或代理工具可靠性。工程團隊比較結果時也應區分 Closed 與 Open division、延遲限制、準確率門檻及叢集規模;跨輪次最高 5.7 倍的改善不能直接歸因於單一晶片。接下來值得觀察的是原始結果能否被第三方重現,以及 Endpoints 是否會公開足以比較成本、尾端延遲和多租戶干擾的指標。