返回首頁

AI 基礎設施與評測

MLPerf 首度量度完整 RAG 管線,但效能模式會固定檢索路徑

MLCommons 新增端到端 RAG 推論基準,分別量度向量資料庫建置與多跳問答吞吐量。為控制生成的不確定性,效能測試重播預先記錄的各階段輸入,因此不能完全代表線上 RAG 的動態行為。

Henriok · CC0 · Image source
zh-Hant

MLCommons 於 8 月 26 日公開首個 MLPerf 端到端 RAG 推論基準,把過往以單一模型、單一提示詞為主的量測,擴展至資料擷取、分段、嵌入、向量索引、檢索、重排、多跳查詢改寫、證據充分性判斷及答案生成。基準拆成 `e2e-rag-db` 與 `e2e-rag-qna`:前者以每秒處理文件數量評估索引建置,後者則以每秒完成任務數量評估整條問答管線。

參考工作負載採用 FRAMES 的 824 條問題,以及固定版本的 2,515 篇維基百科 HTML 文件,切成約 10.7 萬個重疊段落。系統以 E5-base-v2 建立 768 維向量、FAISS HNSW 儲存、ColBERTv2 重排,再由 GPT-OSS-20B/120B 分擔文件判斷、查詢改寫與生成;每題最多執行五輪檢索。這種設計讓參賽者可比較模型共置、不同精度、CPU/GPU 配置、跨階段批次排程及 prefix cache,而不是只最佳化大型模型核心。

不過,首版只有 Offline 情境,未涵蓋線上到達率、尾延遲或併發抖動。為提高可重現性,效能模式會重播各輪預先記錄的輸入,固定檢索文件與迭代次數;模型仍執行運算,但輸出會被捨棄。這意味其吞吐量更接近已知執行圖的系統壓力測試,不能直接推論動態檢索品質。參考答案準確率亦只有 35%,合規門檻是其 97%;現行稽核主要檢查最終生成長度,尚未全面防止參賽者削減中間檢索或判斷工作。工程團隊應等待首批跨硬件提交,並留意未來 Server 情境與更完整的逐階段合規測試。

來源

  1. Introducing the MLPerf End-to-End RAG Inference Benchmark
  2. MLPerf End-to-End RAG reference implementation
  3. MLPerf Inference Rules