返回首頁

邊緣 AI

Atlas 以 Rust 與客製 GPU 核心瞄準桌面推論,提交跨 NVIDIA、AMD 的 MLPerf 測試

Atlas 更新其可驗證推論映像,並以同一套核心來源向 MLPerf Inference 6.1 邊緣組提交 GB10 與 AMD gfx1151 結果。正式數字仍受 embargo 約束,現階段只能確認測試方法與提交狀態,不能據此宣稱領先 llama.cpp。

Own work · CC BY 1.0 · Image source
zh-Hant

開源推論引擎 Atlas 在 7 月 24 日更新驗證版本,並確認已向 MLPerf Inference 6.1 的 closed edge division 提交 NVIDIA GB10 與 AMD gfx1151 測試。專案以 Rust、CUDA 與平台專用核心建構,發行物是一個約 2.5 GB、毋須 Python 或 PyTorch 的二進位檔;社群版採 AGPLv3,另有商業授權。其主要定位不是資料中心高併發,而是 DGX Spark、Strix Halo 等單機統一記憶體裝置上的本地模型與代理推論。

Atlas 的發行閘門會確認支援模型能啟動、輸出保持連貫、工具呼叫可用,並要求吞吐量不得比已提交基線低逾 10%。相關配方與檢查腳本已置於 GitHub,因此使用者可在自己的硬體重跑;但專案網站所稱的啟動時間與使用者體感仍不能取代標準化比較。

這次提交值得注意,因為 MLPerf 新的 Edge Agentic 工作負載不再只測單輪 token 吞吐量。它以量化 Qwen3.6-27B、BFCL v4 工具呼叫正確率,以及 1,007 輪代理程式任務重播,量測單一請求的 TTFT、每輸出 token 時間和端到端延遲。這較接近桌面代理逐輪累積上下文的實際負載。

不過 Atlas 的正式效能結果尚未公布,網站也明確標示 throughput baseline 等待 MLCommons 發布;同一來源碼跨兩家 GPU 執行,不代表底層核心完全相同或效能可直接橫比。工程團隊應等待公開 submission、功耗資料與可稽核設定,並測試長上下文、併發及工具呼叫穩定性後再評估部署。

來源

  1. Atlas, pure Rust inference for DGX Spark
  2. Call for Submission: Edge Agentic Inference Benchmark for MLPerf Inference v6.1
  3. Avarok-Cybersecurity/atlas