返回首頁

AI 推論系統

Atlas 以純 Rust/CUDA 推論引擎在單顆 GB10 對決 vLLM,高併發吞吐最高快 22.5%

Atlas 公開 Qwen3.8-27B-NVFP4 的可重跑測試,在 DGX Spark 的 1 至 128 路併發均領先 vLLM。結果只涵蓋單一模型與短輸入、長輸出負載,尚不能推廣至一般資料中心部署。

Own work · CC BY 1.0 · Image source
zh-Hant

Atlas Inference 公布新一輪 DGX Spark 測試,主角是以 Rust 編寫控制層、CUDA 實作核心的開源推論引擎。它不在服務熱路徑依賴 Python 或 PyTorch,而是針對「硬體、模型架構、量化格式」組合配置專用核心,並提供 OpenAI 相容 API;社群版採 AGPL-3.0,貢獻者授權協議則容許團隊另行發布企業版。

這次測試在單顆 NVIDIA GB10、121.7 GB 統一記憶體上載入 `unsloth/Qwen3.8-27B-NVFP4`。輸入長度固定為 128 token、輸出為 1,024 token,關閉思考模式並採確定性解碼;Atlas 與 vLLM 都使用 K=4 的多 token 預測,另保留不做推測解碼的 vLLM 組合。每個併發級別先暖機一次,再執行三次計時。Atlas 在 C=1 至 C=128 的總吞吐為 23.59 至 478.11 token/s,相對各級較快的 vLLM 配置領先 1.2% 至 22.5%;最大差距出現在 128 路併發,顯示其排程與核心在請求堆積時仍能擴展。

工程價值不只是移除 Python 啟動成本。Atlas 還把 paged FP8 KV cache、Gated DeltaNet、MTP、NVFP4 反量化與模型配方收進同一套可檢查的二進位部署路徑,適合希望在工作站直接承載多個代理請求的團隊。不過所有數字均由專案方在單機自測;短輸入/長輸出也未覆蓋百萬 token、工具呼叫、前綴快取命中率及延遲尾端。其 MLPerf 6.1 成績仍待 MLCommons 公布。下一步應觀察獨立重跑、長上下文正確性,以及非 GB10 硬體是否仍有優勢。

來源

  1. Atlas, pure Rust inference for DGX Spark
  2. Atlas Inference Engine repository
  3. Atlas runtime profile