端側推論
BaseRT 以 Metal 4 直接驅動 M5 神經加速器,提示處理最快勝 llama.cpp 6.4 倍
BaseRT 新增手寫的稠密、MoE GEMM 與 FlashAttention 核心,將提示階段的矩陣運算交給 M5 GPU 內的神經加速器。團隊在 M5 Pro 報告顯著領先 llama.cpp 與 MLX,但數據目前仍來自開發者自己的單機測試。

Base Compute 公開新版 BaseRT 與技術報告,示範如何繞過通用框架,直接透過 Metal 4 tensor API 使用 Apple M5 GPU 每個核心內建的神經加速器。這些單元適合執行大型矩陣乘法;新版因而加入手寫的稠密與混合專家 GEMM、量化矩陣核心,以及用於 prefill 的 FlashAttention 核心。記憶體頻寬主導的逐 token 解碼則保留既有專用核心,而非強行搬到矩陣單元。
團隊在 M5 Pro 上測試 15 種模型配置,涵蓋 Qwen 3、Qwen 3.5/3.6、Llama 3.2 與 Gemma 4,模型大小由不足 10 億至 350 億參數。報告稱,BaseRT 的提示處理吞吐量最高為 llama.cpp 的 6.4 倍、MLX 的 3.9 倍;解碼最高分別快 1.75 倍與 1.33 倍。MoE 模型的差距尤其明顯,原因是 prefill 需要大量可由神經加速器承擔的矩陣運算,而解碼仍較受統一記憶體頻寬限制。
技術意義不只是另一套本機 LLM 執行器,而是顯示 Apple Silicon 的最佳化界線已從 GPU shader 延伸到專用矩陣硬體。開發者若要處理長提示、RAG 文件或多請求批次,prefill 加速可能比單看生成速度更有價值;原生 Metal 路徑亦可降低對 Python 與大型框架的依賴。
不過,所有比較都由 BaseRT 團隊提供,且集中於單款 M5 Pro。量化格式、提示長度、功耗、記憶體占用與輸出一致性都可能改變排名。下一步應觀察第三方在相同模型檔、相同精度及相同熱功耗條件下重現結果,也要確認手寫核心能否跟上新模型架構與 Metal API 的變動。