AI 推論與開發工具
Axon 以強型別 DSL 生成五種 LLM 後端,MLX 中位延遲降至 Transformers 的 48.3%
Axon 將模型架構寫成具符號張量形狀的函數式規格,再編譯至 PyTorch、Triton、JAX、MLX 與原生 vLLM。467 組推論測試顯示多數生成模型加速,但部分 BF16、編碼器及序列到序列模型仍出現精度或效能退化。

新提出的 Axon 嘗試把 LLM 架構從特定框架的 Python 類別,提升為可跨後端編譯的強型別領域專用語言。開發者以類似 Haskell 的語法描述注意力、MoE、狀態空間模組、參數路徑及 KV cache;`Tensor[B,S,D]` 等型別讓編譯器在產生程式前檢查符號形狀。編譯流程先展開函式與函式庫、正規化成具型別的 Graph IR,再針對 PyTorch、Triton、JAX、MLX 或 vLLM 降階,不要求部署環境保留 Axon runtime。[論文](https://arxiv.org/abs/2608.19889)以 47 種模型定義、135M 至 32B 參數模型完成 467 組推論比較。相對 Hugging Face Transformers,PyTorch、Triton、JAX、MLX 的官方中位加速分別為 7%、12%、91% 與 107%;MLX 的 126 組測試中,中位執行時間為基線的 48.3%。編譯成支援 PagedAttention 與 KV cache 的原生 vLLM 架構後,中位加速為 58%,而非以較慢的 Transformers 相容路徑載入;這項區別也呼應 [vLLM 的模型實作文件](https://docs.vllm.ai/en/latest/models/supported_models/)所列原生與 Transformers backend 差異。技術價值在於,同一份可稽核規格可同時服務訓練、桌面端與伺服器推論,減少每個新架構重寫五套實作的成本。不過結果目前僅來自作者測試:T5、mT5 等短 forward workload 有明顯慢速離群值,五個模型的 MLX BF16 輸出未達數值一致,而且論文未附公開程式庫。工程團隊下一步應關注編譯器與完整基準能否釋出、動態控制流程及量化模型是否受支援,以及加速能否在連續批次、多使用者 serving 下維持。