返回首頁

本機 AI 推論

Nativ 將 MLX-VLM、本機 API 與效能遙測封裝成開源 macOS 推論工作區

Nativ v0.0.1 把模型下載、聊天、監控及 OpenAI、Anthropic 相容端點整合進原生 SwiftUI 應用,近期在本機 AI 社群獲得關注。首版僅支援 Apple Silicon 與 macOS 26,且尚未公布跨模型效能或相容性測試。

Kw0 · CC BY-SA 3.0 · Image source
zh-Hant

在 Apple Silicon 上執行開放模型通常需要自行處理 Python 環境、MLX 服務、模型快取、API 轉接與效能監控。Nativ v0.0.1 嘗試把這些元件整合成單一 macOS 應用:前端以 SwiftUI 建構,`NativServerKit` 管理可重定位的 Python 環境與伺服器生命週期,底層則由 `mlx-vlm` 和 MLX 使用統一記憶體執行模型。專案在 7 月 26 日的本機 AI 社群整理中受到注意,GitHub 頁面目前顯示約 925 顆星。

Nativ 會掃描 Hugging Face 快取,並依裝置記憶體提示模型是否適合載入;介面同時呈現首 token 延遲、解碼速度、token 用量、GPU 使用率、記憶體與 swap 壓力。較具工程價值的是它不只提供聊天 UI,還在 localhost 暴露 OpenAI 相容的 Chat Completions、Responses、模型、影像與音訊路由,以及 Anthropic Messages 和 token counting 端點。Codex、Claude Code、Pi、Hermes 與 OpenCode 因而能在不大幅修改客戶端的情況下,改接 Mac 上的模型。進階設定另涵蓋 KV cache 量化、prefix caching、speculative decoding、結構化輸出與 thinking budget。

不過,首版仍有明顯邊界:只支援 Apple Silicon 與 macOS 26 以上,能否載入模型也受統一記憶體容量及 `mlx-vlm` 相容性限制;專用語音與影像生成模型仍列為後續功能。雖然推論可在模型下載後離線進行,首次下載模型和建立依賴仍需連網。專案也未提供標準化吞吐量、耗電、長時間穩定性或 OpenAI/Anthropic API 完整相容率。採用者應先以實際 coding agent、工具呼叫與長上下文負載測試,而不是把「相容端點」等同於無差異替代雲端服務。

來源

  1. Nativ v0.0.1 release
  2. Nativ turns local AI on Mac into a native product surface
  3. Nativ — Run AI locally on your Mac