推論系統/本機 AI
NVIDIA PAIR 以單一本機端點分派跨裝置推論,但不會合併 GPU 記憶體
開源 Personal AI Router 可在 Windows、Linux 與 macOS 節點間調度 Ollama 或 LM Studio 的獨立請求。它適合提高多代理併發量,卻不是分散式模型執行引擎,單一模型仍須完整放入一台機器。

NVIDIA 發布 Apache 2.0 授權的 Personal AI Router(PAIR)測試版,試圖把同一區域網路內的 RTX 電腦、DGX Spark 與 Apple Silicon Mac 變成共享的本機推論池。應用只需連到一個相容 Ollama 或 OpenAI 格式的端點;PAIR 會追蹤節點是否上線、推論引擎狀態、模型是否已載入及 GPU 使用量,再把每項獨立請求送到合適機器,因此既有代理框架通常不必修改。
依[NVIDIA 技術說明](https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/),節點以 mDNS 發現彼此,完成配對後以雙向 TLS 保護流量。系統目前支援 Windows 11、Linux、macOS,以及 x64、Arm64;實際推論則由 Ollama 或 LM Studio 負責。官方用 Hermes Desktop 建立五個子代理,在三台裝置上完成工作的時間為 8 分 48 秒,單台 RTX Spark 筆電則為 18 分鐘。不過這是供應商示範,尚非涵蓋不同模型、網路與硬體組合的獨立基準。
最重要的架構界線是:PAIR 只做請求層級的排程。[專案文件](https://github.com/NVIDIA/Personal-AI-Router)明確指出,每個請求從頭到尾仍由單一節點處理;它不會合併 VRAM、不會把一個模型切到多台主機,也不會拆分正在生成的序列。若 70B 模型無法裝入任何一個節點,加入更多小型 GPU 並不能解決容量問題。收益主要出現在多個代理或工作階段可平行發出互相獨立的呼叫時。
「資料留在本機」同樣是條件式承諾:客戶端、模型來源、推論引擎及所有節點都必須保持本機,外接雲端工具仍可能送出資料。工程團隊接下來應測量異質節點的排程公平性、模型冷載入成本、串流中斷與節點休眠時的重試行為,也要把配對憑證、代理監聽介面和自動建立的防火牆規則納入威脅模型。