推論基礎設施
NVIDIA PAIR 以相容代理路由閒置電腦,將本機多代理推論分散至不同節點
PAIR 在 Ollama、LM Studio 與代理程式之間加入相容代理層,依模型位置及 GPU 負載把獨立請求派往區域網路內的電腦。它增加的是工作負載並行度,不會合併顯示記憶體,也不能把單次推論拆到多張 GPU。

NVIDIA 9 月 3 日釋出開源的 Personal AI Router(PAIR)測試版,嘗試把家中或小型工作室的 Windows、Linux、macOS 電腦組成彈性推論池。PAIR 本身不是新的推論引擎;每個節點仍由 Ollama 或 LM Studio 載入並執行模型。它接管相容的本機 API 端點,讓既有代理框架只需指向一個位址,不必理解後方有多少機器。
節點可透過 mDNS 自動發現或以 IP 加入,使用者核准配對後,節點間以相互 TLS 與產生的憑證通訊。排程器會檢查機器是否在線、推論引擎狀態、指定模型是否已存在、進行中的工作數及 GPU 使用率,再把新請求交給一個合格節點;串流回應則經相同代理返回。節點休眠、離線或被前景應用占用時,可退出可用池。
這套設計主要解決多代理或多個本機應用同時呼叫模型時的排隊問題,而不是單一模型容量不足。每項請求從開始到結束都留在同一節點,因此 PAIR 不做張量平行、模型切分或跨機器 VRAM 聚合。硬體支援涵蓋 RTX 20 系列以上、RTX PRO、DGX Spark 與 Apple M4 以上裝置。
官方以五個子代理、Qwen 3.6 35B A3B 與 Ollama 示範:三台異質裝置平均用時 8 分 48 秒,單台 RTX Spark 筆電則為 18 分鐘。這只是特定配置展示,沒有工作負載分布、網路延遲與多輪重複數據,不能推論成線性加速。工程團隊接下來應觀察節點中途失效的重試語義、同名模型版本一致性、排程公平性,以及 mDNS、憑證輪替和代理端點是否經得起不受信任區域網路的威脅模型。