返回首頁

開源推論系統

Paddock 開源 Rust/CUDA 推論引擎,鎖定單張 NVIDIA GPU 的代理併發

Truespar 公開 Paddock 的排程器、分頁 KV cache、記憶體管理及自製 CUDA kernels,並提供 OpenAI、Anthropic 相容介面。作者基準顯示它在部分單卡工作負載勝過 vLLM 與 SGLang,但尚無獨立重現,且不支援張量平行、ROCm 或 Metal。

Ra Boe · CC BY-SA 2.5 · Image source
zh-Hant

Truespar 於 9 月 4 日把 Paddock 的內部程式庫以 MIT/Apache-2.0 雙授權公開。這不是包裝 llama.cpp 或 Python 推論後端:Rust 服務層、連續批次排程、分頁 KV cache、radix prefix cache、記憶體管理與 C++ CUDA kernels 都在同一儲存庫。`paddock-runner` 可直接提供 OpenAI Chat Completions、Responses、embeddings、語音轉錄,以及 Anthropic Messages 等相容介面;權重可讀取 GGUF 與 safetensors,量化路徑包括 FP8、NVFP4、MXFP4、Q8_0 與部分 Q4_K。

其設計焦點是單張 GPU 同時服務多個編碼代理或長對話。除了 chunked prefill 與公平排程,Paddock 可把 KV cache 外溢至主記憶體或磁碟,也能從 RAM 串流超出 VRAM 的 MoE experts。CUDA kernel pack 透過穩定 C ABI 與 Rust binary 分離,使用者執行預編譯版本只需 NVIDIA 驅動;自行編譯 kernels 才需要 CUDA 13.x。內建 Studio 則負責模型下載、比較與 artifacts,但這些周邊功能也擴大了需要稽核的程式面。

作者以 NVIDIA `aiperf` 測試 RTX PRO 6000 上的 Qwen3.8-27B FP8,宣稱 13 組情境全部快於 vLLM,幅度為 1.02 至 1.19 倍;相較 SGLang 則十勝、兩負、一平。這仍是供應方控制的單卡測試,且 Reddit 使用者已回報 RTX 5080 的編譯錯誤、部分 GGUF 量化無法執行,以及 loopback 免驗證、失敗時繼續啟動等潛在安全問題;其中編譯錯誤已獲修補,但安全影響尚未經正式公告確認。現階段只支援 Windows/Linux 的 CUDA 路徑,一個模型必須放在一張 GPU,沒有 tensor/pipeline parallel,也沒有 ROCm、Vulkan 或 Metal。部署者應先固定模型、量化、驅動與負載重跑公開情境,並把 API 放在具強制驗證的反向代理後方。

來源

  1. Paddock source repository and technical documentation
  2. Paddock product and architecture overview
  3. Maintainer release thread and community testing