推論基礎設施
Xinference 3.4 加入 prefill/decode 分離與跨 worker 副本擴縮,模型快取可中斷續傳
新版把分離式推論、vLLM 多程序路由及多 worker 副本管理帶進同一個開源服務層。它也讓模型能先下載、從既有快取啟動並續傳,但發布說明沒有提供吞吐或延遲比較。

Xorbits 於 9 月 11 日發布 Xinference 3.4.0,這次更新的主軸不只是增加模型名單,而是補齊叢集部署需要的資料路徑與生命週期控制。新版加入 prefill/decode 分離,可把處理輸入提示與逐 token 解碼交給不同工作程序;同時支援 vLLM 原生 multiprocessing executor 路由及跨多個 worker 的副本擴縮。對需要混合長提示、短回答與長生成流量的部署者而言,這些能力提供了獨立配置計算資源的入口,但實際收益仍取決於模型大小、KV cache 傳輸、批次形狀與網路延遲。
模型管理方面,3.4.0 新增「只下載不啟動」流程、可恢復的快取管理,以及直接以現有快取啟動模型;另可透過 `oci://` URI 交給 llmman serve 取得模型。這使離線環境、受限頻寬節點與滾動部署能把權重傳輸和服務啟動拆開,降低大型檔案下載失敗後重來的成本。新的 engine registration hooks 也讓後端能力註冊更容易擴充。既有文件顯示,Xinference 啟動模型時仍須明確選擇 vLLM、SGLang、llama.cpp、Transformers 或 MLX,且模型格式與量化方式必須和引擎相容;叢集模式則由 supervisor 彙整 worker 的引擎能力。
相容性更新包括 Gemma 4 的 Transformers 批次推論、MiniCPM5-2B、dots.ocr、MonkeyOCR、Fish Audio S1-mini/S2-Pro,以及多模態 embedding、rerank 能力。對台灣使用者,Web UI 亦新增 `zh-TW` 語系。
不過發布頁沒有 prefill/decode 分離的拓撲範例、容錯語義或基準數據,也未說明跨 worker 擴縮時既有請求如何排空。正式升級前應先以自身提示長度分布測量首 token 延遲、解碼吞吐與跨節點流量,並驗證續傳快取的雜湊、來源與權限;「可恢復下載」不能取代供應鏈完整性檢查。