推論系統
vLLM‑Omni 0.29 RC 將全雙工語音移入統一 runtime,但插話能力仍依模型而異
新版以同一套 WebSocket 執行層服務 MiniCPM‑o 4.5、PersonaPlex 與 Nemotron VoiceChat,並加入 diffusion batching、平行化和元件卸載。它目前仍是預發行版,部分端點會靜默退回輪替式語音,不能只憑連線成功判定為全雙工。

vLLM‑Omni 在 9 月 10 日發布 `0.29.0rc1`,並於 9 月 11 日補齊全雙工服務文件。這次變更把先前偏實驗性的語音路徑收進統一 runtime:MiniCPM‑o 4.5、PersonaPlex 與 Nemotron VoiceChat 可透過持久 WebSocket session,在模型輸出語音時繼續接收音訊。執行層處理重疊語音、播放確認、連線恢復和工作階段狀態,應用程式仍負責收音、播放、重採樣與部分 VAD。
對既有 OpenAI Realtime 用戶,主要入口是 `WS /v1/realtime?duplex=1`;需要底層生命週期事件者可用實驗性的 `/v1/duplex`。部署設定必須明確指定 `session_mode: duplex`,模型管線也須提供 duplex adapter。值得注意的是,Realtime 入口在缺少適配器時可能退回一般輪替式處理,因此客戶端應檢查 `session.created.session.capabilities`,不能以 HTTP 或 WebSocket 成功建立連線作為能力探測。
同一候選版亦擴大非文字模型的排程能力:BAGEL 與 Boogu‑Image 新增 request batching,SANA‑Video 可用 tensor、sequence 及 CFG parallelism,DiT 與文字編碼器則能選擇性卸載。多階段服務改用集中式設定解析器,並可在裝置記憶體檢查與 phase lock 保護下平行初始化共置階段。
限制同樣具體。PersonaPlex 雖能處理重疊語音,目前仍標示 `supports_barge_in=false`,尚未證明可在播放游標處破壞性中止並回捲模型狀態;session 容量也取決於部署 YAML。PyPI 將此版標為 pre-release,原生協定仍可能變動。工程團隊應先測試中斷語意、背壓、重連後去重、GPU 記憶體峰值及多 session 公平性,再考慮取代正式環境的 turn-based server。