AI 推論與語音代理
Pipecat 1.10 重整語音代理供應商介面,升級 OpenAI 3 可能改變 TLS 行為
Pipecat 1.10 新增跨片段語音延續、伺服器端語句切分與可調音訊緩衝,同時支援新版 OpenAI、Anthropic及 MCP SDK。這次升級也更換部分 HTTP、STT 與推理預設值,既有容器及語音管線不能只靠套件測試判斷相容性。

開源即時語音代理框架 Pipecat 於 9 月 12 日發布 1.10.0。Smallest TTS 現以同一個 `context_id` 串接單次 LLM 回合內的文字片段,避免每次串流請求都重置韻律,並可用 `max_buffer_delay_ms` 控制伺服器端緩衝。Gradium STT 則新增伺服器端 turn detection,以及 `eot_horizon_s`、`eot_threshold` 等端點參數;LiveKit 輸出佇列也可透過 `audio_out_queue_size_ms` 調整,以降低高抖動網路的 underrun。
更值得部署者注意的是相依套件與預設行為。`openai` 版本範圍擴至 3.x;若解析到 OpenAI 3,底層改用 `httpx2`,TLS 也由 `certifi` 切換為作業系統信任庫。精簡容器若沒有系統 CA,或企業環境使用 TLS inspection,可能必須設定 `SSL_CERT_FILE`/`SSL_CERT_DIR`;傳入服務的 `Timeout` 型別也須與實際 HTTP client 家族一致。Anthropic SDK 可升至 1.x,MCP client 可搭配 1.x 或 2.x SDK,但自建 Bedrock client 現須明確提供 AWS region。
Speechmatics 的變動更接近遷移:服務改接 `/v2/agent`,預設由供應商 VAD 判定回合,並移除 speaker focus 與多個舊參數。DeepSeek 服務則預設關閉 thinking,以縮短語音首 token 延遲,同時補上工具呼叫後缺少 `reasoning_content` 所造成的 400 錯誤。工程團隊應以真實通話重新測量首字延遲、插話、重連及結束事件順序;發布說明未提供端到端延遲或穩定性基準,不能把新增緩衝控制直接視為效能提升。