返回首頁

語音 AI/開發者平台

GPT‑Live‑1 API 將全雙工語音與後端推理解耦,語音層每分鐘收費 0.05 美元

OpenAI 把能同時聆聽、說話及處理插話的 GPT‑Live‑1 開放給開發者,並允許語音前端把複雜推理與工具操作委派給其他模型。新架構減少 STT、LLM、TTS 間的脆弱交接,但後端推理、工具及通話基礎設施仍會另外計費。

European Commission - Photographer: Aurore Martignoni · CC BY 4.0 · Image source
zh-Hant

OpenAI 於 9 月 10 日開放 [GPT‑Live‑1 API](https://openai.com/index/introducing-gpt-live-1-in-the-api/)。它不是把既有語音辨識、文字模型與語音合成三段管線包進同一端點,而是由單一前端模型同時處理輸入與輸出音訊,據此判斷停頓、附和、背景對話及使用者中途改口。需要查詢資料、呼叫工具或長時間思考時,前端可把文字脈絡委派給 GPT‑6 Astra、其他 OpenAI 模型或第三方後端,語音互動則可繼續進行。

這項拆分讓工程團隊能獨立選擇低延遲語音層與不同成本的推理層,也避免每次插話都要在 ASR、對話狀態及 TTS 之間重建同步。API 原生提供辨識逐字稿、回應文字、關鍵詞偏置及回合偵測,並支援電話情境。OpenAI 報告 GPT‑Live‑1 在 Full Duplex Bench 較 GPT‑Realtime‑2.1 提高 30 個百分點;與 Astra medium 組合時亦在 Tau3 端到端語音代理測試居首。不過這些是供應商執行的受控評測,後端模型與推理強度不同,不能單獨歸因於語音模型。

語音層定價為每分鐘 0.05 美元,後端模型與工具另計;[第三方技術整理](https://www.orcarouter.ai/blog/gpt-live-1-api-release)亦指出它使用獨立 Live 端點,並非現有 Realtime 應用只替換模型名稱即可遷移。部署者應特別測試插話後的工作取消語意:停止說話輸出不代表後端工具已停止執行。接下來值得觀察的是繁體中文與混合語言的回合判定、電話網路抖動下的延遲,以及長時間靜音與後端等待造成的實際每通成本。

來源

  1. Build more natural voice experiences with GPT‑Live‑1 in the API
  2. GPT‑Live‑1 Reaches the API: Full‑Duplex Voice at $0.05 a Minute, With No Drop‑In Path From GPT‑Realtime‑2.1