語音 AI/模型 API
Gemini 3.8 Live 將推理移到語音背景執行,客戶端不能再以 turnComplete 判定閒置
Google 推出兩款原生語音模型,Extended Thinking 可在持續輸出音訊時進行背景推理與非同步工具呼叫。新協定提升長流程語音代理的並行能力,卻也要求開發者重寫工作階段狀態機與中斷處理。

Google 於 9 月 15 日推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking;兩者以 Gemini 3 Pro 為基礎,可接收文字、影像、影片及音訊,輸出文字與原生音訊。[模型卡](https://deepmind.google/models/model-cards/gemini-3-8-audio/)列出的輸入上限為 128K token、輸出上限為 64K,定位是高流量、低延遲的即時對話,而 Extended Thinking 另外允許模型一邊串流語音,一邊執行背景推理及工具工作。
真正影響既有整合的是協定語意。依[開發者文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live-extended-thinking),收到 `turnComplete: true` 已不代表伺服器完全閒置;推理、工具呼叫或後續音訊仍可能繼續。客戶端必須追蹤新的 `interaction_status`,只有 `IDLE` 才能確認工作結束。函式呼叫也只支援 `NON_BLOCKING` 非同步模式;若程式仍在 turn complete 後關閉 socket、釋放工具上下文或接受下一個互斥工作,可能遺失呼叫或造成狀態競爭。開發者另可用 low、medium、high 控制背景推理,但不能選 minimal,且 `proactive_audio` 必須保持啟用。
Google 的評測採單次作答,涵蓋 Artificial Analysis、ServiceNow EVA-Bench 與 Sierra τ³-Banking;其中 Extended Thinking 以 high 推理層級及預設取樣測試。這些成績不能直接化約為真實客服成功率:Sierra 的[語音基準研究](https://sierra.ai/uk/blog/bench-advancing-agent-benchmarking-to-knowledge-and-voice)顯示,加入噪音、插話與非指向代理的語音後,各家系統的任務完成率都會明顯下降。下一步應觀察背景推理增加多少首段音訊延遲與成本,以及應用在斷線重連、使用者插話及非冪等工具下,能否維持一致的工作階段狀態。