最新模型
Gemini 3.8 TTS 分離聲線與語氣控制,既有管線須調整音訊格式
Google 推出 Flash 與 Flash-Lite 兩款文字轉語音模型,加入可重用的自訂聲音資源。新版調整提示結構及預設音訊格式,自訂聲音的多人對話仍須逐輪合成。

Google 於 9 月 23 日宣布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,前者側重聲音設計與表演控制,後者面向大量語音生成。開發者需要注意的,是角色聲音、逐輪語氣與朗讀文字有了更明確的介面分工,既有音訊管線也有遷移需求。[官方公告](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)
新版把輸入文字視為朗讀稿,整輪持續的情緒、語速與語調改放在 `speech_metadata.style`;咳嗽、嘆氣或停頓等瞬間事件則以行內標記指定。舊提示若把「用開心的聲音說」混入正文,指示本身可能被念出。一般非串流請求預設也由無標頭 PCM 改成 WAV,舊程式須移除手動補標頭的步驟;需要原始音訊的管線應明確指定格式。[遷移文件](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)
聲音設計另有獨立資源流程:先呼叫 `voices.create` 建立角色,取得聲音識別碼及試聽音訊,再於後續合成請求重用。工程上的意義是把固定聲線與每句表演參數分開管理,較容易追蹤角色設定;但儲存型聲音每專案最多 200 個,存續時間為一年,仍須處理生命週期。[聲音設計文件](https://ai.google.dev/gemini-api/docs/voice-design)
多人對話有明確邊界:單次請求最多兩名說話者,而且限用預設聲音。自訂或複製聲音若要組成對話,須分別合成每輪內容,再拼接 24 kHz PCM 音訊。從部署角度看,應用仍須管理輪次銜接、請求排程與播放緩衝。[語音生成限制](https://ai.google.dev/gemini-api/docs/speech-generation#limitations)
聲音複製要求同一成年說話者提供參考錄音及指定同意聲明錄音;文件列出的參考片段長度為 10 至 30 秒。這會直接影響素材收集與建檔流程,既有聲音素材庫也須核對是否具備符合介面的錄音。[複製介面文件](https://ai.google.dev/gemini-api/docs/voice-replication)
Flash-Lite 的語言表列有繁體中文與粵語,但語言覆蓋不代表所有口音、專有名詞與長篇內容都有相同品質。[模型規格](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) 中文服務下一步應以實際稿件檢查中英夾雜、數字朗讀與聲線穩定度,並量測首段音訊延遲及拼接後的停頓。測試亦應涵蓋提示遷移前後的差異,避免把格式相容誤認為朗讀行為相同;本次未執行獨立聽測。