ホームへ戻る

最新模型

Gemini 3.8 TTS、声質と話し方の制御を分離 既存パイプラインは音声形式の調整が必要

GoogleがFlashとFlash-Liteの2つのテキスト読み上げモデルを発表し、再利用可能なカスタム音声リソースを導入した。新版ではプロンプト構造とデフォルトの音声形式が変更され、カスタム音声を使う複数話者の会話は引き続きターンごとの合成が必要となる。

Asoundd · CC BY-SA 4.0 · Image source
zh-Hant

Googleは9月23日、Gemini 3.8 Flash TTSとFlash-Lite TTSを発表した。前者は音声デザインと演技の制御を重視し、後者は大量の音声生成を想定している。開発者が注意すべき点は、キャラクターの声、ターンごとの話し方、読み上げるテキストを扱うインターフェースの役割分担がより明確になり、既存の音声パイプラインにも移行対応が必要になったことだ。[公式発表](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)

新版では入力テキストを読み上げ原稿として扱い、ターン全体に適用する感情、話速、イントネーションは `speech_metadata.style` に指定する。咳、ため息、ポーズなどの一時的なイベントはインラインタグで指定する。従来のプロンプトで「楽しそうな声で話して」といった指示を本文に混ぜていると、その指示自体が読み上げられる可能性がある。通常の非ストリーミングリクエストでは、デフォルトの音声形式もヘッダーなしのPCMからWAVに変更されたため、既存のコードではヘッダーを手動で付加する処理を削除する必要がある。生の音声データが必要なパイプラインでは、形式を明示的に指定すべきだ。[移行ドキュメント](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts)

音声デザインには独立したリソース作成フローがある。まず `voices.create` を呼び出してキャラクターを作成し、音声IDと試聴用音声を取得してから、後続の合成リクエストで再利用する。実装上は、固定の声質と発話ごとの演技パラメータを分けて管理することで、キャラクター設定を追跡しやすくなる。ただし、保存できる音声は1プロジェクト当たり最大200個で、有効期間は1年間のため、ライフサイクルの管理は引き続き必要だ。[音声デザインのドキュメント](https://ai.google.dev/gemini-api/docs/voice-design)

複数話者の会話には明確な制約がある。1回のリクエストで扱える話者は最大2人で、プリセット音声に限られる。カスタム音声や複製音声で会話を構成するには、各ターンの内容を個別に合成したうえで、24 kHzのPCM音声を連結する必要がある。運用面では、アプリケーション側で引き続きターン間のつなぎ、リクエストのスケジューリング、再生バッファを管理しなければならない。[音声生成の制限](https://ai.google.dev/gemini-api/docs/speech-generation#limitations)

音声の複製には、同一の成人話者による参照録音と、指定の同意文を読み上げた録音が必要だ。ドキュメントに記載された参照音声の長さは10〜30秒となっている。これは素材の収集と登録のフローに直接影響する。既存の音声素材ライブラリについても、インターフェースの要件を満たす録音があるか確認する必要がある。[音声複製インターフェースのドキュメント](https://ai.google.dev/gemini-api/docs/voice-replication)

Flash-Liteの対応言語一覧には中国語(繁体字)と広東語が記載されている。ただし、対応言語に含まれているからといって、すべてのアクセント、固有名詞、長文で同じ品質が得られるわけではない。[モデル仕様](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-lite-tts) 中国語を扱うサービスでは、次の段階として実際の原稿を使い、中国語と英語が混在する箇所、数字の読み上げ、声質の安定性を確認し、最初の音声チャンクが届くまでの遅延と、連結後のポーズの長さを測定すべきだ。テストにはプロンプト移行前後の違いも含め、形式の互換性があることを、読み上げ動作も同じであると誤認しないようにする必要がある。今回は独自の試聴評価を実施していない。

出典

  1. Gemini 3.8 text-to-speech says hello
  2. Gemini 3.8 Flash-Lite TTS
  3. Text-to-speech generation
  4. Voice design
  5. Voice replication