ホームへ戻る

模型與語音 AI

Meta Muse Voice Transcribe、ASR・話者分離・エンドポイント検出を単一のストリーミングモデルに統合

Metaの新しい音声モデルは、同一のデコードループで文字起こし、話者ラベル、発話境界を出力し、動的な待機メカニズムによって精度とレイテンシーのバランスを取る。英語のストリーミング評価では首位に立ち、API価格も低い一方、多言語での品質、セッション上限、非公開のモデル重みが導入判断の制約となっている。

Member of the Expedition 22 crew. · Public domain · Image source
zh-Hant

Meta Superintelligence Labsは、リアルタイム自動音声認識(ASR)、話者分離、エンドポイント検出を単一の自己回帰モデルに統合したMuse Voice Transcribeを公開した。音声は約80ミリ秒のチャンク単位でソフトトークンにエンコードされる。デコーダーはテキスト、話者、音声イベントの各トークンを出力するか、次の音声チャンクの読み込みを要求できる。VAD、ASR、diarizationモデルを連結する従来のアーキテクチャと比べ、この設計はコンポーネント間のタイムラインのずれを抑えられるほか、音声エージェントがエンドポイントイベントに基づいて応答のタイミングを直接判断できる。

もう一つの中核機能がadaptive delayだ。各単語に固定の待機時間を設定するのではなく、現在の音響コンテキストが十分かどうかを判定する。識別しやすい単語は早期に確定し、曖昧な部分では追加の音声を待つ。Metaによると、この戦略は強化学習によって調整され、速度と精度の間でより優れたParetoフロンティアを形成する。モデルの学習データは70以上の言語をカバーし、初回リリースでは25言語で検証済みだ。文中のコードスイッチング、キーワードバイアス、コンテキストバイアスに対応し、モデル層で20人を超える話者も処理できる。

Artificial Analysisによる英語の加重AA-WER Streaming評価では、最終文字起こしのWERは約3.1%で、発話終了の検出から約0.16秒後に最終結果を生成した。ただし、これは各言語で同等の品質が得られることを意味しない。独立テストでは英語録音でローカル実行のWhisper large-v3-turboを上回った一方、単一のヒンディー語・英語混在サンプルでは大幅に下回った。また、話者およびエンドポイントの判定結果も、監督者を置かない高リスク用途を支えられる水準には達していない。

現在、このサービスはMeta Model API、Meta AI for Mac、Muse Codeを通じてのみ提供され、モデル重みは公開されていない。料金は1,000分当たり3米ドル。公開APIのリアルタイム接続は最長約60分で継続接続はできず、ファイル用エンドポイントの制限はさらに厳しいため、公式デモで示された1時間超のモデル処理能力と同一視はできない。エンジニアリングチームは、英語ベンチマークでの首位だけを根拠に移行を決めるのではなく、中国語のアクセント、発話の重なり、ノイズ、切断後の再接続を実際に検証し、文字起こしの修正セマンティクス、データ保持オプション、サービス提供地域も確認すべきだ。

出典

  1. Introducing Muse Voice Transcribe
  2. Speech to Text Providers Leaderboard & Comparison
  3. Meta Muse Voice Transcribe: Benchmarks, Pricing, API Limits, and What It Changes