ホームへ戻る

最新模型

NVIDIA、最大8人対応の話者分離モデルを公開、推奨される最小バッファ遅延は320ミリ秒

Nemotron 3 Diarizationは1億パラメータでストリーミング音声と録音を処理し、話者キャッシュを引き継いで区間をまたぐラベルの一貫性を維持する。遅延の数値は音声のバッファリングのみを対象としており、実際の導入では認識、通信、後処理にかかる時間も測定する必要がある。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIAは9月23日、1億パラメータの話者分離(ダイアライゼーション)モデル「Nemotron 3 Diarization」を紹介した。対応する話者数の上限を前世代の4人から8人へと拡大し、録音とストリーミングの両方を処理できる。モデルは匿名の話者ごとの発話区間を出力し、文字起こしに発言者のラベルを付けるために利用できる。モデル自体はテキストを生成せず、実在する人物の身元も識別しない。[公式技術解説](https://huggingface.co/blog/nvidia/nemotron-diarization)

ストリーミング設計はStreaming Sortformerを踏襲し、最初に発話した順に話者チャネルを割り当てる。既存の論文で説明されているAOSCキャッシュは、過去の音声の音響表現を保存し、予測スコアに基づいて保持する区間を選択する。FIFOキューは直近のコンテキストを補う。この仕組みが対処する中心的な課題は、同じ人が沈黙の後に再び話し始めた際、毎回チャネルを並べ替えずに、音声区間をまたいで一貫したラベルを維持することだ。[アーキテクチャ論文](https://arxiv.org/abs/2507.18446)

新モデルで推奨される最小のバッファ設定は0.32秒で、ほかに0.64秒、1.04秒、30.4秒の設定がある。これらの数値は、現在の音声区間と右コンテキストを合計したもので、モデルの計算、ネットワーク通信、音声認識、アプリケーション処理にかかる時間は含まれていない。バッファを短くすると判断に使えるコンテキストが減るため、320ミリ秒をそのままユーザーに字幕が表示されるまでの時間と見なすことはできない。[遅延設定](https://huggingface.co/blog/nvidia/nemotron-diarization)

公式報告によると、バッファを1.04秒に設定した場合、8つの評価条件における話者分離誤り率の相対的な改善率は平均41%だった。これは各条件の改善率を重み付けせずに平均した値であり、すべての録音をまとめて算出した誤り率ではない。また、あらゆる中国語の会議で同じ改善が得られると推定することもできない。[評価方法](https://huggingface.co/blog/nvidia/nemotron-diarization)

結果を再現する際、NeMoの評価プログラムでは、データマニフェストに対応する時刻アノテーションファイルが必要となる。また、境界の許容幅、重複発話を評価に含めるかどうか、後処理に関する設定も用意されている。プログラムの説明では、モデルカードに記載された成績を再現するには対応する後処理が必要であり、デフォルトの二値化出力をそのまま使っても、同じスコアが得られるとは限らないと注意を促している。[評価プログラム](https://github.com/NVIDIA-NeMo/Speech/blob/main/examples/speaker_tasks/diarization/neural_diarizer/e2e_diarize_speech.py)

2つの話者チャネルが同時にアクティブになっていても、それが示すのは発話が重なった時間帯だけだ。認識された単語をどちらかの話者に割り当てるには、別途アラインメントと曖昧さの解消が必要になる。そのため、導入側が次に行うべきなのは、中国語、複数言語の切り替え、長い沈黙、複数人の割り込み発話を含む録音を使い、文字起こし全体の話者割り当て誤りとエンドツーエンドの遅延を検証することだ。今回の確認では正式なモデルカードを閲覧できず、重みのダウンロード条件は引き続き確認が必要だ。発表された性能結果についても、今回は独立した再現検証を行っていない。

出典

  1. Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization
  2. Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
  3. NeMo 端到端語者分離推論與評測程式