最新模型
NVIDIA 公布八人語者分離模型,最低建議緩衝延遲為 320 毫秒
Nemotron 3 Diarization 以一億參數處理串流與錄音,沿用說話者快取維持跨片段標籤。延遲數字僅計音訊緩衝,實際部署仍須量測辨識、傳輸與後處理成本。

NVIDIA 於 9 月 23 日介紹 Nemotron 3 Diarization:一個一億參數的語者分離模型,將前代四位說話者的支援上限擴為八位,同時提供錄音與串流處理。模型輸出匿名說話者的活動時間,可供逐字稿標記發言來源;它本身不產生文字,也不辨認真實身分。[官方技術說明](https://huggingface.co/blog/nvidia/nemotron-diarization)
其串流設計沿用 Streaming Sortformer,依首次發聲順序安排說話者通道。既有論文描述的 AOSC 快取保存先前語音的聲學表示,並按預測分數挑選保留片段;FIFO 佇列補充最近的上下文。這套機制處理的核心問題,是同一人在停頓後重新發言時,跨音訊片段仍能維持一致標籤,而不必每次重新排列通道。[架構論文](https://arxiv.org/abs/2507.18446)
新模型最低建議的緩衝設定為 0.32 秒,另有 0.64、1.04 與 30.4 秒配置。數字由當前音訊片段加上右側上下文計算,尚未包含模型運算、網路、語音辨識與應用處理。縮短緩衝意味可供判斷的上下文減少,不能直接把 320 毫秒當成使用者看到字幕的時間。[延遲設定](https://huggingface.co/blog/nvidia/nemotron-diarization)
官方報告在 1.04 秒緩衝下,八項評測條件的語者分離錯誤率相對改善平均為 41%。這是各條件改善比例的未加權平均,並非把所有錄音合併計算的錯誤率,也不能推定每種中文會議都會得到相同提升。[評測口徑](https://huggingface.co/blog/nvidia/nemotron-diarization)
重現結果時,NeMo 評測程式要求資料清單對應標註時間檔,並提供邊界容許範圍、是否計入重疊語音與後處理設定。程式說明也提醒,重現模型卡成績需要相應後處理;直接使用預設二值化輸出,未必能得到相同分數。[評測程式](https://github.com/NVIDIA-NeMo/Speech/blob/main/examples/speaker_tasks/diarization/neural_diarizer/e2e_diarize_speech.py)
兩個說話者通道同時活躍,只能指出重疊發聲的時間;要把辨識出的某個詞分配給其中一人,仍需另外處理對齊與歧義。因此,部署端下一步應以中文、交錯語言、長停頓與多人插話錄音,測試完整逐字稿的歸屬錯誤及端到端延遲。本次查核未能讀取正式模型卡,權重下載條件仍待確認;公告中的效能結果也尚未經本次獨立重現。