語音模型
VibeVoice-ASR-Streaming 將逐段辨識與說話者歸屬合併,開源 1.5B、7B 權重
Microsoft Research 的串流語音模型交錯處理音訊區塊、短暫前視與既有逐字稿,直接輸出「誰說了什麼」。公開版本支援十種語言與自訂熱詞,但預期說話者歸屬延遲仍為兩秒,長時間重疊語音也會退化。

Microsoft Research 開源 VibeVoice-ASR-Streaming 的 1.5B 與 7B 權重、推論程式及 vLLM 服務路徑。與先完成逐字稿、再執行 speaker diarization 的串接系統不同,新模型在單一自回歸序列中交錯放入固定音訊區塊、少量未來音訊及先前產生的文字與說話者標記,因而能在錄音持續進入時直接輸出「誰說了什麼」。
公開 checkpoint 採 22-frame、約 2.9 秒的音訊區塊,另保留 4 frame、約 0.5 秒的 lookahead;論文據此計算預期說話者歸屬延遲為 2.00 秒。架構沿用低幀率聲學與語意 tokenizer,再以語言模型維持歷史語音、文字及說話者狀態。它支援中文、英文、日文、韓文等十種語言,也能輸入人名或專業術語作為 hotwords,適合會議字幕及多人語音代理等需要即時區分發言者的場景。
作者在四種會議錄音條件及九語 MLC-Challenge 上比較部署中的串流服務。7B 版本在五組純辨識測試取得最低平均 WER/CER,加入說話者歸屬後,在 13 個設定中的 12 個最佳或並列最佳;相對 Azure ConversationTranscriber,會議基準的 cpWER/cpCER 改善 2.39 至 12.45 點。不過這些仍是研究團隊使用特定正規化與資料集所得的結果,並非各語言、噪音環境及硬體成本的全面獨立評測。
模型目前只能把重疊發言序列化到單一輸出流,長時間多人同時說話會明顯退化;語言擴充也受 Qwen3 ForcedAligner 可支援範圍限制。工程團隊下一步應實測首包與穩態延遲、GPU 記憶體占用、長會議漂移,以及熱詞是否犧牲一般詞彙準確率。