語音模型
Xiaomi-CocktailASR-1 以聲紋提示鎖定混合語音,AliMeeting 遠場字錯率降至 20.63%
小米提出端到端目標說話者 ASR,把一至四秒參考語音和混合錄音送入同一音訊編碼器,不先執行語音分離。模型也能在目標缺席時輸出空字串,但訓練大量依賴未公開資料,且首版報告尚未提供可驗證權重與程式。

多人同時說話時,傳統語音辨識通常會混合轉錄所有聲音;目標說話者 ASR(TS-ASR)則需依聲紋只輸出指定人物。小米 9 月 10 日提交的 Xiaomi-CocktailASR-1 技術報告,將一至四秒參考語音、一秒靜音及待辨識混合音訊依序串接,以參考片段作為聲紋提示,避免先做目標語音分離再辨識所造成的兩階段誤差。
架構由 6 億參數、源自 Data2Vec2 的音訊編碼器開始,將 FBank 特徵轉為同時包含語意與說話者資訊的 1,280 維表示;線性 Adapter 再把音訊映射至以 Qwen3-8B 為基礎的語言模型空間。團隊以約 40 萬小時多人資料、60 萬小時單人資料及一萬小時「參考人物不在錄音中」的負樣本,分四階段完成基礎 ASR、目標說話者訓練、思維鏈資料訓練與最終 SFT/強化學習。
在英文 LibriMix 兩人混音中,報告的目標說話者 WER 為 4.11%,較列出的 TCP 基線 4.84% 相對下降 15.1%;LibriSpeechMix 兩人混音由既有 5.40% 降至 2.90%。真實遠場資料的 AMI-SDM WER 為 21.81%,中文 AliMeeting-Far 字錯率為 20.63%,後者低於報告引用的 MC-TS-ASR 27.50%。模型另以錯配聲紋負樣本學習直接輸出空字串,不需部署者另設拒絕閾值。
這種統一介面適合會議、穿戴裝置與智慧家庭,但目前證據主要來自團隊自行設計的評測。約百萬小時訓練音訊多數未公開,不同基線的資料量與專門化程度也不完全一致;所謂思維鏈是以說話者數量、性別和外部 CAM++ 相似度模板建立,不能視為模型決策的忠實解釋。截至首版論文,公開頁面亦未列出權重或推論程式,實際延遲、記憶體需求與第三方重現仍是下一個檢驗點。