模型與語音 AI
Meta Muse Voice Transcribe 將 ASR、說話者分離與端點偵測合併為單一串流模型
Meta 的新語音模型在同一解碼迴圈輸出逐字稿、說話者標籤及語句邊界,並以動態等待機制平衡準確率與延遲。英語串流評測表現領先且 API 價格低,但多語言品質、工作階段上限與封閉權重仍限制部署判斷。

Meta Superintelligence Labs 發布 Muse Voice Transcribe,將即時自動語音辨識(ASR)、說話者分離與端點偵測整合進單一自回歸模型。音訊以約 80 毫秒區塊編碼成軟 token;解碼器可輸出文字、說話者及語音事件 token,或要求讀取下一段音訊。相較於串接 VAD、ASR 和 diarization 模型的傳統架構,這種設計可減少元件間的時間軸漂移,也讓語音代理直接依端點事件決定何時回應。
模型的另一項核心是 adaptive delay。它不為每個詞採用固定等待時間,而是判斷現有聲學上下文是否足夠;容易辨認的詞可提早提交,模糊片段則等待更多音訊。Meta 表示這項策略經強化學習調整,在速度與準確率之間形成較佳的 Pareto 前緣。模型訓練涵蓋逾 70 種語言,首發驗證 25 種,支援句內語碼切換、關鍵字及上下文偏置,也能在模型層處理逾 20 名說話者。
Artificial Analysis 的英語加權 AA-WER Streaming 評測顯示,其最終逐字稿 WER 約 3.1%,偵測到語音結束後約 0.16 秒產生最終結果。不過這不能推論各語言具有相同品質:獨立測試在英語錄音中優於本機 Whisper large-v3-turbo,卻在單一印地語—英語混合樣本明顯落後,說話者與端點結果也不足以支援無人監督的高風險用途。
服務目前只透過 Meta Model API、Meta AI for Mac 與 Muse Code 提供,沒有開放權重;定價為每千分鐘 3 美元。公開 API 的即時連線最長約 60 分鐘且不能續接,檔案端點限制又更嚴,與官方展示的逾一小時模型能力並不等同。工程團隊下一步應實測中文口音、重疊發言、噪音與斷線重連,並確認逐字稿修訂語義、資料保留選項及服務區域,而非只依英語榜首決定遷移。