返回首頁

模型與語音 AI

Meta Muse Voice Transcribe 將 ASR、說話者分離與端點偵測合併為單一串流模型

Meta 的新語音模型在同一解碼迴圈輸出逐字稿、說話者標籤及語句邊界,並以動態等待機制平衡準確率與延遲。英語串流評測表現領先且 API 價格低,但多語言品質、工作階段上限與封閉權重仍限制部署判斷。

Member of the Expedition 22 crew. · Public domain · Image source
zh-Hant

Meta Superintelligence Labs 發布 Muse Voice Transcribe,將即時自動語音辨識(ASR)、說話者分離與端點偵測整合進單一自回歸模型。音訊以約 80 毫秒區塊編碼成軟 token;解碼器可輸出文字、說話者及語音事件 token,或要求讀取下一段音訊。相較於串接 VAD、ASR 和 diarization 模型的傳統架構,這種設計可減少元件間的時間軸漂移,也讓語音代理直接依端點事件決定何時回應。

模型的另一項核心是 adaptive delay。它不為每個詞採用固定等待時間,而是判斷現有聲學上下文是否足夠;容易辨認的詞可提早提交,模糊片段則等待更多音訊。Meta 表示這項策略經強化學習調整,在速度與準確率之間形成較佳的 Pareto 前緣。模型訓練涵蓋逾 70 種語言,首發驗證 25 種,支援句內語碼切換、關鍵字及上下文偏置,也能在模型層處理逾 20 名說話者。

Artificial Analysis 的英語加權 AA-WER Streaming 評測顯示,其最終逐字稿 WER 約 3.1%,偵測到語音結束後約 0.16 秒產生最終結果。不過這不能推論各語言具有相同品質:獨立測試在英語錄音中優於本機 Whisper large-v3-turbo,卻在單一印地語—英語混合樣本明顯落後,說話者與端點結果也不足以支援無人監督的高風險用途。

服務目前只透過 Meta Model API、Meta AI for Mac 與 Muse Code 提供,沒有開放權重;定價為每千分鐘 3 美元。公開 API 的即時連線最長約 60 分鐘且不能續接,檔案端點限制又更嚴,與官方展示的逾一小時模型能力並不等同。工程團隊下一步應實測中文口音、重疊發言、噪音與斷線重連,並確認逐字稿修訂語義、資料保留選項及服務區域,而非只依英語榜首決定遷移。

來源

  1. Introducing Muse Voice Transcribe
  2. Speech to Text Providers Leaderboard & Comparison
  3. Meta Muse Voice Transcribe: Benchmarks, Pricing, API Limits, and What It Changes