返回首頁

語音 AI

MAI-Transcribe-2 將多人分離與逐字時間戳整合進單一語音 API,批次速度達即時音訊 410 倍

Microsoft 新語音辨識模型涵蓋 60 種語言,原生提供說話者分離、術語偏置、語碼轉換及逐字時間戳。獨立 API 測試顯示其錯字率與批次吞吐量俱佳,但限時價格、中文分項品質及串流延遲仍待驗證。

Steven C. Price · CC BY-SA 4.0 · Image source
zh-Hant

Microsoft 發布 MAI-Transcribe-2,把過去常需串接後處理服務的說話者分離、逐字時間戳與輸出風格控制納入同一套語音轉文字模型。API 可自動辨識語言、用關鍵詞偏置提高專有名詞命中率,並在「verbatim」與移除贅詞的「clean」轉錄間切換;官方亦特別強調 Hinglish、Spanglish 等句內語碼轉換,以及噪音、重疊說話和長音訊。

官方宣稱模型在 FLEURS 的 60 種語言平均字詞錯誤率為 5.2%,但未公開各語言明細。這點對中文部署尤其重要:跨語言平均值可能掩蓋繁體中文、口音、專業詞彙與中英混說的差異,FLEURS 本身也主要是朗讀語音,不能代表客服通話或多人會議。

較可交叉檢驗的是 Artificial Analysis 經公開 API 執行的非串流測試。其目前資料顯示 MAI-Transcribe-2 的 AA-WER 為 2.0%,每秒可處理約 410.7 秒音訊;GPT-Transcribe 為 3.3%/40.0 倍,Scribe v2 為 2.2%/53.6 倍,Gemini 3.5 Transcribe則為 2.6%/89.9 倍。這讓新模型落在準確率與速度的 Pareto 前緣,但 Nova-3 的 606.1 倍仍更快,只是錯誤率較高。

工程上的直接影響是批次字幕、錄音封存與語音資料標註可用較少等待時間完成,並減少分離、標點與時間對齊管線之間的誤差傳遞。模型已透過 Microsoft Foundry、MAI Playground 與 OpenRouter 提供,限時價格為每小時 0.10 美元,至 2026 年底止。

部署前仍應以自身的中文口音、通話編碼、多人重疊及領域詞彙建立測試集。Artificial Analysis 使用約八小時、偏重英語商務場景的資料,速度則以十分鐘檔案近七日中位數計算;它不能回答短音訊首回應、即時串流、上傳排隊或尖峰併發的端到端延遲。Microsoft 也尚未公開模型架構、參數量、權重或完整逐語言結果。

來源

  1. MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world
  2. Speech to Text AI Model & Provider Leaderboard