返回首頁

語音 AI

Azure Speech LLM 2607 自動更新語音辨識,片語清單可提示逾 2,000 個實體

Microsoft 更新託管式 LLM Speech,主打混合語言、專有名稱與數字辨識,並宣稱部分情境延遲較 2605 版最多降低三倍。新版沿用現有 Fast 與即時 API,卻會在服務端自動部署,因此既有語音代理也需要自行建立回歸測試與版本觀測。

Coolcaesar · CC BY-SA 4.0 · Image source
zh-Hant

Microsoft 發布 Azure AI Speech LLM 2607,更新重點不是新增一套端點,而是在既有 Fast Transcription 與即時語音辨識服務中替換模型。官方表示,新版改善對話中途切換語言的混合語音、Tier 2/Tier 3 locale、標點、大小寫、數字以及人名與領域實體的辨識;相較 2605,特定內部測試的處理延遲最多縮短三倍。這對語音代理尤其重要,因為辨識延遲會直接占用使用者開口至代理開始推理之間的時間預算。

較具體的開發介面變化,是把專有詞提示放入獨立的 `phraseList.phrases` 欄位,而非混在泛用 prompt。清單可容納逾 2,000 個名稱、縮寫或術語;Fast API 可用 `2025-10-15` 版本,將音檔與 JSON `definition` 一起送至 `transcriptions:transcribe`。同一設定還能組合 `locales`、說話者分離、頻道選擇及敏感詞處理。這種結構化提示比自然語言指令更容易由產品目錄或企業詞庫自動產生,也較適合進行版本控管與逐批測試。

最大的風險來自發布方式:Microsoft 表示客戶無須操作,模型會在服務端自動更新。相同 API 呼叫因而可能在沒有程式部署的情況下,產生不同文字、延遲與實體偏好。官方只展示兩段範例,未公布各語言 WER、測試集、負載條件或三倍加速的分布;文件列出的多語 Fast 模型包含 `zh-CN`,但沒有足夠資料證明繁體中文、台灣口音及中英夾雜也獲得同幅改善。上線團隊應保留固定音訊集,分別量測 WER、專名召回率、即時尾部延遲及片語清單造成的誤替換,並記錄請求區域與時間,否則服務端更新後很難重現退化。

來源

  1. Announcing Azure AI Speech LLM 2607: Better Multilingual Accuracy, Easier Customization
  2. Use the LLM Speech API
  3. Transcriptions - Transcribe REST API
  4. Azure AI Speech LLM 2607 Rolls Out Automatically: Test Before You Trust the Gain