返回首頁

語音模型與開發者 API

Gemini 3.5 Transcribe 分拆串流與檔案端點,非串流 WER 降至 2.6%

Google 推出兩款語音轉文字端點,加入語言自動辨識、自訂詞彙偏置及智慧格式化。非串流模型準確率較高,但即時版本不支援說話者分離與逐字時間戳。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Google 於 8 月 26 日推出預覽版 Gemini 3.5 Transcribe,把錄音檔處理與即時語音辨識拆成 `gemini-3.5-transcribe`、`gemini-3.5-transcribe-live` 兩個端點。兩者均支援超過 85 種語言、對話中途切換語言、智慧格式化,以及最多 1,000 個詞彙的辨識偏置;模型卡顯示它們以 Gemini 3 Pro 為基礎,輸入與輸出上限分別為 96K、32K token。

非串流端點可處理最長一小時音訊,並提供逐字時間戳及最多八名說話者的分離;啟用這些功能後,單次音訊上限縮至 30 分鐘,而且三名以上說話者的歸屬仍屬實驗功能。Live 版本改走 WebSocket 雙向串流,單次工作階段限於十分鐘,也不提供時間戳或說話者分離,因此不能直接取代會議歸檔管線。

Artificial Analysis 的即時排行榜量得 Live 與非串流版本平均字錯率分別為 4.0%及 2.6%;後者在推出時並非榜首,仍落後部分專用辨識模型。Google 自行公布的多語 FLEURS 測試則為 5.50%及 5.04%,顯示語言組合與測試方法會顯著改變結果。付費 API 的估算成本約為每分鐘 0.009 美元及 0.005 美元,但計價包含音訊、輸出與隱藏的處理 token,實際帳單仍會隨輸出長度變動。

工程團隊尤其要區分「逐字紀錄」與智慧轉錄:後者會刪除贅詞、整理自我修正並重排格式,讀起來更乾淨,卻可能改變法律、醫療或稽核紀錄所需的原始表述。上線前應以自身口音、噪音、專有名詞和說話者重疊資料重測,不宜只依賴綜合 WER。

來源

  1. Intelligent transcription with Gemini 3.5 Transcribe
  2. Speech to Text AI Model & Provider Leaderboard
  3. Gemini 3.5 Audio model card