Back Home

語音辨識與端側AI

Granite Speech 5.0 移除 LLM 骨幹,以 470M CTC 模型換取逾 12,600 RTFx 批次轉錄

IBM 的兩款英語語音辨識模型把輸出速率降至每秒12.5個token,並以三段時間下採樣減少運算。官方在單張H200測得每秒處理逾3.5小時音訊,但這是大批次吞吐量,不等同互動串流延遲。

zh-Hant

IBM 釋出 Granite Speech 5.0 470M Turbo CTC 與其非商業版,兩者均是專用英語自動語音辨識模型。相較 Granite Speech 4.1 把聲學編碼器、投影層與帶 LoRA 的 Granite 語言模型串接,新版完全移除 LLM 骨幹,只保留16層Conformer編碼器與CTC輸出。這把參數量壓至4.7億,官方稱吞吐量較上一代提高逾20倍。

主要改動是降低時間解析度。音訊先轉成每秒100幀的log-Mel特徵,再經三次2倍下採樣降至每秒12.5個token;後兩次下採樣由首兩個Conformer區塊的stride convolution完成。模型亦採chunkwise attention,避免標準注意力隨音訊長度呈平方增長。Apache 2.0版本使用BPE tokenizer;加入GigaSpeech及SPGI Speech等受限資料的版本改用SentencePiece,授權為CC-BY-NC-SA-4.0。

IBM在Hugging Face OpenASR公開短音訊測試集報告:商用版聚合字錯率為5.00%,非商業版為4.85%;兩者在單張NVIDIA H200的大批次測試均超過12,600 RTFx,即一秒可處理逾3.5小時錄音。遠場語音榜中,兩款模型分別排名第九及第五,並是當時速度最快的兩個提交。模型已接入Transformers主分支,但正式版本發布前仍需從原始碼安裝。

工程取捨相當明確:移除語言模型使高容量轉錄及端側部署更容易,卻同時失去舊版的語音翻譯、關鍵字偏置等能力,而且只針對英語。12,600 RTFx依賴加速器和批次聚合,不能用來推算單一串流的首字延遲;手機、瀏覽器與CPU效能仍需個別量測。兩種權重的資料及授權差異也意味著,不能只按較低字錯率選擇生產模型。

Sources

  1. Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTC
  2. Granite 4.2 brings native reasoning to enterprise agents