返回首頁

AI 研究

Whisper 剪除六層編碼器,蒸餾後四語平均錯誤率仍增加

研究利用英文無標註語音蒸餾,部分恢復剪枝後的辨識能力。測速中的 1.75 倍包含批次改變,相同批次效益與中文品質須分別評估。

Cs-wolves · CC BY-SA 4.0 · Image source
zh-Hant

9 月 23 日公開的《Six Layers Less》研究,將 Whisper large-v3-turbo 的編碼器從 32 層減至 26 層,再以知識蒸餾修復辨識能力。這種做法保留原有網路運算形式,提供沿用既有推論框架的壓縮路線;但四種受測語言的平均詞錯誤率仍高於原模型。[論文](https://arxiv.org/abs/2609.27980)

作者先逐一移除編碼層,依詞錯誤率變化排序,再刪除影響較小的六層。公開儲存庫列出選層、剪枝掃描、蒸餾及隨機選層對照流程;蒸餾範例使用英文語音,執行兩千步,讓縮小後的編碼器以均方誤差學習原模型的隱藏表示。因此,「無標註」描述的是恢復訓練;前面的選層仍依賴帶參考逐字稿的辨識評測。[重現流程](https://github.com/rasgaard/whisper-encoder-layer-prune)

論文在丹麥語、英語、德語與法語的平均詞錯誤率,由原模型的 18.2% 升至直接剪枝後的 21.9%,蒸餾後降至 20.1%,仍增加 1.9 個百分點。縮小模型因此涉及可量測的準確率代價,不能將恢復效果理解為完全保留能力;中文也未納入這組評測。[結果與方法](https://arxiv.org/html/2609.27980v1)

效能數字尤其需要核對分母。論文以 M4 Pro 測試一段六十秒英文音訊,表中批次八的剪枝模型標示端到端加速 1.75 倍,但基準是批次一的完整模型。同表批次八的完整模型已達 1.50 倍,因此按表值換算,相同批次下剪枝帶來約 1.17 倍加速;批次一則為 1.08 倍。前者不能全部歸因於刪除六層。[測速表與註解](https://arxiv.org/html/2609.27980v1)

對中文語音服務而言,公開流程提供了重驗入口,尚未回答方言、專有名詞、噪音與長錄音的品質問題。另一個限制是選層與結果都使用所述 FLEURS 測試集,部署評估宜另留獨立資料,避免選擇過程影響泛化判斷。下一步應在相同批次、解碼設定與硬體下重測,並將人工修訂成本一併納入,才能判斷節省運算是否值得。

若使用自己的語音領域重新選層,還要把選層所需的標註與評測成本計入;只計蒸餾步數會低估完整流程。此次結果提供的是一組可檢驗的取捨,仍需要更廣語言與更多錄音條件支持。

來源

  1. Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery
  2. Six Layers Less 論文全文與測速表
  3. whisper-encoder-layer-prune:剪枝與蒸餾重現流程