ホームへ戻る

AI 研究

Whisperのエンコーダーを6層削減、蒸留後も4言語の平均誤り率は元モデルを上回る

ラベルなしの英語音声を使った蒸留により、枝刈り後の認識性能を部分的に回復。速度測定で示された1.75倍にはバッチサイズ変更の効果も含まれ、同一バッチサイズでの効果と中国語の認識品質はそれぞれ評価する必要がある。

Cs-wolves · CC BY-SA 4.0 · Image source
zh-Hant

9月23日に公開された研究『Six Layers Less』は、Whisper large-v3-turboのエンコーダーを32層から26層に削減し、知識蒸留で認識性能を回復させた。この手法は元のネットワークの演算形式を維持し、既存の推論フレームワークを引き続き利用できる圧縮方法を示している。ただし、評価対象の4言語における平均単語誤り率は、依然として元モデルを上回っている。[論文](https://arxiv.org/abs/2609.27980)

著者らはまずエンコーダー層を1層ずつ除去し、単語誤り率の変化に基づいて順位を付け、影響の小さい6層を削除した。公開リポジトリには、層の選択、枝刈りのスイープ、蒸留、ランダムな層選択による対照実験の手順が示されている。蒸留の実行例では英語音声を使って2,000ステップ学習し、縮小したエンコーダーに平均二乗誤差を用いて元モデルの隠れ表現を学習させる。したがって、「ラベルなし」が指すのは性能回復のための学習であり、それに先立つ層の選択は、依然として参照用の書き起こしを伴う認識評価に依存している。[再現手順](https://github.com/rasgaard/whisper-encoder-layer-prune)

論文によると、デンマーク語、英語、ドイツ語、フランス語の平均単語誤り率は、元モデルの18.2%から枝刈り直後には21.9%に上昇し、蒸留後には20.1%まで低下したものの、元モデルより1.9ポイント高かった。モデルの縮小には、このように測定可能な精度低下が伴うため、回復効果を能力の完全な維持と解釈することはできない。また、中国語はこの評価に含まれていない。[結果と手法](https://arxiv.org/html/2609.27980v1)

性能の数値については、特に比較の基準を確認する必要がある。論文ではM4 Proを使い、60秒の英語音声を処理している。表では、バッチサイズ8の枝刈り済みモデルにエンドツーエンドで1.75倍の高速化と記されているが、基準はバッチサイズ1の元モデルだ。同じ表で、バッチサイズ8の元モデルはすでに1.50倍に達している。そのため、表の数値から換算すると、同一バッチサイズで枝刈りがもたらす高速化は約1.17倍となる。バッチサイズ1では1.08倍だ。先の1.75倍という数値を、すべて6層の削除による効果とみなすことはできない。[速度測定の表と注記](https://arxiv.org/html/2609.27980v1)

中国語の音声サービスにとって、公開された手順は再検証の足掛かりになるが、方言、固有名詞、ノイズ、長時間録音における品質の問題はまだ解明されていない。もう一つの制約は、層の選択と結果の評価の両方に、論文で述べられたFLEURSのテストセットを使用している点だ。導入に向けた評価では、選択過程が汎化性能の判断に影響しないよう、独立したデータを別途確保することが望ましい。次の段階では、バッチサイズ、デコード設定、ハードウェアをそろえて再測定し、人手による修正コストも含めて、計算量の削減に見合う価値があるかを判断する必要がある。

独自の音声ドメインに合わせて層を選び直す場合は、層の選択に必要なアノテーションと評価のコストも計上しなければならない。蒸留のステップ数だけを数えると、工程全体のコストを過小評価することになる。今回の結果が示すのは検証可能なトレードオフであり、より多くの言語と幅広い録音条件で裏付ける必要がある。

出典

  1. Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery
  2. Six Layers Less 論文全文與測速表
  3. whisper-encoder-layer-prune:剪枝與蒸餾重現流程