返回首頁

語音模型

X-AuT 逐級裁剪 Qwen3-ASR 音訊塔,車載編碼延遲降低 21.4%

小鵬以行為探針、跨尺度蒸餾及 LoRA,把 Qwen3-ASR-0.6B 的音訊編碼器由 18 層縮至 14 層。權重與推論程式已公開,但完整蒸餾流程及逾 28 萬小時訓練資料仍未釋出。

Ogidya · CC BY-SA 4.0 · Image source
zh-Hant

小鵬 AI 公開 X-AuT,嘗試只壓縮語音大模型的音訊塔,同時維持既有文字解碼器。直接刪除 Transformer block 會改變送入解碼器的音訊嵌入,常見後果是大量漏字或過早輸出 EOS;X-AuT 因此不把單層重要度當成固定規則,而以短週期「行為探針」實際測試不同刪層組合的可恢復性。

壓縮分成 18→16→14 層兩步。每一步先對中間表示、bridge 輸出及 logits 做對齊,再由凍結的 Qwen3-ASR-1.7B 教師執行跨尺度蒸餾;訓練會逐漸把解碼上下文從教師輸出切換為學生自己的輸出,最後才以較低學習率進行 LoRA 微調。0.6B 學生的語言模型主幹保持凍結,只有解碼器 attention adapter 與特定輸出元件參與恢復。相同 16 層設定下,大型教師的宏平均錯誤率為 5.55%,自蒸餾則為 8.45%,顯示教師尺度對修復刪層造成的介面偏移很重要。

在十項中英文公開 ASR 基準上,16 層版本的 CER/WER 宏平均由原模型的 5.61% 降至 5.27%;14 層版本為 5.75%,音訊塔參數從約 186.38M 減至 147.79M。後者在車載 PPU 與 H800 的編碼器延遲分別降低 21.4% 和 11.4%,但端到端改善只有 4.7% 和 2.6%,因未裁剪的 28 層文字解碼器仍主導整體時間。

公開內容包含 14 層完整權重、獨立推論腳本及精簡 LoRA 範例,卻不含行為探針、前兩階段蒸餾程式或原始資料管線。所有基準又是單次最佳 checkpoint,沒有多亂數種子或信賴區間;14 層模型也僅在兩項基準優於基線。因此值得追蹤的是完整訓練能否重現,以及方法能否跨語言、模型架構和串流批次維持同樣收益。

來源

  1. X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
  2. XPENG-AI/X-AuT model card and released artifacts