音訊模型
NAPE 只預測下一個聲譜 patch embedding,303M 音訊編碼器在 IEMOCAP 達 68.8%
Imperial College London 團隊以因果 Transformer、stop-gradient 與餘弦損失簡化音訊自監督預訓練。方法在六項分類測試呈現穩定擴展,但尚未證明可泛化至 ASR、生成任務或非 AudioSet 語料。

Imperial College London 團隊提出 NAPE(Next-Audio-Patch-Embedding prediction),把語言模型的下一步預測概念移到聲譜圖,但不建立離散 acoustic tokenizer,也不重建原始音訊。[論文](https://arxiv.org/abs/2608.19863)先把 16 kHz 單聲道音訊轉成 128-band log-mel spectrogram;每段十秒音訊切為 504 個 16×16 patch,因果 Transformer 根據先前 patch 預測下一個 patch 的連續 embedding。
訓練目標只有負餘弦相似度,目標分支停止梯度,另加一個非對稱 predictor head。消融顯示三項設計缺一不可:移除 prediction shift 會讓模型複製當前輸入,移除 stop-gradient 會令 embedding 收斂至共同常數;取消 causal mask 雖不會數值發散,卻可偷看目標 patch,令 AudioSet-20K mAP 下跌 14.3 點、ESC-50 準確率下降 25.4 點。這使 NAPE 不需要重建 decoder、EMA teacher、負樣本或額外正則化。
團隊以未標註 AudioSet 預訓練 19M、85M、303M 三種編碼器,使用約 198 萬個不平衡訓練片段及 2.1 萬個平衡片段。303M 版本在 AudioSet-2M 達 50.2 mAP、AudioSet-20K 達 40.5 mAP;對 IEMOCAP 情緒辨識,對角掃描版本達 68.8% 準確率,較表中最強既有結果高 4.3 點。三個尺寸在六項下游測試均隨規模上升,但 Base 擴至 Large 的邊際收益已開始縮小。
這項工作值得音訊工程團隊注意,因為它把複雜的遮罩重建或師生式預訓練縮成可直接描述的自回歸表徵目標。[Hugging Face 論文頁](https://huggingface.co/papers/2608.19863)列出的成果目前仍只來自作者。各基線分數取自原論文,並非全部在同一程式與算力下重跑;微調仍用了 SpecAugment、Mixup、CutMix、EMA 等完整增強堆疊。研究也只涵蓋事件、關鍵字與情緒分類,沒有端到端語音辨識、聲音生成、跨語言或長音訊測試。後續關鍵是作者是否公開權重與程式,以及簡化的預訓練目標能否真正降低總算力,而不只是減少架構元件。