返回首頁

模型訓練

漸進加深 Transformer 時 Post-Norm 反勝 Pre-Norm,9 層學生模型 CE 低 0.0328

一項 Qwen3-8B 蒸餾實驗發現,完整深度共同訓練時兩種正規化位置幾乎沒有差別,但逐階段加入 Transformer block 後,Post-Norm 明顯勝出。結果顯示正規化位置不能脫離模型成長策略單獨選擇。

Ministerstvo dopravy, pôšt a telekomunikácii SR · Public domain · Image source
zh-Hant

現代解碼器通常採用 Pre-Norm:先正規化再進入 attention 或 MLP,藉此改善完整深度模型初始化時的梯度穩定性。然而 8 月 13 日提交的新研究指出,若模型不是一次訓練全部層,而是由淺至深逐步加入 block,這項慣例可能需要重估。

研究以 36 層 Qwen3-8B-Base 作凍結教師,建立包含九個 decoder layer、約 30.9 億參數的學生模型。共同訓練全部九層時,Pre-Norm 與 Post-Norm 的驗證交叉熵只差 0.0004;採用三階段 depth-growing curriculum 後,Post-Norm 的 CE 則比 Pre-Norm 低 0.0328。加入更多訓練 token、匹配 active-layer token 數及重新啟動學習率的固定深度對照組,最終 CE 仍高於 Post-Norm 成長模型的 2.7330,表示差異不能只以額外運算量解釋。

診斷結果提供了可能機制:新增 block 接收到的是已訓練前綴產生的 residual stream。Pre-Norm 不直接約束跨 block 輸出的尺度,其每 token RMS 標準差由 5.81 漂移至 19.98;Post-Norm 維持約 0.07 至 0.19。漂移尤其集中於文件邊界等結構 token。移除最後一個 Pre-Norm 成長 block,CE 僅改變 0.02,顯示該層接近 identity mapping;移除任一 Post-Norm 成長 block,CE 至少上升 2.38。

這對漸進式預訓練、模型擴深及蒸餾排程具有直接意義:架構搜尋應把 normalization placement 與 growth schedule 視為聯合超參數。不過證據仍限於單一 Qwen 教師、九層學生、3.11B-token 固定資料 shard 與特定蒸餾設定;作者也只提供相關性診斷,尚未直接干預 residual 尺度。下一步應在更深模型、不同資料分布及從零預訓練中重現交叉反轉。

來源

  1. Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing
  2. Qwen3-8B Model Card