ホームへ戻る

模型壓縮與推論

QAH 讓 60B MXFP4 模型在 9 項評測中有 7 項超越同架構 BF16 版本

Multiverse Computing 改由原始 120B 模型直接蒸餾經結構壓縮及量化的 60B 學生模型,避免把中間恢復模型的誤差當成學習上限。結果顯示 4-bit 模型可超越同架構 BF16 檢查點,但未全面追回原始教師的能力。

zh-Hant

Multiverse Computing 公布 Quantization-Aware Healing(QAH),處理大型語言模型先經結構壓縮、再降至 4-bit 後的能力損失。常見量化感知訓練(QAT)會以任務標籤重新訓練低精度模型;量化感知蒸餾則通常把同架構的全精度版本當教師。然而經刪層、裁剪注意力頭或移除神經元後,較小架構並沒有獨立預訓練的全精度教師,只有由原模型恢復而來、已帶有損失的 BF16 檢查點。

QAH 跳過這個中間教師,讓 60B、MXFP4 學生直接匹配原始 GPT-OSS 120B 的輸出分布。教師 logits 預先離線計算,訓練以 KL divergence 為目標;長至 32K token 的樣本則分塊計算損失,避免同時具現化完整的序列乘詞彙表張量。

作者測得 QAH 模型在 9 項評測中有 7 項超越同架構的 60B BF16 恢復版本:AA-LCR 增加 7.4 分、AIME 2025 增加 5.6 分,Aider、τ²-bench、GPQA Diamond、IFBench 與 LiveCodeBench亦有提升;MMLU-Pro及SciCode則分別落後0.2及1.4分。與matched QAT實驗相比,QAH約100步達到54.9平均分,QAT約700步才達54.6,且QAT繼續訓練至1,200步後下降近19分。

這不代表4-bit版本全面勝過原始120B教師:它只在LiveCodeBench略高,多數項目仍落後。結果亦來自單一壓縮管線和作者選定的評測,尚缺其他模型家族及獨立重現。部署團隊還應留意論文報告的分散式訓練後端品質差異;QAH降低的是權重記憶體與每token計算量,並未直接證明所有硬件上的端到端延遲或成本降幅。

出典

  1. Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
  2. Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs