模型量化與推論
ReRound 用擴散先驗重選量化捨入,3/4 位元小模型平均準確率最高增加 1.6 點
ReRound 不使用校正語料,而是從模型自身權重訓練條件式擴散模型,重新判斷接近量化區間中點的權重應向上或向下捨入。部署時維持原有低位元格式且沒有額外推論負擔,但每款模型須先支付數小時的專屬重建成本。

低位元量化通常把權重交給 round-to-nearest(RTN),但接近兩個量化值中點時,向上或向下的純量誤差幾乎相同,微小選擇累積後仍可能改變整個線性層。8 月 11 日公開的 [ReRound](https://arxiv.org/abs/2608.11045) 專門重查這些模稜兩可的捨入決策,而且不讀取校正文字、activation 或下游標籤。
方法先從待量化模型的權重矩陣裁出 64×64 區塊,訓練條件式 U‑Net 擴散模型,由低位元觀測重建連續權重。重建值只充當捨入方向的先驗,不會成為部署權重;離區間中點較遠時仍保留 RTN。不同容許度會產生多組整數權重候選,系統再比較反量化矩陣與原始矩陣的前導奇異值,選出較能保留主要變換結構的一組。
在 Gemma、Qwen3、OLMo、SmolLM2、Llama、Pythia 與 Phi 等八款 1B 至 2.7B 模型上,ReRound 在相同 scale、zero-point、群組大小 128 及量化層範圍下,3 位元與 4 位元的四任務平均分數都高於 RTN,增幅為 0.1 至 1.6 個百分點。它在六款模型的 4 位元比較中也勝過使用 128 筆 C4 校正樣本的 AdaRound,最多高 1.9 點。
代價集中在離線階段:論文列出的擴散訓練需兩張 GPU、約 1.76 至 3.43 小時,單 GPU 重建另需 3.65 至 9.55 小時;完成後,實際量化約 42 至 124 秒,推論格式與 RTN 相同。[程式庫](https://github.com/louisYen/ReRound)已提供 RTX 3090/4090 配方。工程團隊仍應注意,評測只有四項零樣本任務及單一種子,光譜相似亦不保證特定下游任務最佳;每個 checkpoint 都重新訓練擴散模型,對大量模型版本可能不划算。