模型推論與壓縮
ICBQ 重查量化區塊接縫,Qwen3‑8B 的三值模型困惑度由 5752.9 降至 29.9
ICBQ 不更換量化器,而是讓相鄰 Transformer 區塊的邊界接受第二次聯合校正,減少早期誤差沿深度累積。品質改善的代價是量化時間平均增加 21%,且作者尚未釋出實作。

現有跨區塊後訓練量化通常以兩個 Transformer block 為視窗,從模型前端一路向後校正;視窗移走後,較早產生的誤差便不會再被處理。Interleaved Cross-Block Quantization(ICBQ)改變的不是權重編碼或損失函數,而是排程:它把網路切成多個 chunk,讓每個 chunk 接縫上的區塊對先在前一段末端最佳化,再於下一段開頭重做一次。
這項設計可套在三值 DBF,也可把 GPTQ 當作內部量化器。以 C4 校準的三值實驗為例,Qwen3‑8B 在一般循序跨區塊量化下的困惑度為 5752.9;採用 chunk size 4 的 ICBQ 後降至 29.90。Mistral‑7B 由 31.1 降至 16.8,Qwen3‑14B 則由 44.82 降至 24.67。七款主要模型的三值比較全部取得較低困惑度,平均零樣本準確率則在六款持平或較高;Llama‑2‑13B 是例外,循序版本僅高 0.0002。
效果並非免費。11 款模型的完整量化時間平均變成循序方法的 1.21 倍;Qwen3‑14B 由約 15 小時增至 19 小時 39 分。保存校準 activation 也增加記憶體,7B/8B 級設定約多 4.3GB,13B/14B 級約多 5.2GB。這是離線產生 checkpoint 的品質與成本交換,不能解讀成推論吞吐提升。
工程上值得注意的是,低位元量化的失敗可能源自最佳化順序,而不只是量化碼本。既有 GPTQ 或跨區塊管線可嘗試加入接縫重訪,但應同時量測校準時間、峰值記憶體、下游任務與實際核心速度。論文尚無程式碼或量化 checkpoint;在獨立重現前,Qwen 的巨大改善也可能高度依賴作者的 DBF 實作與校準配置。