模型推論與量化
BaKron 將雙側 Hessian 量化降至三次複雜度,8192 方陣核心較 YAQA 快 60 倍
BaKron 以反對角線平行化及遞迴分治,在保留輸入、輸出兩側曲率資訊時把總工作量由四次降至三次。Llama 3 8B 的 2.81-bit 實驗改善 GPTQ 的困惑度,但整體量化時間仍更長,且目前未見公開實作。

BaKron 要解決的是 GPTQ 類後訓練量化的資訊取捨。GPTQ 以校準資料的輸入相關矩陣調整逐權重捨入,相當於使用 `A⊗I` 形式的 Hessian,忽略不同輸出座標間的關聯。BoA、YAQA 等雙側方法把它擴充為 `A⊗B`,能同時描述輸入與輸出幾何,但直接在向量化權重上操作需要四次方工作量。BaKron 沿反對角線批次處理相互獨立的更新,再以分治重用矩陣乘法,把 m×n 權重矩陣的核心成本降至 `O(mn(m+n))`,循序深度則維持 `O(m+n)`。
在單張 NVIDIA RTX PRO 6000、float32 自訂 Triton 核心的微基準中,BaKron 處理 8192×8192 矩陣需 1.839 秒,YAQA 等價實作需 110.379 秒,核心加速 60 倍;4096×14336 與反向形狀亦約快 43 倍。不過 GPTQ 處理同一 8192 方陣只需 0.059 秒,因為它仍使用較簡單的單側幾何。BaKron 的價值因此不是擊敗 GPTQ 的速度,而是把原本難以擴展的雙側量化降至與 GPTQ 相同的三次複雜度等級。
品質測試以每權重約 2.81 bit 量化 Llama 3 與 Qwen3。Meta-Llama-3-8B 上,GPTQ 的 WikiText2 困惑度為 53.47;使用反向傳播 K-FAC Hessian 的 BaKron 降至 11.90,未量化模型為 7.44。然而該 BaKron 流程耗時 1,939 秒,GPTQ 為 530 秒,顯示 Hessian 累積、校準資料前後向傳播及 Cholesky 分解仍支配端到端成本。論文也只在單一 GPU、特定縮放與 2.81-bit 設定下評估,且沒有附公開程式碼;工程團隊應等待實作、更多位元寬及實際推論吞吐量驗證。