Back Home

推論系統/模型壓縮

PTQ4SNN 同時量化權重與膜電位,事件分類僅損失 1 個百分點

PTQ4SNN 把脈衝神經網路長期保留的浮點膜電位納入後訓練量化,按通道配置 2、4 或 8 位元。論文在分類與語意分割上接近浮點模型,但硬體收益仍來自分析模型,且專用程式尚未公開。

zh-Hant

脈衝神經網路的輸出雖是二進位 spike,LIF 神經元仍須跨時間步保存膜電位。現有低位元方法若只把權重量化,這些循環狀態依舊佔用浮點記憶體與讀寫頻寬;直接共用權重尺度又可能在放電閾值附近改變 spike,讓誤差沿時間累積。

PTQ4SNN 以少量校準資料處理這個缺口,不重新訓練主幹。它先把線性或卷積投影與後續 LIF 神經元組成可重用單元,再令每個通道的膜電位尺度滿足 `s_mem,c = s_w,c × 2^k`。尺度轉換因此可用位移完成,同時又比完全共用權重尺度更能配合膜電位分布。第二個元件依放電率及量化敏感度,在平均約 4-bit 的預算下,為各通道配置 2、4 或 8 位元。

在 CIFAR10-DVS 的 SDT-2-256 上,W4/M4 的 Acc@1 為 70.80%,比浮點 checkpoint 低 1.00 個百分點;FlowQ 在同表為 67.30%。Pascal VOC2012 語意分割則得到 59.77 mIoU,只比浮點模型低 0.67 點,FlowQ 的降幅為 11.03 點。ImageNet-1K 的 SDT-8-768 與 Meta-SpikeFormer 分別達 75.16% 與 78.50%,距浮點版本為 0.74 與 0.38 點。

作者另以 32-nm、400-MHz、8×16 PE 的分析模型估算 SEW-ResNet18 狀態成本:混合精度配置把膜電位儲存量由 2.219 MiB 降至含中繼資料的 0.392 MiB,正規化 SRAM 讀寫能耗為 0.177。不過這不是晶片量測,實際效益仍取決於快取、排程、低位元封裝與目標硬體是否支援通道級混合精度。論文也未附 PTQ4SNN 程式庫;目前只能取得其採用的 Spike-Driven Transformer 類主幹。工程團隊應等待校準程式與實機核心,特別驗證不規則位寬是否抵銷理論上的頻寬收益。

Sources

  1. PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks
  2. Spike-Driven Transformer V2 reference implementation
  3. CIFAR10-DVS: An Event-Stream Dataset for Object Classification