AI 推論系統
WIDE 讓每個 token 動態裁切模型寬度,解碼端到端加速 1.55 倍
WIDE 讓每個 token 自行選擇注意力頭與 FFN 通道群組,將動態剪枝從逐層決策推進至神經元區塊。論文在 50% 稀疏度下報告 prefill 與解碼端到端加速 1.68 倍、1.55 倍,但仍仰賴客製核心與額外訓練。

大型語言模型的「寬度」通常在部署前固定:每個 token 都通過相同數量的注意力頭與前饋網路通道。7 月 30 日公開的 WIDE 改以 token 為單位配置計算量,讓不同 token 動態選擇 attention-head group 與 FFN-channel group;容易處理的 token 可跳過更多區塊,較困難者則保留較完整的模型寬度。這比只跳過整層的 dynamic depth 更細,也同時涵蓋 prefill 與逐 token decode。
訓練分成兩階段。系統先學習各 token 的稀疏選擇,再調整模型以適應動態執行路徑。真正困難之處在硬體:零散遮罩未必能節省 GPU 時間,因此團隊加入 mask reordering,把被選中的頭與通道重新排列成較連續的區塊,再結合與硬體無關的 block skipping,以及針對裝置實作的 intra-block skipping。這使方法不只減少理論 FLOPs,而能轉成核心與端到端延遲改善。
論文稱,在 50% 稀疏度及僅使用校準資料的設定下,WIDE 相較既有動態深度剪枝保留更多品質,效能指標提高 55.1%。其客製核心最高帶來 1.98 倍 prefill、4.95 倍 decode 加速;包含其餘推論開銷後,端到端數字降為 1.68 倍與 1.55 倍。這個落差正是部署時應關注的重點:剪掉一半計算不代表服務吞吐能翻倍。
程式已放入 EIT-NLP 的 LLM-Pruning 儲存庫,方便檢查訓練與核心設計。不過結果目前仍來自作者選定的模型、GPU、批次與序列長度;動態路由還會增加遮罩、重排及核心維護成本。下一步要看它能否整合 vLLM、SGLang 等連續批次執行器,並在不同 GPU、量化模型與高併發服務下維持收益。