返回首頁

推論系統

PELM 聯合調節 DVFS 與推測解碼,端側 LLM 能耗最多降低 52.4%

PELM 不只調整處理器頻率,還動態選擇推測解碼設定與驗證深度,在熱限制下共同控制硬體和模型工作量。論文報告最高 23.1% 加速及 52.4% 節能,但峰值結果不能直接外推到手機或其他模型。

Felix König · CC BY 3.0 · Image source
zh-Hant

端側 LLM 的瓶頸不只是算力;長時間生成會累積熱量,引發降頻,讓固定在最高時脈執行反而未必最快或最省電。獲 SenSys 2026 接收的 PELM 將這項問題視為跨硬體與解碼器的聯合控制:除了 CPU/GPU 的動態電壓與頻率調整(DVFS),系統也改變推測解碼配置及目標模型的驗證深度。

推測解碼先由較小的草稿模型提出 token,再交給目標模型驗證。PELM 的核心觀察是,不同 token 不一定都需要相同深度的完整驗證;線上控制器因而根據速度、使用率、功耗與溫度等回饋選擇動作,在輸出品質、延遲和能源之間最佳化。團隊在多種硬體、模型與資料集上的實驗,對比既有功率治理方法,報告最高 23.1% 速度提升與 52.4% 能耗下降,同時維持相近任務表現。

這對工程端的重要性在於,節能策略可從「只管晶片時脈」擴展到「同時改變每個 token 的推論成本」;在無風扇、電池供電或長時間運作的裝置上,可能比單純量化更能處理熱節流。團隊已公開實驗程式,參考環境指定 JetPack 6.2.1、PyTorch 2.8.0 與 Transformers 4.53.2,啟動腳本亦會設定風扇、溫控和 DVFS。

不過,52.4% 是跨設定中的最佳值,而非所有工作負載的平均保證;動態降低驗證深度也使品質是否「相近」取決於所用基準。後續應觀察控制器面對互動式流量、長上下文、背景程式及不同 SoC 時是否仍穩定,以及節能是否伴隨尾端延遲或罕見輸出錯誤增加。

來源

  1. PELM: Power Efficient On-Device LLM Inference with Speculative Decoding and Dynamic Voltage Frequency Scaling
  2. imec-nu/PELM:SenSys ’26 程式與實驗資產