推論系統/MoE
ACE 依 token 跳過低貢獻 MoE 專家,A100 預填最高加速 2.25 倍
ACE 從 SwiGLU 權重與路由器方向預估專家貢獻,不需重訓模型或使用校正資料。作者在三款 MoE 模型上取得較佳的高跳過率品質,但速度數據仍限於單機 A100 與工作負載相符的門檻設定。

MoE 模型雖只為每個 token 啟用部分專家,常見的固定 top-k 路由仍要求所有 token 執行相同數量的專家槽位。新研究 ACE 試圖再削去這一層冗餘:它保留原始 checkpoint 與路由器,不另行訓練配置器,而是在推論時依 token 判斷哪些已入選的次要專家可以略過;最高權重的 top-1 專家則一律保留。
ACE 有兩組離線訊號。Global Spectral Proxy(GSP)聯合分析每個 SwiGLU 專家的 gate、up、down projection 與前置 RMSNorm,估計其全域轉換能力;Router-Conditioned Refinement(RCR)則將同層路由器權重中心化,建立專家偏好的輸入方向,再量測該方向上的回應強度。線上階段只需查表、結合目前 token 的 gate 值並做少量純量運算;只有 GSP 與 RCR 都判定貢獻偏低時,系統才跳過該專家。
作者在 Qwen3-30B-A3B-Instruct-2507、Qwen3.6-35B-A3B 與 Gemma-4-26B-A4B-it 上測試 WikiText-2,以及 ARC、PIQA、MATH-500、GPQA-Diamond、HumanEval、LiveCodeBench 等七項任務。以 Qwen3.6-35B-A3B 的 50% 專家跳過率為例,ACE 相較最強對照法將 WikiText-2 perplexity 降低 7.96%,七項任務平均準確率提高 4.15 個百分點;這是同等跳過預算間的比較,並非相對完整 BF16 模型反而全面變強。
經最佳化的 expert dispatch 在單張 NVIDIA A100、60% 跳過率下,首 token 延遲改善 1.72 至 2.25 倍,每 token 延遲改善 1.31 至 1.41 倍;輸入長度 1,024、batch 1 時,TTFT 由 270.9 毫秒降至 120.3 毫秒。公開程式庫已包含端到端管線與測試,但排除了部分輔助實驗,README 的校正步驟也仍取用 WikiText token 來映射目標跳過率。論文承認結果來自單次確定性執行及工作負載相符門檻;下一步須驗證門檻跨領域轉移、多 GPU expert parallel 通訊,以及在 vLLM、SGLang 等生產執行期的整合收益。