返回首頁

推論系統

FreeBalance 提前預測 MoE 熱門專家,八張 A800 的 prefill 延遲最多降低 13.1%

FreeBalance 用上一層殘差狀態預測下一層專家負載,讓權重交換與注意力計算重疊。方法不改變最終路由與模型輸出,但目前證據只涵蓋兩款 MoE 模型、單一八卡拓撲及 prefill 工作負載。

X-ray Image ID: 3684. Photographer: Unknown. · Public domain · Image source
zh-Hant

MoE 服務通常把不同專家分散到多張 GPU;當路由器把大量 token 指向同一 rank,其餘裝置即使較早完成,也得等待最慢節點。傳統線上平衡要等路由結果出爐才搬移專家權重,傳輸因而落在推論關鍵路徑。[FreeBalance 論文](https://arxiv.org/abs/2608.14205)改用第 ℓ−1 層輸出的殘差 hidden state,提早呼叫第 ℓ 層既有 router,估計各專家即將收到的 token 數;這次預測只決定實體配置,正式 MoE 計算仍使用原本的路由結果,因此不近似 logits,也不改模型語義。

系統依預測負載,在最忙與最閒 rank 間安排成對 expert swap。成本模型利用已量測的注意力時間、連線頻寬與啟動延遲限制交換量,務求把權重傳輸藏在下一層 attention 之下;成對交換也維持每張卡的 expert 數量與記憶體占用。各 rank 以相同統計資料及確定性排序自行重建計畫,毋須另外廣播完整配置。論文在 8 張 NVIDIA A800-SXM4、EP=8、batch 16、8K 輸入上測試 Qwen3-30B-A3B 與 Moonlight-16B-A3B;前者本身有 [128 個專家、每 token 啟用 8 個](https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507)。

作者報告最大/平均 rank 負載比下降 32.8%,端到端 prefill 延遲最多下降 13.1%,平均每層可隱藏 5.1 個專家的交換成本。LongBench 各子集的收益並不一致,混合任務亦低於最佳案例。工程上下一步要看公開實作、decode 階段、小 batch、跨節點 InfiniBand,以及 H100、B200 等不同計算/通訊比例;預測若失準雖不影響答案,仍可能搬錯專家並浪費頻寬。

來源

  1. FreeBalance: Pre-Routing Online MoE Load Balancing via Residual Workload Prediction
  2. Qwen3-30B-A3B-Instruct-2507 Model Card
  3. LongBench Repository