推論系統
FreeBalance 提前預測 MoE 熱門專家,八張 A800 的 prefill 延遲最多降低 13.1%
FreeBalance 用上一層殘差狀態預測下一層專家負載,讓權重交換與注意力計算重疊。方法不改變最終路由與模型輸出,但目前證據只涵蓋兩款 MoE 模型、單一八卡拓撲及 prefill 工作負載。

MoE 服務通常把不同專家分散到多張 GPU;當路由器把大量 token 指向同一 rank,其餘裝置即使較早完成,也得等待最慢節點。傳統線上平衡要等路由結果出爐才搬移專家權重,傳輸因而落在推論關鍵路徑。[FreeBalance 論文](https://arxiv.org/abs/2608.14205)改用第 ℓ−1 層輸出的殘差 hidden state,提早呼叫第 ℓ 層既有 router,估計各專家即將收到的 token 數;這次預測只決定實體配置,正式 MoE 計算仍使用原本的路由結果,因此不近似 logits,也不改模型語義。
系統依預測負載,在最忙與最閒 rank 間安排成對 expert swap。成本模型利用已量測的注意力時間、連線頻寬與啟動延遲限制交換量,務求把權重傳輸藏在下一層 attention 之下;成對交換也維持每張卡的 expert 數量與記憶體占用。各 rank 以相同統計資料及確定性排序自行重建計畫,毋須另外廣播完整配置。論文在 8 張 NVIDIA A800-SXM4、EP=8、batch 16、8K 輸入上測試 Qwen3-30B-A3B 與 Moonlight-16B-A3B;前者本身有 [128 個專家、每 token 啟用 8 個](https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507)。
作者報告最大/平均 rank 負載比下降 32.8%,端到端 prefill 延遲最多下降 13.1%,平均每層可隱藏 5.1 個專家的交換成本。LongBench 各子集的收益並不一致,混合任務亦低於最佳案例。工程上下一步要看公開實作、decode 階段、小 batch、跨節點 InfiniBand,以及 H100、B200 等不同計算/通訊比例;預測若失準雖不影響答案,仍可能搬錯專家並浪費頻寬。