返回首頁

模型架構與推論

UniF-MoE 先抽共享區塊再路由殘餘計算,較 top-2 GMoE 降低 45.2% 推論時間

UniF-MoE 不再分別決定共享專家、FFN 寬度與啟用專家數,而是讓每個 token 先選共享通道,再按剩餘需求累積路由機率。它在作者的 DeiT 與 BERT 實驗中改善準確率及 MoE 推論成本,但尚未在生成式大型語言模型或分散式 expert parallelism 上驗證。

Evan-Amos · Public domain · Image source
zh-Hant

傳統稀疏 MoE 以 top-k 路由器把每個 token 送進固定數量的完整 FFN 專家;共享專家、專家內剪裁與動態 k 通常又由不同控制器處理。新提出的 UniF-MoE 認為三者其實有先後依賴:抽走可重用計算後,剩餘內容、最佳專家與所需專家數都可能改變,因此必須「先共享,再路由剩餘部分」。

作者先研究由同一稠密 FFN 複製、再稀疏升級的專家,把每個 FFN 拆成對齊的 key-value 通道區塊。常共同啟用的專家,其 value 位置重合比例較高;移除這些共享位置後,只有 5.7%的 token 保留原本 top-2 專家組合。高共享比例的專家對只需兩個殘餘專家便能重建原輸出的比例為 56.3%,低共享組則為 11.8%,支持重新路由而非沿用原決策。

UniF-MoE 為每個 token 計算共享需求 α,用它決定共享區塊數及共享路徑權重;各區塊的 up-projection key 均值則作為原型,選出實際共享內容。剩餘需求 β=1−α 再成為累積路由機率門檻:系統啟用最少數量的殘餘專家,直到機率總和覆蓋 β。Gram 正則化約束路由向量接近正交,避免多個專家反覆承擔相同工作。

在五套 DomainBed 資料上,平均準確率為 69.5%,高於所列可完整比較基線;五項 GLUE 平均為 82.76%,亦高於逐任務挑選固定 k 的 81.95%。以 VLCS 測量,相較 top-2 GMoE,啟用參數與 FLOPs 分別少 9.1%及 16.1%,推論步時間由 0.31 秒降至 0.17 秒,記憶體由 0.55 GiB 降至 0.26 GiB。不過稠密 DeiT 仍只需 0.04 秒及 0.29 GiB,顯示這是 MoE 內部的改善,不代表全面勝過稠密模型。

Apache 2.0 程式已包含視覺、語言、測試與重現腳本,但沒有訓練 checkpoint 或結果陣列。接下來要看此路由是否能擴展至解碼式 LLM、長序列 batching、專家跨 GPU 通訊,以及不再由同一 FFN 初始化的異質專家。

來源

  1. Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation
  2. UniF-MoE official implementation