模型架構與推論
UniF-MoE 先抽共享區塊再路由殘餘計算,較 top-2 GMoE 降低 45.2% 推論時間
UniF-MoE 不再分別決定共享專家、FFN 寬度與啟用專家數,而是讓每個 token 先選共享通道,再按剩餘需求累積路由機率。它在作者的 DeiT 與 BERT 實驗中改善準確率及 MoE 推論成本,但尚未在生成式大型語言模型或分散式 expert parallelism 上驗證。

傳統稀疏 MoE 以 top-k 路由器把每個 token 送進固定數量的完整 FFN 專家;共享專家、專家內剪裁與動態 k 通常又由不同控制器處理。新提出的 UniF-MoE 認為三者其實有先後依賴:抽走可重用計算後,剩餘內容、最佳專家與所需專家數都可能改變,因此必須「先共享,再路由剩餘部分」。
作者先研究由同一稠密 FFN 複製、再稀疏升級的專家,把每個 FFN 拆成對齊的 key-value 通道區塊。常共同啟用的專家,其 value 位置重合比例較高;移除這些共享位置後,只有 5.7%的 token 保留原本 top-2 專家組合。高共享比例的專家對只需兩個殘餘專家便能重建原輸出的比例為 56.3%,低共享組則為 11.8%,支持重新路由而非沿用原決策。
UniF-MoE 為每個 token 計算共享需求 α,用它決定共享區塊數及共享路徑權重;各區塊的 up-projection key 均值則作為原型,選出實際共享內容。剩餘需求 β=1−α 再成為累積路由機率門檻:系統啟用最少數量的殘餘專家,直到機率總和覆蓋 β。Gram 正則化約束路由向量接近正交,避免多個專家反覆承擔相同工作。
在五套 DomainBed 資料上,平均準確率為 69.5%,高於所列可完整比較基線;五項 GLUE 平均為 82.76%,亦高於逐任務挑選固定 k 的 81.95%。以 VLCS 測量,相較 top-2 GMoE,啟用參數與 FLOPs 分別少 9.1%及 16.1%,推論步時間由 0.31 秒降至 0.17 秒,記憶體由 0.55 GiB 降至 0.26 GiB。不過稠密 DeiT 仍只需 0.04 秒及 0.29 GiB,顯示這是 MoE 內部的改善,不代表全面勝過稠密模型。
Apache 2.0 程式已包含視覺、語言、測試與重現腳本,但沒有訓練 checkpoint 或結果陣列。接下來要看此路由是否能擴展至解碼式 LLM、長序列 batching、專家跨 GPU 通訊,以及不再由同一 FFN 初始化的異質專家。