返回首頁

推論系統

MoE 路由器可減少 60% 快取失誤,但未通過 1% 困惑度退化門檻

一項預先註冊研究嘗試把專家局部性直接訓練進 MoE 路由器,卻發現快取改善與模型品質存在明顯交換。訓練與無訓練重路由疊加可再降低失誤,但仍未證明能轉化為等比例端到端加速。

JU580 at English Wikipedia · Public domain · Image source
zh-Hant

在顯存遠小於模型權重時,MoE 理論上的低啟用參數量不等於低資料搬運量:每個 token 選中的專家仍可能要由 RAM 或 SSD 載入 GPU。新研究以 8GB GPU 執行 134GB、Q4_K_M 量化的 Qwen3-235B,量得暖機後解碼僅 0.44 token/s,與「每 token 所需位元組數除以實測頻寬」的模型相符。原本希望以 batch 共同攤銷 SSD 掃描,batch 32 時反而因分頁抖動崩潰。

作者另開發不修改模型的 `llama-moe-trace`,擷取 Qwen3-30B 的路由決策。量測顯示,相鄰 token 重用同一專家的機率約為隨機基準兩倍;95% 流量集中在 52.5% 的專家,而容量只涵蓋 13.4% 專家的 LRU 快取可服務 66% 請求。這說明路由本來已有可利用的局部性,但不足以消除 SSD 頻寬牆。

研究接著依預先註冊條件訓練 137M MoE,加入局部性及領域路由損失。機制確實令快取失誤最多下降 60%,某些靜態固定方案甚至達 99% 命中率;然而所有設定都未通過「困惑度惡化不超過 1%」的品質門檻。340M 實驗也沒有顯示規模增加會消除代價。把已訓練的局部性與推論時快取感知重路由疊加,可在兩種模型規模把失誤降低約 80%,代價是不超過 3.4% 的困惑度惡化。

這是一項有價值的負結果:邊緣 MoE 部署不能假設路由器可免費變得更易快取。不過訓練實驗遠小於被量測的 30B/235B 模型,快取失誤下降也未提供完整延遲、耗能及不同 SSD 的端到端結果;工程上仍需比較分層放置、預取、量化與 CPU 直接計算等替代方案。

來源

  1. Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall
  2. cacheable-by-design code, traces and preregistration
  3. Qwen3-235B-A22B model card