返回首頁

GitHub Repo

Ai2 開源 Olmo-core 3,重構 MoE 訓練的專家配置與資料路由

新版讓專家常駐 GPU,以資料路由減少反覆聚合權重的成本,官方初步測試回報約 2.7 倍吞吐量。兆參數配置已完成系統測試,但採用隨機路由,實際訓練品質與穩定性仍待驗證。

投稿者が撮影 · Public domain · Image source
zh-Hant

Ai2 於 10 月 1 日發布 Olmo-core 3,重新設計開源框架的混合專家模型(MoE)訓練系統。更新聚焦專家分布與跨 GPU 資料搬移,將成為下一代 Olmo 的訓練基礎,並公開程式碼供研究者修改與實驗。官方公告

核心改變是從先前以完全分片資料平行(FSDP)為主的實作,轉向以分散式資料平行(DDP)為基礎的設計:專家權重留在 GPU,把 token 資料送到對應專家,減少每個小批次反覆聚合及重新分片權重的成本。官方在八張 NVIDIA B300 上測試 470 億參數 MoE,每張 GPU 的吞吐量由每秒 19,400 token 提升至 52,000,約為原實作的 2.7 倍;這是初步測試,不能直接套用到其他叢集。測試與架構說明

擴展能力也有明確邊界。官方以 512 張 B300 測試 1.2 兆總參數、每 token 啟用 583.6 億參數的配置,但使用隨機路由衡量系統效能。這項結果支持框架能承載大型配置,尚不足以證明同規模模型的收斂品質、長時間穩定性或實際訓練成本。官方測試限制

工程落地仍須處理依賴與環境差異。儲存庫提供 ai2-olmo-core 套件及原始碼安裝方式,部分功能需要額外核心套件;README 特別指出,dropless MoE 使用的 grouped_gemm 可能需要自行編譯。官方 Docker 映像包含核心與選用依賴,卻未預裝 Olmo-core 本身,且不同硬體、驅動或 CUDA 版本仍可能需要重建映像。儲存庫安裝說明

對準備採用新版的團隊,下一步應在自身硬體與真實路由負載下,比較吞吐量、尖峰記憶體及訓練損失,再判斷架構改動是否值得導入。這是依測試範圍提出的工程建議;公開程式碼降低了檢查與改造門檻,跨環境效益仍須重現。

來源

  1. Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
  2. allenai/Olmo-core:原始碼與安裝文件