返回首頁

開放模型

AMD 開放 Instella-MoE 全訓練鏈,16B 模型每個 token 僅啟用 2.8B 參數

AMD 釋出 Instella-MoE 的預訓練、長上下文、SFT、DPO 與強化學習等六階段檢查點,並同步公開訓練框架、資料配方及推論程式。模型以 Gated MLA 和 FarSkip-Collective 降低注意力與跨 GPU 通訊成本,但正式技術報告及獨立評測仍未完成。

Konstantin Lanzet · CC BY 3.0 · Image source
zh-Hant

AMD 更新 Instella 專案並公開完整的 Instella-MoE-16B-A3B 模型鏈。這是一個總參數 160 億、每個 token 啟用約 28 億參數的稀疏混合專家模型,共有 64 個專家、2 個共享專家;路由器每次選用 6 個專家。模型使用 27 層解碼器、2,048 維隱藏狀態及 128,896 個詞彙,權重目前以 BF16 Safetensors 發布。

這次值得注意的不只是最終聊天模型。AMD 同時提供預訓練、中期訓練、長上下文延伸、監督式微調、DPO 和強化學習六個檢查點,開發者因而能比較能力在各階段如何形成,或從較早的基礎模型重新設計後訓練。官方也宣稱公開資料混合、訓練配方,以及建立在 ROCm 上的 Primus 訓練框架與 Miles 強化學習框架;這比只提供最終權重更接近可研究的「全開放」模型。

架構方面,Instella-MoE 採用 Gated Multi-head Latent Attention,以壓縮注意力狀態並由閘門控制輸出;FarSkip-Collective 則讓較遠的計算工作跨過阻塞中的集合通訊,嘗試把 MoE 常見的 all-to-all 等待時間與 GPU 計算重疊。模型在 MI300X、MI325X 上從頭訓練,模型卡也列出 Transformers、vLLM 與 SGLang 的載入路徑,因此並未被綁定在 AMD 自有服務介面。

不過,現階段的成績表主要是圖片形式的官方比較,正式 Instella-MoE 技術報告仍標示為即將發布;多語能力亦尚未測試。工程團隊應先確認 `trust_remote_code`、記憶體需求及非 ROCm 平台相容性,再觀察訓練資料清單、路由負載分布、長上下文長度與可重現腳本是否完整補齊。

來源

  1. Instella-MoE-16B-A3B model card
  2. Instella training code and recipes
  3. FarSkip-Collective: Unhobbling Blocking Communication in Mixture of Experts Models