模型訓練基礎設施
Marin 啟動 535B-A23B 開放訓練,11 套 GB200 NVL72 可公開追蹤
Marin 開始訓練總參數 535B、每個 token 啟用約 23B 的 MoE 模型,計畫使用 11 套 GB200 NVL72 處理約 18T 至 18.75T token。專案公開設定、縮放實驗與即時遙測,但模型品質、長上下文方案及最終 token 預算仍未定案。

Marin 社群啟動目前規模最大的開放訓練實驗:一個約 535.3B 總參數、22.76B 啟用參數的 mixture-of-experts 模型。公開計畫使用 11 套 GB200 NVL72,運行約三個月;對外公告稱資料航程為 18.75T token,約需 2.7×10²⁴ FLOPs。與只發布最終權重不同,Marin 同時開放設定、資料組成、縮放預測與 Weights & Biases 遙測。[訓練追蹤議題](https://github.com/marin-community/marin/issues/8435)
模型包含 48 個 Transformer block,每層配置 384 個 routed expert、top-8 routing,以及兩個共享 SwiGLU expert。LatentMoE 先把 6,144 維 token 表徵壓至 3,072 維再進行 expert dispatch,以減少 all-to-all 傳輸;64-way expert parallelism 放在每個 72-GPU 機櫃內,11 個機櫃則作為 data-parallel replicas。容量係數 1.15 與三輪靜態 expert wave 用來限制通訊及運算緩衝區,代價是負載不均時可能丟棄 token。[技術整理與設定連結](https://www.ai-primer.com/engineer/stories/marin-535b-training)
團隊在主訓練前建立四級 scaling ladder,從 1.6B-A61M、48B token,一路增至 27.7B-A1.2B、926B token。這套預跑約佔主實驗 1% 算力,用於預測 loss、梯度範數及評測軌跡;先前實驗正是藉此發現高 batch 下的梯度增長,才加入 logit z-loss。若主模型偏離預測曲線,維護者可在耗掉完整三個月算力前調查資料、路由或核心實作。
主要風險仍是長上下文與規模穩定性。模型先以 4K 序列訓練,因較多序列有利 expert balancing;既有測試的 token dropping 卻會在延伸至 65K 時由約 7% 增至約 40%。團隊考慮 dropless ragged all-to-all、提高容量係數或序列級平衡,並規劃後段才嘗試 65K、262K。公開資料另有 18.0T 與 18.75T token 兩種記法,因此目前應把架構與遙測視為可重現的訓練實驗,而非已完成或已有能力成績的模型發布。