訓練系統
SLAI T-Rex 在 Ascend SuperPOD 全參數後訓練兆級 MoE,MFU 提升至 34.22%
研究團隊針對 DeepSeek-V4 家族重做平行策略、通訊排程、核心與算子融合,使 Ascend 訓練效率達開源基線的 2.93 倍。系統再以求解器驗證資料訓練運籌研究模型,但程式、資料與硬體測量仍需更完整的公開重現。

SLAI T-Rex 技術報告把焦點放在一項棘手的系統問題:如何於 Ascend CloudMatrix384 SuperPOD 上,對兆級參數的 DeepSeek-V4 MoE 模型進行全參數持續預訓練與監督微調。這類工作負載不只受模型權重與最佳化器狀態的記憶體壓力限制,專家平行產生的跨節點通訊、稀疏注意力核心及大量碎片化算子也會讓 NPU 閒置。
團隊採用三層最佳化。模型層重新安排資料、張量、流水線與專家平行,並協調計算和通訊;核心層以 AuraKernel 配合 profiling,集中改寫稀疏注意力、正規化及其他耗時核心;執行層則把連續的小型 eager 算子融合為 AscendC 核心,減少啟動成本、中間張量與全域記憶體流量。報告稱最終模型 FLOPs 使用率達 34.22%,相對開源基線配方提升 2.93 倍,同時維持訓練穩定。
研究還把這套基礎設施用於運籌研究後訓練。資料流程以求解器驗證合成的數學規劃文件,建立涵蓋四類任務、三種問題表示的 1 萬筆 SFT 資料。以 DeepSeek-V4-Flash 為底座的專用模型,在團隊評測中取得平均零樣本 Pass@1 71.81%,比 GPT-5.4-Mini 高 3.98 個百分點,也比未調整底座高 11.27 點。
這項工作的重要性在於,它同時處理非 CUDA 大型訓練堆疊與可驗證領域資料,而不是只呈現單一核心的微基準。然而,MFU 高度依賴模型配置、精度、序列長度與叢集拓撲;與 GPT-5.4-Mini 的比較也無法單獨證明廣泛推理能力。工程界接下來應關注核心與訓練配方是否完整開放、在不同 Ascend 叢集能否重現,以及求解器驗證是否真正排除格式正確但數學建模錯誤的答案。