開放模型與推論
openPangu 2.0 Pro 開放 505B MoE 權重,以 18B 啟用參數支援 512K 上下文
華為 openPangu 團隊釋出以昇騰 NPU 訓練的 505B 混合專家模型,每個 token 約啟用 18B 參數。模型加入分層稀疏注意力與三頭多 token 預測,但效能數字目前主要來自團隊自評。

華為 openPangu 團隊公開 openPangu 2.0 Pro 權重與推論程式,提供思考及非思考兩種模式。模型約有 505B 總參數、每個 token 啟用約 18B,預訓練資料量約 34T tokens,標示支援最長 512K token 上下文。這次釋出的技術重點不只在模型規模,而是嘗試讓超大 MoE 在昇騰硬體上維持可部署性。
注意力層以 1:2 比例交錯 DSA 與滑動視窗注意力:SWA 處理局部關係,DSA 執行稀疏的全域聚合,藉此避免長序列每一層都承擔完整注意力成本。網路另以四支流 mHC 取代傳統單一路徑殘差連接,並加入三個 MTP 預測頭,一次提出後續三個 token,供自投機解碼驗證。官方推論路徑採用 omni-infer,而非現成 vLLM 端點;Hugging Face 頁面目前也沒有第三方 Inference Provider,因此下載權重不等於能直接沿用既有 CUDA 服務堆疊。
團隊公布的思考模式自評包括 SWE-bench Verified 68.5、LiveCodeBench V6 85.7、TAU2-Bench 81.1,以及 GPQA-Diamond 87.9。這些成績採 Avg@3、Avg@4 等不同聚合方式,不能直接與只報單次成功率的模型比較;測試提示、工具環境和推論預算也會明顯影響代理基準。模型使用專屬 OpenPangu Model License 2.0,不能僅因權重可下載便視為標準 Apache 或 MIT 開源。
工程團隊接下來應觀察兩件事:omni-infer 在真實 512K 輸入下的 KV cache、首 token 延遲與多使用者吞吐量,以及社群能否在非昇騰硬體重現官方成績。若轉換工具與獨立評測補齊,這款模型才可能從硬體生態展示進一步成為可移植的長上下文基座。