返回首頁

開放模型與推論

openPangu 2.0 Pro 開放 505B MoE 權重,以 18B 啟用參數支援 512K 上下文

華為 openPangu 團隊釋出以昇騰 NPU 訓練的 505B 混合專家模型,每個 token 約啟用 18B 參數。模型加入分層稀疏注意力與三頭多 token 預測,但效能數字目前主要來自團隊自評。

Bjoertvedt · CC BY-SA 4.0 · Image source
zh-Hant

華為 openPangu 團隊公開 openPangu 2.0 Pro 權重與推論程式,提供思考及非思考兩種模式。模型約有 505B 總參數、每個 token 啟用約 18B,預訓練資料量約 34T tokens,標示支援最長 512K token 上下文。這次釋出的技術重點不只在模型規模,而是嘗試讓超大 MoE 在昇騰硬體上維持可部署性。

注意力層以 1:2 比例交錯 DSA 與滑動視窗注意力:SWA 處理局部關係,DSA 執行稀疏的全域聚合,藉此避免長序列每一層都承擔完整注意力成本。網路另以四支流 mHC 取代傳統單一路徑殘差連接,並加入三個 MTP 預測頭,一次提出後續三個 token,供自投機解碼驗證。官方推論路徑採用 omni-infer,而非現成 vLLM 端點;Hugging Face 頁面目前也沒有第三方 Inference Provider,因此下載權重不等於能直接沿用既有 CUDA 服務堆疊。

團隊公布的思考模式自評包括 SWE-bench Verified 68.5、LiveCodeBench V6 85.7、TAU2-Bench 81.1,以及 GPQA-Diamond 87.9。這些成績採 Avg@3、Avg@4 等不同聚合方式,不能直接與只報單次成功率的模型比較;測試提示、工具環境和推論預算也會明顯影響代理基準。模型使用專屬 OpenPangu Model License 2.0,不能僅因權重可下載便視為標準 Apache 或 MIT 開源。

工程團隊接下來應觀察兩件事:omni-infer 在真實 512K 輸入下的 KV cache、首 token 延遲與多使用者吞吐量,以及社群能否在非昇騰硬體重現官方成績。若轉換工具與獨立評測補齊,這款模型才可能從硬體生態展示進一步成為可移植的長上下文基座。

來源

  1. openPangu-2.0-Pro model card
  2. openPangu-2.0-Pro repository