開放模型與推論
openPangu 2.0 Pro、505B MoEの重みを公開——18Bのアクティブパラメータで512Kコンテキストに対応
HuaweiのopenPanguチームは、Ascend NPUで学習した505BのMixture-of-Expertsモデルをリリースした。各tokenで約18Bパラメータをアクティブ化する。階層型疎注意機構と3ヘッドのMulti-Token Predictionを導入しているが、性能値は現時点で主にチームによる自己評価に基づく。

HuaweiのopenPanguチームは、openPangu 2.0 Proの重みと推論コードを公開し、thinkingモードとnon-thinkingモードの2種類を提供した。モデルは総パラメータ数が約505B、各tokenでアクティブ化されるパラメータが約18Bで、約34T tokensのデータで事前学習されている。最大512K tokensのコンテキストに対応するとされる。今回のリリースにおける技術的な焦点はモデル規模だけではなく、超大規模MoEをAscendハードウェア上でデプロイ可能な状態に保つ試みにある。
注意機構の層では、DSAとSliding Window Attention(SWA)を1:2の比率で交互に配置している。SWAが局所的な関係を処理し、DSAが疎なグローバル集約を行うことで、長いシーケンスの全層で完全なattentionのコストが発生することを回避する。また、従来の単一経路のresidual connectionを4ストリームのmHCに置き換え、3つのMTP予測ヘッドも追加した。後続の3 tokensを一度に提案し、self-speculative decodingで検証できる。公式の推論パスは既存のvLLM endpointではなくomni-inferを採用している。Hugging Faceページにも現時点でサードパーティーのInference Providerは存在しないため、重みをダウンロードできても、既存のCUDA serving stackをそのまま利用できるとは限らない。
チームが公表したthinkingモードの自己評価には、SWE-bench Verifiedの68.5、LiveCodeBench V6の85.7、TAU2-Benchの81.1、GPQA-Diamondの87.9が含まれる。これらのスコアにはAvg@3やAvg@4など異なる集計方式が用いられており、単一試行の成功率のみを報告するモデルとは直接比較できない。テストプロンプト、ツール環境、推論予算もagent benchmarkの結果に大きく影響する。モデルには独自のOpenPangu Model License 2.0が適用されており、重みをダウンロードできるという理由だけで、標準的なApache LicenseやMIT Licenseのオープンソースとみなすことはできない。
エンジニアリングチームが今後注視すべき点は2つある。第一に、実際の512K入力におけるomni-inferのKV cache、time to first token、マルチユーザー時のthroughput。第二に、コミュニティがAscend以外のハードウェアで公式スコアを再現できるかどうかだ。変換ツールと独立評価が整って初めて、このモデルはハードウェアエコシステムのデモンストレーションを超え、ポータブルな長コンテキスト基盤モデルになり得る。