ホームへ戻る

開放模型與推論

Hy4 preview、770B MoE、疎注意機構、ネイティブMTPで100万token対応のオープンモデルを前進

TencentはHy4 previewとFP8ウェイトを公開した。各tokenでは770Bパラメータのうち49Bを有効化し、ネイティブで100万tokenのコンテキストに対応する。モデルはレイヤー間でインデックスを再利用する疎注意機構を採用し、vLLMおよびSGLang向けのデプロイ用イメージも提供するが、巨大なウェイトとベンダーによる自己評価のため、実運用への採用判断には依然として制約がある。

Amazingloong · CC BY-SA 4.0 · Image source
zh-Hant

Tencentは8月28日、[Hy4 preview](https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/)を公開し、BF16およびFP8ウェイト、ファインチューニング手順、Apache 2.0ライセンスも同時に提供した。モデルのバックボーンは770Bパラメータを持ち、tokenごとに49Bを有効化する。全78層のうちDense FFNを使用するのは最初の層のみで、残る77層にはそれぞれ256個のルーティングExpertと1個の共有Expertがあり、毎回8個のルーティングExpertが選択される。これにより、同規模のDenseモデルより計算量は大幅に少なくなるが、完全なBF16ファイルは依然として約1.56TBに達する。このため、「49Bのアクティブパラメータ」を、一般的な49Bモデル向けハードウェアでそのままデプロイできるという意味に解釈すべきではない。

アーキテクチャのもう一つの要点は、[Gated DeepSeek Sparse Attention](https://github.com/Tencent-Hunyuan/Hy4-preview)である。Indexerは最大2,048個の位置のみを選択し、IndexCacheが疎インデックスをレイヤー間で再利用することで、100万tokenのコンテキストにおけるAttentionコストを抑える。さらに、4-way identity Hyper-Connectionsによって残差情報の流れを拡張している。モデルにはネイティブのMulti-Token Prediction(MTP)層も1層搭載されており、総パラメータ数は10B、実際に有効化されるのは0.7Bである。公式のvLLMサンプルでは一度に3 tokenを推測でき、FLASHMLA_SPARSEバックエンドが指定されている。SGLangについてもx86およびArm向けのビルド済みイメージが用意され、どちらのサンプルも8-way tensor parallelでFP8版を起動する。

Tencentの報告によると、Hy4はSWE-bench Pro publicで65.7%、Terminal-Bench 2.1で85.4%を記録した。また、社内の専門家163人が203件のエンジニアリングタスクをブラインド評価した結果、GLM-5.3とKimi K3をわずかに上回ったという。ただし、これらの数値は主に開発元自身が算出したものであり、タスクharness、推論予算、ハードウェアコストは完全には条件が揃っていない。モデルカードでも、過剰に推論し、検証を繰り返す傾向があることを認めている。エンジニアリングチームは今後、第三者によるLong Contextのストレステスト、異なるGPU上でのSparse kernelの実効スループット、FP8量子化後もAgent機能とTool Calling能力が維持されるかに注目すべきだ。

出典

  1. Tencent Releases and Open-Sources Tencent Hy4 preview
  2. Tencent-Hunyuan/Hy4-preview
  3. tencent/Hy4-preview-FP8 Model Card