ホームへ戻る

開放模型與影音生成

MiniMax H3、33Bのベースウェイトを公開――映像とステレオ音声をネイティブに同期生成

MiniMax H3は、単一のTransformerで映像と音声のlatentを共同予測し、テキスト、開始・終了フレーム、マルチモーダル参照からの生成に対応する。公開版はローカルで768pの映像・音声を生成できるが、公式の2Kワークフローは依然として、オープンソース化されていない2つのクラウドモジュールに依存している。

Lucasbosch · CC BY-SA 3.0 · Image source
zh-Hant

MiniMaxは、[H3](https://huggingface.co/MiniMaxAI/MiniMax-H3)のBF16ベースウェイト2種類を公開した。FL2VAはテキストと、オプションの開始・終了フレームを受け付ける。Ref2VAは、最大9枚の画像、3本の動画、3つの音声クリップを同時に入力できる。どちらも4~15秒、24 FPSの映像と32 kHzのステレオ音声を生成でき、ベース出力の短辺はデフォルトで768ピクセルとなる。

中核のH3-Omni-Transformerは、33Bパラメータのdenseな単一シーケンスモデルで、約13Bパラメータが事前計算およびキャッシュ可能なAdaLNブランチに配置されている。テキストと視覚セマンティクスにはQwen3-VL-32Bの第50層の出力を使用する。画像と音声は、それぞれ時間方向に因果的なVisualVAEとAudioVAEで圧縮され、Transformerが両方のlatentを同期して予測する。視覚latentの空間圧縮率は16倍、時間圧縮率は4倍で、さらに`1×2×2`でpatchifyされる。音声は1秒当たり40個のlatent tokenに圧縮される。

デプロイは決して軽量ではない。[SGLangのネイティブパイプライン](https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3)では、H200を4基使用するか、TP2とUlysses2を組み合わせて80GB H100を4基使用する構成を推奨している。モデルカードにはvLLM、Diffusers、ComfyUIも記載されている。初回リリースのウェイトが対応するのはfull attentionのみで、学習時に使用されたsparse attentionはまだ公開されていない。

「オープン」の範囲は、エンジニアリングチームが特に注意すべき点だ。自由形式の素材を構造化されたContext-IRへ変換するマルチモデル・オーケストレーションサービスと、768pの結果を元の条件とともに再生成して2K化するモジュールは、いずれもAPIでのみ提供される。つまり、ローカルで再現できるのはH3-Baseであり、公式の完全な2Kシステムではない。モデルには独自のコミュニティライセンスが適用されるため、本番デプロイ前に商用利用が認められる地域と用途に関する条項も確認する必要がある。今後は、sparse attentionの実装、エンドツーエンドのVRAM使用量とレイテンシーのデータ、さらに音声と映像の同期、人物の一貫性、テキスト再現能力に関する第三者のブラインドテストに注目したい。

出典

  1. MiniMax H3 model card
  2. MiniMax-H3 deployment cookbook
  3. MiniMax H3 repository and generation skills