ホームへ戻る

生成式影片與推論加速

FastH3、MiniMax H3を4回のDiT呼び出しに圧縮――B200×8基で15秒の映像を13秒で生成

FastVideoはDMD2蒸留と90%のスパース・アテンションにより、ベースモデルの49回のDiT呼び出しを4回に削減し、完全な重みとLoRAを公開した。リアルタイム生成の数値はB200×8基、専用VSAカーネル、ウォームアップ後のテストを前提としており、単一GPUや一般消費者向けGPUではまだ同等の速度に達していない。

Official GDC · CC BY 2.0 · Image source
zh-Hant

UC San DiegoのHao AI Labが主導するFastVideoチームは、MiniMax H3のText-to-Video+Audioモデルを4ステップ版へ蒸留した「FastH3 Preview v1」を公開した。ベースとなるH3の330億パラメータ級の映像・音声diffusion transformerは、出力ごとに49回の処理を必要とする。FastH3はDMD2(distribution matching distillation)によってノイズ除去プロセスを4回のDiT呼び出しまで削減。さらにVideo Sparse Attention(VSA-H3)を組み合わせ、推奨checkpointではアテンション計算のスパース率を約90%に維持する。チームは完全な重み、事前抽出済みLoRA、dense attentionとの比較用バージョン、FastVideoの推論コードを提供している。

公式テストでは、1344×768、24 FPS、ステレオ音声付きの15秒コンテンツを、B200×1基で47.2秒、B200×4基で15.5秒、B200×8基で12.88秒で生成した。単一GPUでは、dense FlashAttention 4を使用するベースH3と比べて14.38倍高速だった。ただし、8基構成については同一構成のベースモデルとの比較結果がないため、チームは高速化倍率を主張していない。数値は完全なウォームアップ後に実行した3回のリクエストの中央値で、エンコード、ノイズ除去、映像・音声のデコード、パッケージング、ファイル出力を含む一方、モデルのロード時間とコンパイル時間は除外されている。

高速化は、分離可能な2つの要素から成る。少ステップ蒸留がtransformerのforward pass回数を減らし、スパースカーネルが各ステップのアテンション処理量を削減する。これにより、動画推論の最適化は量子化やtensor parallelismだけに依存せず、ポストトレーニング時にサンプリングコストそのものを直接変更できるようになる。ただし、推奨されるVSA checkpointはtile-64 VSA-H3バックエンドと専用カーネルに依存している。単純にdense attentionへ置き換えて、同等の品質と速度を期待することはできない。デプロイしやすいdense蒸留版でも、単一GPUで15秒の動画を生成するには91.3秒を要する。

Preview v1は現在、Text-to-Video+Audioのみに対応し、開始・終了フレーム条件や参照画像モードはまだ蒸留されていない。チームによると、トレーニングには1,000 B200時間以上を使用したが、完全なトレーニングレシピは依然として「近日公開」とされている。重みにも標準的なApache LicenseやMIT Licenseではなく、MiniMax H3 Community Licenseが引き続き適用される。今後は、RTX、DGX Spark、Apple MLXでの実測結果、コールドスタートのレイテンシ、ピークメモリ使用量に加え、スパース蒸留が複雑な動き、ディテール、映像と音声の同期に与える影響についての独立評価に注目すべきだ。

出典

  1. FastVideo FastH3 V1 technical announcement
  2. FastVideo source repository
  3. FastH3 Preview v1 model collection