返回首頁

生成式影片與推論加速

FastH3 將 MiniMax H3 壓至四次 DiT 呼叫,八張 B200 可在 13 秒內生成 15 秒影音

FastVideo 以 DMD2 蒸餾與 90% 稀疏注意力,把基礎模型的 49 次 DiT 呼叫縮減為四次,並公開完整權重與 LoRA。即時生成數字依賴八張 B200、專用 VSA 核心及暖機後測試,單卡與一般消費級 GPU 尚未達到同等速度。

Official GDC · CC BY 2.0 · Image source
zh-Hant

UC San Diego Hao AI Lab 主導的 FastVideo 團隊發布 FastH3 Preview v1,將 MiniMax H3 的文字生成影片與音訊模型蒸餾成四步版本。基礎 H3 的 33B 級影音 diffusion transformer 每段輸出需執行 49 次;FastH3 以 DMD2 distribution matching distillation,把去噪流程降為四次 DiT 呼叫,再配合 Video Sparse Attention(VSA-H3),令建議 checkpoint 在注意力計算中維持約 90% 稀疏度。團隊提供完整權重、預先抽取的 LoRA、密集注意力對照版本及 FastVideo 推論程式碼。

官方在 1344×768、24 FPS、包含立體聲音訊的測試中,生成 15 秒內容需時 47.2 秒(單張 B200)、15.5 秒(四張 B200),以及 12.88 秒(八張 B200)。單卡相較使用 dense FlashAttention 4 的基礎 H3 為 14.38 倍加速;不過八卡結果沒有相同配置的基礎模型對照,因此團隊沒有宣稱八卡加速倍數。數字是完整暖機後三次請求的中位數,包含編碼、去噪、影音解碼、封裝與檔案輸出,但排除模型載入及編譯時間。

加速來自兩個可分離部分:少步蒸餾減少 transformer 前向次數,稀疏核心則減少每一步的注意力工作量。這讓影片推論優化不再只靠量化或張量平行,也可在後訓練時直接改變取樣成本。然而推薦的 VSA checkpoint 依賴 tile-64 VSA-H3 後端與專用核心,不能直接換成 dense attention 而期待相同品質和速度;較易部署的 dense 蒸餾版本在單卡生成 15 秒影片仍需 91.3 秒。

Preview v1 目前只支援文字生成影音,尚未蒸餾首尾幀條件及參考影像模式。團隊稱訓練使用超過一千 B200 小時,但完整訓練配方仍標示即將公開;權重亦沿用 MiniMax H3 Community License,而非標準 Apache 或 MIT 授權。接下來應觀察 RTX、DGX Spark、Apple MLX 的實測、冷啟動延遲、峰值記憶體,以及稀疏蒸餾對複雜運動、細節和音畫同步的獨立評估。

來源

  1. FastVideo FastH3 V1 technical announcement
  2. FastVideo source repository
  3. FastH3 Preview v1 model collection