返回首頁

影片生成/推論系統

NVIDIA 為 MiniMax H3 加入兩階段生成,單張 GB200 的 10 秒影片延遲降至 14.9 秒

H3 Super Acceleration 先以低解析度、四步去噪建立草稿,再交由 LTX 與 Sol-Attn 用三步完成高解析度細化。官方測得 768p、10 秒影片較 SGLang 基準快 27.7 倍,但加速改變了取樣路徑,並非等品質的純核心最佳化。

David Birkas · CC BY 2.0 · Image source
zh-Hant

NVIDIA SANA 團隊更新 MiniMax H3 的推論方案 H3 Super Acceleration,重點不是把原模型的每個運算核心等比例加速,而是重新切分生成工作。第一階段使用 H3、專用 LoRA 與輕量解碼器,以 896×512、24 FPS 執行四個去噪步驟;第二階段把草稿放大至 768p、1080p 或 2K,再由 LTX 模型配合 Sol-Attn 執行三步細化及快速 VAE 解碼。兩個階段在同一張 GB200 上串行運作,總計七步。

在 1344×768、batch size 1 的暖機測試中,五秒影片耗時 6.852 秒,十秒影片耗時 14.931 秒;官方列出的 SGLang 基準分別為 152.3 與 414.1 秒,換算為 22.2 倍及 27.7 倍加速。進一步拆解顯示,TAEH3 把第一階段 VAE 解碼由 3.427 秒壓至 0.028 秒;LTX TAEHV 則把原本 6.404 秒的最終解碼降至 0.187 秒。工程上的訊息是,影片服務的主要延遲未必只在 DiT:解碼器、解析度安排及細化模型同樣可能主導端到端成本。

這組數字仍不能直接當成無損核心加速。新流程減少全解析度 H3 步數,並改用另一個模型補回細節,因此紋理、動作與音訊都可能偏離原始 SGLang 結果。測量亦排除模型載入和暖機,第二階段只取十次熱請求平均,尚未交代併發、長尾延遲、顯存峰值或客觀品質指標。下一步應觀察程式碼與 LoRA 是否完整發布、消費級 GPU 能否容納兩套模型,以及在大批量服務下能否維持相同速度與畫質。

來源

  1. MiniMax announces H3 Super Acceleration
  2. MiniMax H3 Super Acceleration
  3. MiniMax-H3 model card