返回首頁

生成式影片

MiniMax H3 開放影音生成權重,ComfyUI 同步提供可執行工作流

MiniMax 將 H3 影片模型權重公開,讓開發者可在本地執行含同步聲音的影像轉影片流程。ComfyUI 已加入官方工作流,但消費級 GPU 的實測多仰賴剪枝與 INT8 衍生檔,不能視為原始權重的完整品質重現。

Lucasbosch · CC BY-SA 3.0 · Image source
zh-Hant

MiniMax 在推出 H3 影音生成模型後,於 8 月 3 日把模型權重放上 Hugging Face,將原先只承諾「數日內開放」的計畫變成可下載成果。H3 可依文字、起始影像或參考素材生成影片,並把畫面與立體聲音訊納入同一次生成流程;這與先產生無聲影片、再串接語音或音效模型的傳統管線不同,時間同步可直接由同一模型處理。

開放權重的實際價值在於工作流已開始落地。ComfyUI 的官方範本庫新增 `video_minimax_h3_i2v.json`,把模型載入、文字編碼、影像條件、採樣與影音輸出節點串成可檢查的圖。開發者因此可以替換採樣器、調整解析度與影格長度,或把 H3 接入既有素材管理及後製流程,而不必依賴 MiniMax 的託管 API。

不過「可下載」不代表一般顯示卡能無條件執行原版。發布首日的社群測試大量使用剪枝、INT8 或旋轉量化衍生檔,有案例在 RTX 4090 Laptop 生成 960×540、5 秒影片約需三分鐘。這類結果證明本地推論可行,卻同時混入量化器、磁碟卸載、節點實作與非官方 checkpoint 的影響;記憶體占用及速度不能直接套用到 BF16 原始權重,更不能據此比較雲端 API 的品質。

研究與產品團隊接下來應核對授權是否涵蓋商業部署、訓練資料及人物生成限制,並建立同提示的 API、原始權重與量化版對照。技術上尤其要測試長片段中的人物一致性、口型與聲音同步、鏡頭切換後的物件保存,以及音訊是否出現幻覺式對白。若社群推論框架能穩定支援,H3 可能成為少數可完整自架、同時生成畫面和聲音的影片基礎模型。

來源

  1. MiniMax H3 模型權重與文件
  2. ComfyUI MiniMax H3 影像轉影片工作流
  3. MiniMax H3 首批本地推論測試