開放模型與影音生成
MiniMax H3 公開 33B 基礎權重,原生同步生成影片與立體聲
MiniMax H3 以單一 Transformer 聯合預測影音 latent,支援文字、首尾幀及多模態參考生成。公開版本可本機產生 768p 影音,但官方 2K 流程仍依賴兩個未開源的雲端模組。

MiniMax 公開 [H3](https://huggingface.co/MiniMaxAI/MiniMax-H3) 的兩組 BF16 基礎權重:FL2VA 接受文字及可選的首、尾幀;Ref2VA 則可同時接收最多九張圖片、三段影片與三段音訊。兩者可生成 4 至 15 秒、24 FPS 的影片及 32 kHz 立體聲,基礎輸出短邊預設為 768 像素。
核心 H3-Omni-Transformer 是 33B dense、單一序列模型,約 13B 參數位於可預先計算及快取的 AdaLN 分支。文字與視覺語意取自 Qwen3-VL-32B 第 50 層;影像及音訊再分別經時序因果 VisualVAE 與 AudioVAE 壓縮,Transformer 同步預測兩種 latent。視覺 latent 的空間、時間壓縮率分別為 16 倍及四倍,再以 `1×2×2` patchify;音訊則壓成每秒 40 個 latent token。
部署並不輕量。[SGLang 的原生管線](https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3)建議使用四張 H200,或以 TP2 加 Ulysses2 配置四張 80GB H100;模型卡亦列出 vLLM、Diffusers 與 ComfyUI。首批權重只提供 full attention,訓練時使用的 sparse attention 尚待公開。
「開放」範圍尤其值得工程團隊留意。將自由格式素材轉成結構化 Context-IR 的多模型編排服務,以及把 768p 結果連同原始條件重新生成為 2K 的模組,均只提供 API。換言之,本機可重現的是 H3-Base,而非官方完整 2K 系統。模型採自訂社群授權;正式部署前還須核對商用地域與用途條款。下一步應觀察稀疏注意力實作、端到端顯存及延遲數據,以及第三方對音畫同步、人物一致性和文字重現能力的盲測。