多模態模型
MiniMax 開放 H3 基礎權重:33B 單流模型同步生成最長 15 秒立體聲影片
MiniMax H3 將文字、圖片、影片與音訊封裝成單一序列,聯合預測視覺及音訊 latent,輸出最高 768p、24 FPS、32 kHz 立體聲。官方工作流程宣稱可再生至 2K,但提示編排與高解析度模組仍只提供託管 API。

MiniMax 釋出 H3 的兩組 BF16 基礎 checkpoint,分別處理文字或首尾影格生成,以及多模態參考生成。模型可接收最多九張圖片、三段影片與三段音訊,產生 4 至 15 秒、24 FPS、32 kHz 立體聲影片;本機權重的標準輸出為短邊 768 像素。
H3-Base 先以專用編碼器與 VAE 將各模態壓入統一序列,再由 33B 參數的 dense H3-Omni-Transformer 同時預測影音 latent。文字及視覺理解部分取用 Qwen3-VL-32B 第 50 層的隱藏狀態;影片 VAE 在空間及時間分別壓縮 16 倍與四倍,音訊 VAE 則把每個聲道轉成每秒 40 個 latent token。Transformer 本身不在注意力或 FFN 中建立模態專用分支,差異主要留在輸入輸出層及 AdaLN。
值得注意的是,官方所稱的完整 H3 並不等於目前可下載的權重。負責解析自由格式素材、產生結構化提示的 H3-Context-IR,以及把 768p 成果連同原始條件重新生成為 2K 的 H3-Regenerate-2K,都仍依賴 MiniMax API。訓練時使用的 sparse attention 也尚未開放,初版推論只能採 full attention;官方 SGLang 範例因此要求四張 GPU 做序列平行部署。
對工程團隊而言,這次釋出提供了少見的原生影音同步模型與可重播的 768p 範例,但不能把本機 H3-Base 的結果直接視為官方 2K 產品品質。下一步應觀察 sparse-attention 實作、2K 再生模組是否真正公開,以及社群能否在相同提示與硬體條件下重現影音同步、文字細節和長鏡頭一致性。