生成式影音與推論系統
fal 以後訓練與 GB200 推論共設計推出 H3 Max,五秒影音生成壓至約三秒
H3 Max 在 MiniMax H3 開放權重上加入後訓練資料,並以客製推論堆疊提高影音生成吞吐量。fal 宣稱五秒影片可在三秒內完成,但目前模型僅透過託管 API 提供,速度數字仍欠缺可自行重現的部署配方。

fal Research 發布 H3 Max,從 MiniMax H3 的開放權重出發,加入針對提示遵循與視覺品質的新資料進行後訓練,再由推論團隊同步調整執行堆疊。基礎 H3 是約 33B 參數的多模態影音系統,可在同一次生成中產生畫面與立體聲;H3 Max 的公開 API 目前支援文字或圖片生成影片、480p/768p、五至十五秒,以及多種長寬比。
這次更新的技術重點不是單純減少去噪步數。fal 表示,團隊在 NVIDIA GB200 NVL72 上共同開發 checkpoint 與核心推論路徑,對降精度、近似昂貴運算或刪除採樣步驟等最佳化逐一做偏好測試;只保留未令品質排名下降的改動。官方測得五秒影片約三秒完成,吞吐量約為 MiniMax 官方 H3 端點的三十五倍,並稱相對同品質模型平均快十五倍。這使影音模型首次接近可放進互動式剪輯器、預覽工具或代理反覆修訂迴圈的延遲範圍。
品質方面,fal 以十二個模型進行成對人類偏好比較,分別評估整體偏好、提示理解及美感,再以 Bayesian Elo 與 95% 信賴區間彙整,內部結果把 H3 Max 排在三項第一。不過即時的 Artificial Analysis 有聲文字轉影片榜把它列為第三:Elo 1,235、95% 區間正負十分,與第一名 Wan 3.0 及第二名 Gemini Omni Flash 的區間重疊。這代表它處於第一梯隊,卻不足以證明穩定且顯著領先。
部署者還要區分「開放基礎模型」與「開放衍生模型」。MiniMax H3 權重可下載,但 fal 公告目前只提供 H3 Max Playground、Agent 與 API,沒有同步公開衍生權重、後訓練資料、核心程式或可重現的延遲測試。API 的 `timings.inference` 也只在部分路由回傳 DiT 時間,不能直接代表排隊、提示擴寫、傳輸與完整端到端延遲。接下來應觀察權重與推論配方是否釋出,以及不同片長、批次量和硬體下的成本曲線。