返回首頁

生成式影片與開放模型

LTX‑2.5 以擴散解碼器與單次多鏡生成更新開放影音模型

LTX‑2.5 公開 22B 可訓練及八步蒸餾權重,新增跨鏡頭角色、聲音與場景一致性。完整快速入門元件約 66 GiB,Diffusers 支援仍須安裝主分支,模型也受營收門檻式社群授權限制。

Collision Conf · CC BY 2.0 · Image source
zh-Hant

Lightricks 於 8 月 12 日發布 LTX‑2.5 的權重及推論工具,核心仍是能同步生成畫面與聲音的 22B DiT,但生成流程有三項實質改動。第一,模型可在單次推論中產生多個相連鏡頭,嘗試跨剪接維持人物身份、環境、光線、聲音與風格;第二,以擴散式影片解碼器取代單純 VAE 重建,針對臉部、文字、材質和快速運動改善細節;第三,detail-fidelity rendering 會按場景複雜度分配算力,再以空間及可選的時間 latent upscaler 完成細化。

發布包包含完整可訓練的 BF16 DiT、固定八步排程且 CFG=1 的蒸餾版、ComfyUI 專用 INT8,以及面向 Blackwell 的 NVFP4 權重。文字端改用客製 Gemma 4 12B encoder,另有依提示預測幀數的 duration head。官方 Python 快速入門所需 transformer、文字 encoder、影音 VAE 與上採樣器合計約 66 GiB;記憶體不足時可使用 FP8 cast 和 CPU 或磁碟 offload,但這通常以傳輸延遲換取可執行性。資料夾式元件封裝也代表舊版單檔 loader 不能直接沿用。

工程整合目前並非完全成熟。官方 `ltx-pipelines` 要求 Python 3.12、建議 CUDA 12.7 與 PyTorch 2.7;Diffusers 相容包已提供,卻尚未進入正式 release,使用者需從 GitHub 主分支安裝。多數 LTX‑2.3 LoRA 據稱可直接運行,但官方承認仍有例外,投產前必須逐一驗證。權重也不是 Apache 類寬鬆授權:年營收低於 1,000 萬美元的實體可免費商用,較大組織需另簽協議,轉讓微調模型亦可能收費。後續值得看的是獨立影音同步評測、跨鏡身份漂移,以及擴散解碼器增加的實際 VRAM 與延遲。

來源

  1. LTX-2.5 model card and component weights
  2. Lightricks/LTX-2 inference and training repository
  3. LTX open-source model documentation