ホームへ戻る

生成式影片與開放模型

LTX‑2.5、拡散デコーダーと単一パスのマルチショット生成でオープン動画モデルを更新

LTX‑2.5は、学習可能な22Bモデルと8ステップ蒸留モデルの重みを公開し、ショットをまたぐキャラクター、音声、シーンの一貫性を追加した。完全なクイックスタート用コンポーネントは約66 GiBで、Diffusers対応には依然としてmainブランチのインストールが必要だ。また、モデルには売上高基準のコミュニティライセンスによる制限もある。

Collision Conf · CC BY 2.0 · Image source
zh-Hant

Lightricksは8月12日、LTX‑2.5の重みと推論ツールを公開した。中核は引き続き映像と音声を同期生成できる22B DiTだが、生成プロセスには3つの実質的な変更が加えられた。第1に、モデルは単一の推論パスで連続する複数のショットを生成でき、カットをまたいで人物のアイデンティティ、環境、照明、音声、スタイルの一貫性維持を試みる。第2に、単純なVAE再構成を拡散ベースの動画デコーダーに置き換え、顔、テキスト、質感、高速な動きのディテールを改善した。第3に、detail-fidelity renderingがシーンの複雑さに応じて計算資源を割り当て、空間latent upscalerと、オプションの時間latent upscalerによって仕上げを行う。

公開パッケージには、完全に学習可能なBF16 DiT、CFG=1かつ固定8ステップスケジュールの蒸留版、ComfyUI専用のINT8版、Blackwell向けのNVFP4重みが含まれる。テキスト処理にはカスタムGemma 4 12B encoderを採用し、プロンプトからフレーム数を予測するduration headも備える。公式Pythonクイックスタートで必要となるtransformer、テキストencoder、映像・音声VAE、upscalerの合計容量は約66 GiB。メモリが不足する場合はFP8 castやCPU/ディスクoffloadを利用できるが、通常は転送レイテンシーと引き換えに実行可能性を確保することになる。また、コンポーネントがフォルダー形式でパッケージ化されたため、旧バージョンの単一ファイルloaderはそのまま流用できない。

現時点で、エンジニアリング面の統合は完全には成熟していない。公式の`ltx-pipelines`はPython 3.12を必須とし、CUDA 12.7とPyTorch 2.7を推奨している。Diffusers互換パッケージはすでに提供されているものの、まだ正式releaseには含まれておらず、ユーザーはGitHubのmainブランチからインストールする必要がある。LTX‑2.3用LoRAの大半はそのまま動作するとされるが、公式も例外があることを認めており、本番投入前に個別の検証が必要だ。重みのライセンスもApache系のような寛容なものではない。年間売上高が1,000万米ドル未満の法人・団体は無償で商用利用できるが、それを超える組織は別途契約を締結する必要があり、ファインチューニング済みモデルの譲渡にも料金が発生する可能性がある。今後注目すべき点は、独立した映像・音声同期ベンチマーク、ショット間のアイデンティティドリフト、そして拡散デコーダーによって実際に増加するVRAM使用量とレイテンシーだ。

出典

  1. LTX-2.5 model card and component weights
  2. Lightricks/LTX-2 inference and training repository
  3. LTX open-source model documentation