返回首頁

影片生成與模型架構

V-RAE 改用凍結視覺表徵作影片 latent,K600 生成訓練最快提早六倍收斂

V-RAE 不再只為像素重建訓練影片 VAE,而是在 DINOv3、SigLIP2 或 V-JEPA 2.1 等語意特徵上加入時間壓縮與解碼器。作者測得新 latent 可同時改善生成與未來畫面預測,但目前只展示低解析度、短片段及類別條件生成。

Lefevrue · CC BY-SA 3.0 · Image source
zh-Hant

現行影片生成模型通常先以 VAE 把像素壓縮成 latent,再由 diffusion transformer 學習其分布;問題是 VAE 主要追求重建紋理,重建分數高不代表 latent 容易生成。V-RAE 改以凍結的視覺基礎模型作編碼器,測試 DINOv3、SigLIP2、EUPE 及 V-JEPA 2.1 四種表徵。其後的可學習 attention pooling 把相鄰時間特徵合併,保留語意而縮短序列;帶 3D RoPE 的時空 Transformer decoder 再由每個 latent step 重建多幀畫面。訓練時只更新 pooling 與 decoder,生成階段則凍結 V-RAE,在 latent 上訓練 rectified-flow DiT。

作者在 Kinetics-600 測得 V-JEPA 2.1 版本的重建 rFVD 為 2.13;在相同 DiT 與訓練設定下,最佳版本的生成 gFVD 在 UCF101、K600 分別為 117.86 與 19.16,收斂速度最多快六倍。更值得注意的是,傳統 rFVD 與下游生成品質的 Pearson 相關只有 0.200、0.473。團隊因此提出 tFVD:在 latent 時序中插值、解碼後量度連貫性;它與生成品質的相關提高至 0.621、0.919。

這表示影片 tokenizer 的選型不應只看像素重建,語意結構與 latent 時間幾何也會直接影響 DiT 的樣本效率。可是實驗仍集中於 256×256、17 幀評估及類別條件生成,並使用 100 步 Euler 採樣;高維表徵 latent 也可能增加記憶體與注意力成本。截至查核,[專案頁](https://v-rae.github.io/)提供結果展示,但論文入口未列出公開程式或權重。下一步要看文字條件長影片、較低採樣步數與大規模開源重現能否保留相同優勢。

來源

  1. V-RAE: Rethinking Video Latent Spaces for Generation
  2. V-RAE project page