視覺模型/自監督學習
LeVJEPA 移除目標編碼器與預測器,影片預訓練算力最多降至 V-JEPA 2 的二十分之一
LeVJEPA 以單一編碼器、跨視圖不變性損失及 SIGReg 防止表徵坍塌,不再依賴 EMA 目標網路、stop-gradient 或像素解碼器。作者在相同資料與訓練週期下報告 5.6 至 20.8 倍算力差距,但結果仍限於團隊重訓的凍結編碼器基準。

影片自監督學習通常以兩種方式避免表徵坍塌:V-JEPA 類方法維持指數移動平均目標編碼器、停止梯度及容量受限的預測器;VideoMAE 類方法則重建被遮蔽的像素。LeVJEPA 改用同一個 ViT 編碼器處理一段 16 幀影片的全域與局部視圖,最小化各視圖 `[cls]` 嵌入之間的均方誤差,再以 SIGReg 約束嵌入分布接近各向同性高斯,排除所有樣本映射至同一向量的平凡解。訓練圖因此只剩編碼器與投影器,梯度可同時流經比較的兩端。
另一項節省來自隨機丟棄輸入 token。作者在 Kinetics-710 的相同 20% 子集訓練 ViT-S、B、L 240 個 epoch;相較自行重訓的 V-JEPA 2,LeVJEPA 使用少 5.6 至 20.8 倍總 FLOP,準確率相近或更高。以相同算力比較 ViT-B 時,其 ImageNet-1K 凍結探測 top-1 為 61.0%,V-JEPA 2 為 51.6%;Kinetics-400 為 44.6% 對 40.7%,但 Something-Something-v2 反而以 40.4% 落後 42.5%。這說明「20 倍」不是所有模型、資料集都能取得的固定加速,也不是端到端影片理解的通用勝率。
LeVJEPA 還能採用區塊因果注意力:同一幀內雙向注意、跨幀只讀取現在與過去。測試未見凍結探測準確率下降,新增影片幀時亦毋須重新編碼歷史幀,對串流感知及自回歸世界模型尤其實用。專案已公開程式碼與 checkpoint;下一步應觀察獨立重現、在更大且更多樣影片上的縮放結果,以及低成本預訓練能否轉化為偵測、追蹤、規劃與機器人控制的實際收益。