返回首頁

世界模型與強化學習

WorldCycle 用可逆動作自製驗證訊號,影片世界模型複合動作準確率提升四倍

WorldCycle 把動作及其反向操作組成封閉迴圈,無須真實未來影片即可量測長期狀態漂移。研究在 8B 影片世界模型上降低最多 44% 的循環誤差,複合動作準確率由 0.136 升至 0.553。

Jim.henderson · CC0 · Image source
zh-Hant

互動式影片世界模型會逐段生成動作後的畫面,但細小轉移誤差可在數百幀後累積成顏色、幾何與物件位置漂移。一般軌跡沒有唯一的真實未來影片,因而難以建立長距離強化學習獎勵。[WorldCycle](https://arxiv.org/abs/2608.04964)利用一個可解析驗證的例外:若模型先執行一串可逆動作,再依相反次序執行逆動作,最終狀態理應回到起點。

方法不只比較最後一幀。空間閉合獎勵把正向軌跡中的每個局部狀態,對齊逆向路徑的鏡像狀態,讓錯誤位置可被密集定位;時間一致性獎勵則重複執行同一封閉迴圈,比較各輪相同階段的畫面,懲罰隨時間增加的漂移。研究以 8B WorldPlay 自回歸檢查點為起點,使用約 4,000 組真實場景圖片與文字,於 8 張 H200 上後訓練三天;每次訓練即時產生封閉及重複軌跡,不需要人工標註對應的未來影片。

團隊另建 CycleBench,以 47 條動作軌跡、380 張初始畫面測試可逆、封閉、重複及串接迴圈,最長 rollout 達 381 幀。相較同樣由 WorldPlay 後訓練的 WorldCompass,WorldCycle 在 125 幀設定把 ESC 降低 32%、RPS 降低 44%;381 幀設定的 RCS 降低 34%。未見於基礎訓練的複合動作上,準確率由 WorldPlay 的 0.136 升至 0.553,約為四倍,也比 WorldCompass 高 11%。專案另以 HPSv3 與 VBench 檢查畫質,未觀察到以閉環一致性換取明顯視覺退化。

[研究展示頁](https://nevsnev.github.io/Worldcycle/)提供同步影片與逐項結果,但截至查閱時未列出程式碼或權重下載。更大的限制是驗證訊號只適用於可逆且淨變換已知的動作;它能改善狀態轉移的一致性,尚不能證明模型理解不可逆事件、碰撞或物體生成。下一步應觀察閉環訓練能否轉移至機器人規劃,以及第三方能否在不同世界模型上重現收益。

來源

  1. WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
  2. WorldCycle — Self-Verifiable RL for Video World Models