返回首頁

世界模型與生成式影片

Code World Model 以可執行程式保存世界狀態,再交由影片模型渲染

新框架讓 coding agent 維護規則與長期後果,再把狀態編譯成深度及語義代理影片,約束 MiniMax-H3 生成畫面。原型展示了五組受控場景,但沒有量化基準、消融實驗或即時生成結果。

President (1969-1974 : Nixon). White House Gift Unit. 1/20/1969-8/9/1974 · Public domain · Image source
zh-Hant

西湖大學與南洋理工大學研究者提出 [Code World Model](https://arxiv.org/abs/2608.25927),把「世界如何演化」與「世界看起來如何」拆成兩條計算路徑。coding agent 負責解讀事件、撰寫或修改程式;可執行程式則在每個 tick 更新位置、關係、規則及事件歷史。相較只從短影片推測下一幀,這種狀態可以保留已離開鏡頭的角色,以及要在較長時間後才發生的後果。

系統不直接把程式碼餵給影片生成器,而是將更新後的狀態確定性地編譯成逐幀 proxy video。原型以固定對數深度圖及語義 ID 圖表示場景佈局、物件位置、遮擋、移動路徑與攝影機軌跡;文字提示則補上身份、外觀及動作語意。影片模型因此負責紋理與細緻運動,而不必同時猜測隱藏規則。

研究者以 MiniMax-H3 Ref2VA 為視覺骨幹,從 157 段、約 5.6 小時遊戲錄影建立 9,420 組五秒配對資料。訓練在全部 50 個 Transformer block 加入 rank-128 LoRA,約有 596M 可訓練參數,使用八張 H800 跑三個 epoch。目標影片包含 124 幀、解析度 1344×768、24 FPS;輸入 proxy 則降至 336×192,顯示中介表示刻意只保留粗略時空約束。

[專案頁](https://buaacyw.github.io/cwm/)展示長時間維持同一世界狀態、每 60 秒更換視覺風格,以及不同角色和場景的生成例子。論文聲稱模型能跟隨物件位置、相機與運動約束,但證據只有五組定性案例,沒有控制準確率、影片品質、延遲或對照消融;真實影像管線亦只示範如何從 KITTI-360 幾何資料建立 proxy,實際微調仍使用遊戲資料。這較適合視為可檢查狀態與生成式渲染之間的介面原型,而非已可即時運行的開放世界引擎。下一步關鍵是釋出完整程式、加入長程狀態壓力測試,並量化代理改寫錯誤會如何傳播至視覺結果。

來源

  1. Code World Model: Coding Agent as World Brain
  2. Code World Model Project Page
  3. buaacyw/code-world-model