世界模型與生成影片
ReWorld 以姿態索引地標庫固定 KV 預算,讓互動世界模型走遠後仍能返回原景
ReWorld 把短期動作控制與長期場景記憶分配給不同注意力範圍,再以固定容量的地標庫保存歷史。作者展示 704×1280 即時串流及 64 秒返回軌跡,但目前只有論文和示範頁,尚未發布權重或程式碼。

香港科技大學(廣州)與阿里巴巴研究人員提出 ReWorld,針對互動世界模型的結構性衝突:精確回應鍵盤或相機動作需要集中注意最近畫面,記住很久以前到過的地點卻要求保存完整歷史。若只用滑動窗口,舊場景很快被逐出;保留完整 KV cache,顯存則會隨旅程持續增長。
ReWorld 在訓練時混合不同長度的逐 head 注意力窗口,多數 head 只看近期,一小部分可讀取長期歷史;隨機 head routing 避免控制或記憶能力固定依賴特定 head,隨機丟棄歷史 chunk 則讓稀疏記憶成為訓練分布的一部分。推論時,系統以固定大小 KV cache 搭配姿態索引的 landmark bank:攝影機移動足夠距離才寫入地標,生成下一段畫面時再按目前姿態取回鄰近視圖,因此記憶成本不隨總路程線性增加。
資料管線把 Unreal 渲染、遊戲漫遊及真實影片等八類來源對齊至同一物理尺度,使相同控制輸入代表相同移動距離;回文式往返軌跡則專門提供「離開後返回」的監督訊號。模型再以限制在 LoRA adapter 的分布匹配蒸餾,把擴散採樣壓至四步,同一 backbone 可切換高畫質多步模式和 704×1280 即時串流模式。
作者稱其相較六個近期系統取得 11.95 度旋轉誤差及最佳相機動作一致性,固定 12-chunk cache 在 64 秒、384 個 latent 的往返測試仍能重建起點。不過影片與評測均由團隊自行提供,網站沒有權重、訓練資料或可執行程式。工程上應等待實測幀率、硬件與顯存配置、地標庫容量消融,以及在自由探索、動態物件和累積姿態誤差下的長時間穩定性。