世界模型與影片生成
AlayaWorld v1.1 改用串流 3D 點快取,長時影片一致性評分升至 89.5
AlayaWorld 重寫互動式世界模型的空間記憶與條件管線,讓攝影機控制、歷史畫面及生成內容使用對齊的因果 VAE 表徵。新報告在 WBench 取得最高一致性總分,但新版權重與推論程式尚未同步公開。

Alaya Lab 於 8 月 13 日公開 AlayaWorld v1.1 技術報告;模型骨幹、訓練資料及逐段自回歸生成方式維持不變,主要更新集中在條件訊號如何表示與注入。舊版把深度圖扭曲成空間記憶,並透過獨立的 AdaLN 分支輸入攝影機參數;新版則在每段影片生成後,把逐像素三維點登記到持久快取,再從下一段的計畫視角重新渲染。渲染結果經相同的因果 VAE 編碼後,直接同時承擔幾何記憶與視角控制。
團隊亦把靜態首幀改成九幀的動態條件、在像素空間對齊歷史窗口,並將「把記憶 token 歸零」改成真正移除 token。這些修改旨在消除訓練與逐段推論之間的時間邊界、序列長度及 latent 統計差異;無效的 3D 渲染區域也會刪除 token,以保持 FlashAttention 相容性。
在 WBench 的 158 個導航案例中,AlayaWorld 的一致性平均分為 89.5,高於八個比較系統;背景、透視及幾何一致性分別達 94.1、86.6 與 94.1。不過它的場景設定分只有 51.6,因果忠實度為 65.1,顯示畫面能記住空間,並不等於模型掌握環境語意或物理因果。
部署者目前還不能把論文數字直接視為可重現版本。公開倉庫仍描述舊有 AdaLN 與 Depth-Anything-3 路徑,「改良權重」亦列為待發布;訓練程式和部分資料同樣未釋出。下一個關鍵里程碑是新版權重、ViGeo 點快取實作及可對照的 WBench 評測設定是否同步落地。