世界模型/影片生成
AlayaWorld v1.1 改用串流 3D 點快取,長時世界模型一致性得分升至 89.5
AlayaWorld 沒有更換15B主幹或訓練資料,而是重寫視覺條件、記憶與相機控制的介面。新版在158個導航案例取得最高一致性平均分,但物理因果與導航指標仍未領先。

Alaya Lab 公開 AlayaWorld v1.1 技術報告,焦點不是擴大15B參數模型,而是修正條件訊號與生成 latent 之間的表示落差。原有的 chunk-wise 自回歸骨架與訓練資料保持不變;新版把基於深度 warping 的空間記憶換成串流 3D point cache,每生成一個片段,便把逐像素三維點註冊到持久快取,再從下一段預定相機位置重新渲染。相機軌跡會依既有位移做尺度對齊,內參則由點圖擬合後固定。
第二項核心改動是讓條件與輸出共用同一套 causal VAE 時序規則。靜態圖片不再單幀編碼,而會放進九幀窗口取得帶時間上下文的 latent;跨 chunk 交接亦使用相同方法。時間記憶則先在像素空間對齊25幀,再精確編成四個 latent,避免舊版 off-by-one 邊界混入上下文。記憶 dropout 也由保留位置的全零 token,改為直接移除 token,令訓練真正看見與首次推論相同的無記憶序列。
新版還刪除獨立的 camera AdaLN 分支,將相機控制完全改由3D快取在目標視角下的重渲染結果表達。這使視差、遮擋及尺度都經相同視覺 latent 進入模型,也讓有效區域可直接使用 FlashAttention。
在 WBench 的158個導航案例中,AlayaWorld 一致性平均分為89.5,為九個受測系統最高;背景、透視、主體及幾何一致性亦居首。不過導航得分80.0,低於HY-World 1.5的87.5;物理平均分63.1也落後最高的69.1,顯示保存場景不等於正確模擬因果。更重要的是,GitHub目前仍把「improved weights」與訓練程式列為未完成,公開快速入門也描述舊版DA3與AdaLN路徑。工程師應等待新版權重、程式與消融結果對齊後,再判斷這次架構更新能否獨立重現。