返回首頁

世界模型/多模態生成

EchoWM 把六自由度導航與原生聲音合入世界模型,但互動版程式尚未發布

京東 Joy Future Academy 團隊提出 EchoWM,以統一軌跡介面控制第一及第三人稱的 720p 影音世界。論文稱系統為「開放」模型,但目前連結的程式庫仍只提供長影片管線,EchoWM 程式與權重尚待釋出。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

EchoWM 的技術重點不是在影片生成器外接音效,而是讓同一模型按連續導航輸入,同步生成 720p 畫面、環境聲、音樂及語音。系統把鍵盤等離散指令和連續相機姿態轉成具有公制尺度的相對六自由度軌跡;第一人稱場景據此移動觀察者,第三人稱場景則由模型學習相機、角色與載具的聯動,不必為每種視角建立獨立控制器。

訓練資料混合內部及網路遊戲影片、Unreal Engine 模擬和一般網路影片,分別補足精確幾何與豐富聲音。訓練流程先延續影音預訓練,再凍結主幹、只訓練軌跡通道,其後低學習率聯合微調,最後以模型自行生成的歷史做自回歸後訓練。四步因果版本 EchoWM-Flash 則面向較低延遲的連續生成。

論文在 WBench 的 158 個導航案例及 SANA-WM-Bench 報告領先或前列結果,並展示多輪返回既有場景。不過這些仍是作者評測:模型沒有顯式持久化 3D 記憶,長時間運行後幾何、角色、狀態與聲音都可能漂移;可控制速度、位移和旋轉也受訓練資料範圍限制。更重要的是,官方 GitHub 目前明言 JoyAI-Echo 1.5 程式「即將發布」,現有推論程式主要服務文字生成長影片,不能重現 EchoWM 的互動導航。工程團隊應等待互動權重、端到端延遲、顯存需求及第三方重跑結果,再判斷它能否成為即時模擬器。

來源

  1. EchoWM: Open and Enterable Omnimodal World Models
  2. JoyAI-Echo repository