生成式影音與 3D
StateFlow 以持久 3D 狀態取代逐鏡重生成,影片預視使用者評分達 4.5/5
StateFlow 把物件幾何、姿態、語意狀態及攝影機保存成可編輯的 3D 世界,再讓影片模型負責視覺潤飾。30 人實驗給予其影片預視 4.5/5 的整體評分,但系統依賴多個封閉模型,程式亦尚未公開。

北京交通大學、北京智源人工智能研究院等團隊提出 StateFlow,嘗試修正文字生成影片在反覆編輯時常見的物件漂移、空間關係改變及攝影機失控。系統不把每個鏡頭視為獨立生成任務,而是維護物件層級的持久世界狀態;每個物件包含幾何、3D 位置與姿態,以及外觀和事件狀態等語意屬性。後續換風格、移動物件或破壞場景時,只更新受影響的狀態記錄。
建構階段先生成正視圖與鳥瞰圖:前者提供物件外觀,後者約束全域布局。若兩張圖的物件數量或位置衝突,VLM 會判斷哪些是幻覺、哪些應保留,再以碰撞、邊界及語意先驗調整 3D 包圍盒;各物件圖像之後交由 Hunyuan3D 轉成資產。攝影機規劃則採「提出—渲染—修正」迴圈:VLM 先依導演意圖產生軌跡,低成本渲染器實際檢查遮擋、取景、碰撞與運動問題,再局部修改距離、視角、焦點或視野。
作者以 Gemini 3.1、Nano Banana 2、Hunyuan3D 與 Seedance 2 組成實驗系統。3D 場景比較中,StateFlow 的 CLIP-I 為 0.788,高於 SynCity 的 0.689;CLIP-T 為 30.214,亦高於 22.880,但 HPS V2 反而由 SynCity 領先。30 名參與者針對每種設定的 12 個提示評分,StateFlow 在場景與最終影片的整體平均均為 4.5/5,影片基線最佳為 Seedance 2 的 3.6。
結果仍不能視為通用世界模型突破:測試沒有真實 3D 場景作幾何基準,自動評審又使用同一款 Gemini 3.1,且專案頁面的程式連結仍標示「soon」。完整流程需要數分鐘並依賴多個第三方模型;工程上最值得追蹤的是程式公開後,狀態格式能否跨生成器重播,以及成本、失敗率和長序列編輯是否仍保持一致。