返回首頁

應用研究

ByteDance UniVR 讓模型在視覺空間中推理、模擬動態並規劃長期行動

UniVR 嘗試只從視覺示範共同學習複雜推理、物理動態與長期規劃。ByteDance 同步公開 34B Planning 檢查點,為不依賴文字思考鏈的視覺代理研究提供可測試基線。

ByteDance · Public domain · Image source
zh-Hant

ByteDance 研究團隊在 7 月 14 日公開 UniVR 論文與 UniVR-34B-Planning 檢查點,主張以統一模型從純視覺示範學習細粒度物理動態、複雜推理及長期規劃。不同於先把畫面轉成文字描述、再由語言模型產生步驟,UniVR 嘗試在視覺表徵空間中預測後續狀態與行動,使模型能保留難以用文字完整表達的空間關係、物體接觸與連續變化。

這條路線對機器人、遊戲代理與電腦操作特別重要。文字思考鏈方便檢查,卻可能丟失幾何和時間資訊;直接生成或比較未來視覺狀態,理論上能讓規劃器評估「採取某動作後會看到什麼」。但視覺 rollout 也容易累積誤差:早期生成的一個位置偏移,經多步迭代後可能變成完全不同的場景。模型也可能學到畫面上的相關性,而非可轉移的物理規則。

開放檢查點讓研究者可測試規劃能力是否來自記憶、資料重疊或真正的狀態預測。接下來應觀察封閉迴路控制,而不只是離線影片指標;重要測試包括未見物體、攝影機視角變化、外力擾動、長時程誤差與真實世界遷移。34B 規模仍會限制邊緣部署,實際機器人系統可能需要蒸餾、動作分層或把視覺世界模型放在較低頻率的規劃迴圈中。

來源

  1. UniVR: Thinking in Visual Space for Unified Visual Reasoning
  2. ByteDance/UniVR-34B-Planning model card