返回首頁

具身 AI/機器人

FLUX-mimic 以影片生成骨幹預測機器人動作,單張 RTX 5090 將反應時間壓至 101 毫秒

Black Forest Labs 與 mimic robotics 把 FLUX 3 的影片世界模型接上輕量動作解碼器,用同一套表徵處理視覺預測與機器人控制。團隊在軟性零件分揀自測達 95% 成功率,但模型、資料與完整評測尚未公開。

VulcanSphere · Public domain · Image source
zh-Hant

Black Forest Labs 與 mimic robotics 發表 FLUX-mimic,嘗試把生成影片時學到的物理動態直接轉成機器人控制。其基礎 FLUX 3 從一開始便聯合訓練影像、影片與音訊;團隊再加入動作模態,並以人類操作影片、穿戴式裝置示範、遙控及實際部署資料補強機器人能力。BFL 表示,加入動作預測初期曾使影片品質下降最多 10%,但約 3,500 個訓練步驟後恢復原有水準,顯示生成與控制可共用骨幹,而不必長期犧牲內容生成能力。

推論時,系統不需要先生成完整影片再解析動作。FLUX 3 骨幹預測場景如何演變,緊湊的動作解碼器直接讀取其中的潛在表徵,以去噪方式產生一段機器人動作;世界模型只需執行一次前向傳播。mimic 同時讓感測器、模型與致動器管線重疊執行,宣稱骨幹在單張 RTX 5090 上少於 80 毫秒,整體反應時間為 101 毫秒。

在真實機器人的軟性物件分揀任務中,預覽版未做單一任務微調便取得 95% 完成率;團隊列出的比較基線分別為經其資料調整的 π0.5(55%),以及針對該任務大量後訓練的 flow-matching policy(70%)。Audi 也正測試車門組裝、密封條及線纜處理等案例。

這項工作值得注意之處,是把大量無動作標註的人類影片納入機器人資料管線,降低對昂貴遙控示範的依賴。不過,成功率、比較設定與「部署」描述都來自合作團隊;權重、訓練資料、試驗次數及跨機器人結果尚未公開。接下來應觀察它能否在獨立評測、不同硬體及分布外任務維持可靠度,以及失敗時是否具備可驗證的安全停止機制。

來源

  1. FLUX 3 x mimic: The Next Generation of Video-Action Models
  2. Introducing FLUX-mimic: Scaling Video-Action Models for General Purpose Dexterity
  3. FLUX 3 Model Overview: Multimodal Flow Models for Image, Video, Audio, and Action Prediction