返回首頁

最新模型

FLUX 3 Action 開放權重,將影片與動作納入共同去噪

模型提供 DROID 與 SO-101 權重及微調流程,RoboLab 公開榜單列出約 42.9% 成功率。控制迴圈仍須由應用程式處理,規劃涵蓋時間不能當成推論延遲。

VulcanSphere · Public domain · Image source
zh-Hant

Black Forest Labs 於 9 月 23 日公布 FLUX 3 Action,開放七十億參數世界動作模型的權重與訓練程式,並提供 DROID、SO-101 機械臂的策略權重。模型接收攝影機影像、目前狀態與文字指令,同時預測後續動作及視覺結果,讓開發者以示範資料調整特定任務。[官方公告](https://huggingface.co/blog/black-forest-labs/flux-3-action)

架構採擴散 Transformer,將影片與動作放進同一序列共同去噪;凍結的影片 VAE 負責影像編碼,文字條件由凍結的 Qwen3-VL-4B 編碼。不同機器形態使用各自的動作輸入投影與輸出層,因此更換機械臂時,仍要對齊關節定義、狀態單位與攝影機配置,不能只讓向量長度相同。[架構說明](https://huggingface.co/blog/black-forest-labs/flux-3-action)、[微調資料契約](https://docs.bfl.ai/flux_3/flux3_action_finetuning)

RoboLab-120 公開榜單列出 1,200 次試驗中成功 515 次,成功率約 42.9%,高於同表 Cosmos3-Nano-Policy 的 36.8%。但這是模擬基準;FLUX 在複雜任務分組的成功率為 28.2%,也未領先所有模型。整體排名不能直接代表各類操作、實體環境或部署成本均占優勢。[RoboLab 榜單](https://research.nvidia.com/labs/srl/projects/robolab/leaderboard.html)

實際控制還要區分「預測多遠」與「多久算完」。DROID 預設每次產生並執行 32 個動作,以 15 Hz 計約涵蓋 2.13 秒;SO-101 獨立執行設定產生 42 個動作、執行其中 32 個,以 30 Hz 計約 1.07 秒後再規劃。這些時間不包含模型運算,不能當成推論延遲。[控制迴圈文件](https://docs.bfl.ai/flux_3/flux3_action_inference)

文件也說明,新的觀測只會影響下一輪規劃,不會取代佇列內尚未執行的指令;同步推論可能延誤控制節拍,應用程式仍須負責攝影機擷取、命令執行與排程。官方實機影片採四倍速並剪去規劃停頓,工程團隊應以未剪輯流程量測反應時間,而非從示範畫面推算即時性。[執行限制](https://docs.bfl.ai/flux_3/flux3_action_inference)、[示範條件](https://huggingface.co/blog/black-forest-labs/flux-3-action)

公開程式提供完整微調、續訓與匯出流程,SO-101 的任務 LoRA 則走 LeRobot 整合。這使研究者能檢查控制管線,分開評估模型能力與執行排程造成的失敗。後續值得追蹤的是各權重版本的成功率與控制延遲能否重現,以及新場景下的失敗恢復表現。程式採 Apache-2.0,模型權重另採 FLUX Kommunity License,商用與衍生模型用途須依權重條款核對。[程式庫](https://github.com/black-forest-labs/flux-action)、[權重授權](https://huggingface.co/black-forest-labs/flux-3-action-base/blob/main/LICENSE.md)

來源

  1. FLUX 3 Action: a world action model you can fine-tune
  2. Fine-tune FLUX 3 Action
  3. RoboLab-120 Leaderboard
  4. Run FLUX 3 Action
  5. FLUX 3 Action 公開訓練與推論程式
  6. FLUX 3 Action 權重授權條款