返回首頁

多模態模型

Cosmos 3 Edge 將世界模型縮至 4B,單 GPU 同時處理視覺、文字與機器人動作

NVIDIA 開放 Cosmos 3 Edge 權重與推論流程,以 4B Mixture-of-Transformers 結合自回歸推理及擴散式多模態生成。模型可接收文字、影像與動作軌跡,並另提供以 DROID 資料調整的機器人策略版本,但物理一致性與邊緣裝置延遲仍需獨立驗證。

ESO/G. Vecchia · CC BY 4.0 · Image source
zh-Hant

NVIDIA 釋出 Cosmos 3 Edge,將原先面向資料中心的 Cosmos 3 世界模型縮小到 4B 規模,定位為單 GPU 及邊緣端物理 AI 的起點。模型沿用 Mixture-of-Transformers 架構:自回歸 Transformer 負責離散文字與推理輸出,擴散 Transformer 則透過反覆去噪產生影像、影片、音訊或動作等連續訊號。兩條生成路徑放在共同框架中,目的不是單純做視覺問答,而是讓系統能從觀察推斷未來狀態,再產生模擬內容或控制序列。

公開套件包含通用 Cosmos3-Edge,以及依 DROID 機器人操作資料調整的 Cosmos3-Edge-Policy-DROID。輸入介面支援文字、RGB 影像與二維動作軌跡;後者可表示關節位置、夾爪狀態或相機姿態等逐幀控制值。配套的 Cosmos Framework 提供推論、訓練及評估流程,並列出 DROID、LIBERO 與物理合理性評分等訓練配方。這使研究者能在同一架構內比較視覺推理、世界生成及策略學習,而不必串接彼此獨立的語言模型、影片模型與控制模型。

「Edge」仍不等於任何嵌入式平台都能即時運作。部署所需的實際顯存、量化方式、影像解析度、影片長度與擴散步數都會顯著改變延遲;模型卡亦警告空間幾何、因果關係、時間順序及物體狀態可能被錯判。工程團隊下一步應關注 Jetson 與桌面 GPU 上的端到端基準、閉迴路操作成功率,以及模型產生錯誤未來預測時,控制器能否透過安全限制及即時感測避免把幻覺轉成實體動作。

來源

  1. Introducing Cosmos 3 Edge
  2. NVIDIA Announcements at SIGGRAPH 2026
  3. Cosmos3-Edge Model Card
  4. Cosmos 3: Omnimodal World Models for Physical AI
  5. NVIDIA Cosmos Framework