機器人與世界模型
Cosmos-H-Dreams 將手術世界模型推進即時閉環,單張 RTX PRO 6000 生成約 160 FPS
NVIDIA 公開以少步擴散、自生成歷史蒸餾及串流 KV 快取打造的手術機器人生成式模擬器。系統已能即時接收機器人運動資料並合成下一段畫面,但視覺逼真度仍不能替代物理正確性及臨床驗證。

NVIDIA 7 月 27 日公開 Cosmos-H-Dreams,把原本用於離線推演的 Cosmos-H-Surgical-Simulator 蒸餾成可互動的因果世界模型。模型從初始 RGB 畫面與持續送入的機器人運動學資料出發,自回歸產生下一段手術影像;官方在單張 RTX PRO 6000 上報告約 160 FPS,相較標準教師模型約 10 FPS,已足以讓人類控制器或機器人策略在生成環境中形成閉環。
訓練管線先把雙臂 dVRK 的位移、旋轉和夾爪狀態映射至統一的 44 維動作表示,再以成功操作、掉針、漏穿及打結失敗等資料微調教師模型。訓練視野由 12 幀逐步延伸至 72 幀,學生模型則先模仿預先快取的教師去噪軌跡,學會因果注意力與串流 KV cache。後續的 self-forcing distillation 讓學生以自身生成畫面繼續推演,再由凍結教師提供分布匹配監督,降低訓練時只看乾淨歷史、部署時卻反覆累積自身誤差的落差。每個潛在幀最低只需兩個去噪步驟。
推論端的 FlashDreams 結合串流 KV cache、模型編譯與 CUDA Graph,並以 WebRTC、WebXR 接入瀏覽器鍵盤或 Meta Quest 控制器。程式、模型與適配自有資料的教師微調及蒸餾配方均已公開,工程團隊可測試合成資料、策略訓練和失敗情境重播。
關鍵限制在於 160 FPS 只衡量生成速度。官方尚未證明工具尖端位置、夾爪循環、組織反應、長時間漂移及模擬策略排名能與實機一致;目前模型也特化於 dVRK 桌面縫合。它是研發模擬器,不是診斷、術中影像或實體機器人控制系統,下一步應看閉環物理一致性與 sim-to-real 驗證,而非只比較影片品質。