機器人與世界模型
Cosmos-H-Dreams、手術世界モデルをリアルタイムの閉ループへ前進、RTX PRO 6000 1基で約160 FPSを生成
NVIDIAは、少数ステップ拡散、自己生成履歴を用いた蒸留、ストリーミングKVキャッシュによって構築した手術ロボット向け生成シミュレーターを公開した。システムはロボットの運動データをリアルタイムで受け取り、次の映像区間を合成できるが、視覚的なリアリティは物理的な正確性や臨床検証の代替にはならない。

NVIDIAは7月27日、オフラインでのロールアウトに使われていたCosmos-H-Surgical-Simulatorを、対話可能な因果世界モデルへ蒸留したCosmos-H-Dreamsを公開した。このモデルは、初期RGB画像と継続的に入力されるロボットの運動学データを基に、次の手術映像区間を自己回帰的に生成する。公式発表では、RTX PRO 6000 1基で約160 FPSを達成し、約10 FPSの標準的な教師モデルと比べ、人間の操作者やロボットポリシーが生成環境内で閉ループを形成するのに十分な速度に達している。
トレーニングパイプラインでは、まず双腕dVRKの並進、回転、グリッパー状態を統一された44次元のアクション表現にマッピングし、成功した操作、針の落下、縫合の取りこぼし、結紮失敗などのデータで教師モデルをファインチューニングする。トレーニング時の時間窓は12フレームから72フレームへ段階的に拡張される。学生モデルは、事前にキャッシュされた教師モデルのデノイジング軌跡を最初に模倣し、因果アテンションとストリーミングKV cacheを学習する。その後のself-forcing distillationでは、学生モデルが自ら生成した映像を使ってロールアウトを継続し、凍結した教師モデルが分布マッチングの監督信号を提供する。これにより、トレーニング時にはクリーンな履歴だけを見る一方、デプロイ時には自己生成誤差が繰り返し蓄積するというギャップを縮小する。各潜在フレームの生成に必要なデノイジングステップは最少2回である。
推論側のFlashDreamsは、ストリーミングKV cache、モデルコンパイル、CUDA Graphを組み合わせ、WebRTCとWebXRを通じてブラウザのキーボードやMeta Questコントローラーから操作できる。コード、モデルに加え、独自データへ適応させるための教師モデルのファインチューニングおよび蒸留レシピも公開されており、エンジニアリングチームは合成データ、ポリシートレーニング、失敗シナリオのリプレイを検証できる。
重要な制約は、160 FPSが生成速度のみを示す指標である点だ。ツール先端の位置、グリッパーの開閉サイクル、組織反応、長時間のドリフト、シミュレーション上のポリシー順位が実機と一致することは、公式にはまだ実証されていない。現時点のモデルは、dVRKによる卓上縫合にも特化している。これは研究開発用シミュレーターであり、診断、術中イメージング、実ロボットの制御システムではない。今後注目すべきなのは、映像品質の比較だけではなく、閉ループでの物理的一貫性とsim-to-real検証である。