NVIDIAが手術ロボット向けリアルタイム生成シミュレータ「Cosmos-H-Dreams」を発表
要点
-
NVIDIAは、手術支援ロボットの動作モデルを自律的に訓練・評価するためのリアルタイム生成シミュレータ「Cosmos-H-Dreams」を発表した。
-
先行する大型モデルの機能を高速な「学生モデル」に蒸留し、単一のGPUで遅延のない双方向シミュレーションを可能にした。
-
研究用ロボット「dVRK」の卓上縫合操作に特化し、針の落下や結び目の作成失敗といったエラー動作も高精度に再現する。
-
医療機器メーカー等と協力し、実際の手術支援ロボット「Versius」の外科医用コントローラーと統合したリアルタイム動作を実証している。
-
NVIDIAは2026年7月27日、手術支援ロボティクスの動作評価と学習を安全かつ高速に進めるための、リアルタイムでロボットのアクションに連動する生成シミュレータ「Cosmos-H-Dreams」を発表した。本モデルは、ロボットの動作指示に連動して手術の映像を生成するワールド基盤モデル(物理環境の視覚的変化を予測するAI)をベースに、推論ステップを抑えた軽量なモデルへと蒸留(大型モデルの知識を高速な小規模モデルに引き継ぐ手法)したものである。単一のGPU上で動作し、人間やロボットを制御するAIモデルの出力に合わせたインタラクティブな操作を可能にしている。
-
手術支援ロボティクスの開発は現在、人間による遠隔操作から、視覚・言語・行動データを統合して次の動作を決定する「ビジョン・ランゲージ・アクション(VLA)ポリシー」を用いた自律制御へと急速に移行している。しかし、これらのシステムの訓練や評価は容易ではない。物理ロボットの運用はコストが高く、実験の再現にも時間がかかるほか、動作の失敗が手術器具や生体組織の破損につながるリスクがある。従来の物理演算に基づくシミュレータも存在するが、変形する生体組織、微細な器具操作、光を反射する表面、縫合糸や針の挙動、手術時の煙、器具による視界の遮蔽(オクルージョン:手前の物体が奥の物体を隠す現象)といった複雑な手術環境をプログラムで正確に再現することは極めて困難であった。
-
この課題に対し、あらかじめすべての物体や物理法則を手動で構築するのではなく、実際の映像とロボットの運動学(キネマティクス)から物理的変化を直接学習するアプローチが注目されている。NVIDIAがすでに提供している「Cosmos-H-Surgical-Simulator」は、初期画像とロボットの一連のアクションを入力に、その結果生じる手術映像を予測・生成するモデルであり、オフラインでのポリシー評価やデータ生成に活用されてきた。
-
今回発表された「Cosmos-H-Dreams」は、このシミュレーション能力をリアルタイムに動作させることを目指して開発された。研究用手術支援ロボットのプラットフォームである「da Vinci Research Kit(dVRK)」を用いた卓上での縫合操作に特化し、自己回帰的(過去の生成映像を元に次の映像を順次生成する手法)にシーンを描写する軽量な「学生モデル」へと再構築されている。
-
Cosmos-H-Dreamsは、最初の画像フレームとロボットの運動学データのライブストリームを受け取り、次のフレーム群を瞬時に生成する。これにより、人間やAIの動作モデルが直接介在する「クローズドループ」(動作結果を逐次フィードバックして次の制御に反映する仕組み)の環境が実現した。本モデルはNVIDIAの高速ストリーミング推論ライブラリ「FlashDreams」を介して提供され、単一の「NVIDIA RTX PRO 6000」GPUで実行できる。すでに医療機器メーカーのCMR SurgicalやCambridge Consultantsとの共同開発により、手術支援ロボット「Versius」の外科医用コントローラーと統合したリアルタイム運用も実証されている。
-
映像の再現精度を保ちながら生成コストを抑えるため、Cosmos-H-Dreamsの学習には「教師・生徒(Teacher-to-Student)学習パイプライン」が用いられた。まず教師モデルとして、NVIDIAの「Cosmos-Predict2.5-2B」をベースにロボットデータセット「Open-H-Embodiment」で追加学習したモデルを使用。dVRKモデルの構築においては、ロボットアーム先端部(エンドエフェクター:対象物に直接作用する器具やグリッパー)の移動、回転、グリッパーの開閉といった双腕のアクションデータを44次元の共通表現にマッピングした。
-
さらに教師モデルは、ジョンズ・ホプキンス大学(JHU)のdVRK卓上縫合データセットを用いてファインチューニング(微調整)されている。このデータセットには、縫合の成功例だけでなく、針の落下、縫合糸を通し損ねる動作、結び目の作成失敗といった「失敗例」や、学習データにない「分布外(Out of Distribution:AIの学習データに含まれていない想定外の状況)」のイレギュラーなエピソードが意図的に含まれている。ロボットの動作モデルを正確に評価するためには、失敗した際の視覚的な結果も再現できる必要があるため、これらの失敗データの学習が重要な役割を果たしているという。
-
NVIDIAは本プロジェクトのリポジトリをGitHubで公開しており、物理的な危険を伴わない、安全かつ高速な手術ロボット訓練環境の構築に貢献するとしている。