NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics
이 논문은 교육, 합성 데이터 생성 및 의사결정 지원을 위해 비용이 많이 드는 물리적 실험과 고전적 시뮬레이터 사이의 간극을 메우기 위해, 실시간 상호작용이 가능한 사실적인 수술 시뮬레이션을 160 FPS로 구현하고자 교사-학생 증류(teacher-student distillation)와 셀프 포싱(Self Forcing)을 활용한 컨트롤러 불가지론적(controller-agnostic) 실시간 생성 세계 모델인 Cosmos-H-Dreams을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수술실에서 성공적인 수술과 합병증 사이의 경계는 밀리미터와 밀리초 단위로 측정될 수 있습니다. 외과의들은 혈관을 꿰매거나 장기를 제거하는 것과 같은 섬세한 작업을 수행하기 위해 로봇 시스템에 의존하지만, 이러한 순간을 위한 훈련은 역사적으로 느리고 비용이 많이 들며 종종 위험한 과정이었습니다. 학습을 위해 훈련생은 동물 조직이나 카다버(해부용 시신)에서 연습할 수 있지만, 이는 유한한 자원이며 재사용할 수 없습니다. 또는 컴퓨터 시뮬레이션을 사용할 수도 있지만, 이러한 방식은 실제처럼 보이고 작동하는 데 오랫동안 어려움을 겪어 왔습니다. 시뮬레이션은 종종 연조직이 어떻게 물결치고, 피가 나며, 혹은 수술 도구의 열에 어떻게 반응하는지를 포착하는 데 실패하곤 합니다. 수십 년 동안 디지털 훈련장과 실제 수술실 사이의 간극은 넓게 유지되었으며, 이로 인해 외과의들은 직관과 제한된 연습 시간에 크게 의존해야 했습니다.
NVIDIA와 CMR Surgical의 연구진은 이제 이 간극을 메우는 시스템을 구축하여, 수술 로봇이 실시간으로 훈련하고 테스트할 수 있는 디지털 세계를 만들어냈습니다. 그들은 이 창조물을 Cosmos-H-Dreams라고 부릅니다. 미리 녹화된 영상을 재생하거나 딱딱하고 인위적으로 보이는 경직된 물리 엔진에 의依赖하는 기존의 시뮬레이션과 달리, 이 시스템은 외과의나 컴퓨터 프로그램의 움직임에 즉각적으로 반응하며 새로운 비디오 프레임을 실시간으로 생성합니다. 이것은 생성형 모델, 즉 수천 시간의 실제 수술 영상을 관찰함으로써 물리 법칙과 수술의 시각적 외형을 학습하는 인공지능의 한 종류입니다. 그 결과, 이 시뮬레이터는 실시간 상호작용이 가능할 정도로 빠르게 실행되어, 사람이 키보드나 헤드셋으로 가상 로봇을 제어하거나 컴퓨터 알고리즘이 물리적인 도구를 전혀 만지지 않고도 매듭을 묶는 법을 배울 수 있게 합니다.
이 성과의 핵심은 고품질의 비주얼과 속도의 필요성을 균형 있게 맞춘 두 부분의 전략에 있습니다. 연구진은 먼저 9가지 서로 다른 유형의 로봇 시스템에서 얻은 방대한 수술 데이터 컬렉션을 사용하여 거대한 "교사(teacher)" 모델을 훈련시켰습니다. 이 교사 모델은 수술 장면에서 다음에 어떤 일이 일어날지를 매우 높은 정확도로 예측하는 법을 배웠지만, 실시간 상호작용을 사용하기에는 너무 느렸습니다. 즉, 각 새로운 프레임을 계산하는 데 시간이 너무 오래 걸렸습니다. 이를 해결하기 위해 그들은 더 작고 빠른 "학생(student)" 모델을 만들었습니다. 그들은 학생 모델이 교사 모델의 예측을 모방하도록 학습시키는 '지식 증류(distillation)' 기법을 사용했는데, 훨씬 더 효율적인 방식으로 이를 수행했습니다. 학생에게 수십 단계가 아닌 단 두 단계만으로 짧은 비디오 프레임 폭발을 생성하도록 가르치고, 소프트웨어를 강력한 단일 컴퓨터 칩에서 실행되도록 최적화함으로써 팀은 속도의 돌파구를 마련했습니다. 이제 시스템은 단일 워크스테이션에서 약 160fps(초당 프레임 수)의 연속적인 사실적 수술 영상을 생성할 수 있으며, 이는 가상 현실이 이질적으로 느껴지게 만드는 지연 시간을 제거하기에 충분한 속도입니다.
이 시스템을 진정으로 독특하게 만드는 것은 어떤 소스로부터든 제어를 수용할 수 있는 능력입니다. 연구진은 시뮬레이터가 키보드를 치는 사람, 가상 현실 헤드셋을 착용한 외과의, 또는 Versius와 같은 상업용 수술 로봇 콘솔에 의해 구동될 수 있음을 입증했습니다. 또한 스스로 작업을 수행하는 법을 배우는 인공지능 정책에 의해서도 제어될 수 있습니다. 이러한 실험에서 AI는 자신이 생성한 영상을 관찰하고, 움직임을 결정한 다음, 그 움직임의 즉각적인 시각적 결과를 확인하며 학습의 폐쇄 루프(closed loop)를 형성합니다. 이는 이러한 상호작용이 가능한 실시간 월드 모델이 수술에 적용된 첫 사례로, 인간과 기계 모두가 합성된 환경 내에서 행동하고 그 결과를 즉시 관찰할 수 있게 합니다.
연구진은 디지털 세계가 실제 세계처럼 작동하는지 확인하기 위해 시스템을 엄격하게 테스트했습니다. 시뮬레이터가 수천 번의 봉합 작업을 수행하도록 하고, 그 결과를 동일한 작업을 물리적 로봇에서 수행했을 때와 비교했습니다. 결과는 작업 전반에 걸쳐 피어슨 상관계수 0.696을 기록하며 시뮬레이션과 실제 결과 사이에 중간 정도의 전반적인 일치도를 보여주었습니다. 그러나 특정 절차에 따라 성능은 상당히 달랐습니다. 시스템은 물체를 집어 던지는 것과 같은 작업에서는 상대적으로 강한 일치도를 보였으나, 핸드오버(물건 건네주기)나 매듭 묶기와 같이 더 복잡한 작업에서는 상관관계가 음수로 나타났는데, 이는 시뮬레이터가 실제 로봇이 실패한 지점에서 성공을 예측하거나 그 반대의 경우를 나타냈음을 의미합니다. 시스템은 대부분의 시но리오에서 연조직의 물리 법칙과 수술 도구의 거동을 정확하게 포착했습니다. 그러나 연구는 기술의 한계도 드러냈습니다. 시뮬레이션에 매듭을 묶는 과정에서 실이 스스로 겹쳐지는 것과 같이 극도로 미세하고 중첩되는 구조가 포함될 때, 시스템은 가끔 실의 모양을 실제와 다르게 환각(hallucination)하는 오류를 범했습니다. 이러한 오류는 더 느리고 정확한 교사 모델보다 빠른 실시간 버전에서 더 흔하게 나타났으며, 이는 시스템이 섬세한 조작을 위한 강력한 훈련 및 평가 도구이긴 하지만, 모든 유형의 정교한 조작에 대해 아직 완벽하지는 않다는 것을 시사합니다.
이러한 한계에도 불구하고, 이 연구의 함의는 매우 큽니다. 안전하고 확장 가능하며 사실적인 환경을 제공함으로써, Cosmos-H-Dreams는 수술 교육의 새로운 토대를 제공합니다. 외과의들은 이제 카다버나 동물이 필요 없이 복잡한 절차를 반복해서 연습할 수 있으며, 로봇 정책은 병원에 배치되기 전에 디지털 샌드박스에서 훈련되고 정교해질 수 있습니다. 연구진은 더 안전한 수술 로봇과 더 나은 훈련 도구의 개발을 가속화하기 위해 코드와 모델을 대중에게 공개했습니다. 현재 시스템은 테이블탑 봉합 작업에 집중하고 있지만, 팀은 이를 복잡한 해부학적 구조를 포함하는 전체 임상 절차로 확장하는 것을 구상하고 있습니다. 현재로서 이 시스템은 수술 훈련의 미래가 물리적인 실험실이 아니라, 실수가 안전하고 학습이 무한한 실시간 생성형 세계에 있을 수 있다는 것을 보여주는 개념 증명으로서 자리 잡고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.