← Neueste Arbeiten
💻 computer science

NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics

Das Papier stellt Cosmos-H-Dreams vor, ein echtzeitfähiges, controller-agnostisches generatives Weltmodell, das Teacher-Student-Distillation und Self Forcing nutzt, um interaktive, fotorealistische chirurgische Simulationen mit 160 FPS zu ermöglichen und so die Lücke zwischen kostspieligen physikalischen Experimenten und klassischen Simulatoren für die Ausbildung, die Generierung synthetischer Daten und die Entscheidungsunterstützung zu schließen.

Ursprüngliche Autoren: Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

Veröffentlicht 2026-08-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Im Operationssaal kann die Spanne zwischen einem erfolgreichen Eingriff und einer Komplikation in Millimetern und Millisekunden gemessen werden. Chirurgen verlassen sich auf Robotersysteme, um delikate Aufgaben wie das Vernähen von Blutgefäßen oder das Entfernen von Organen auszuführen, doch das Training für diese Momente war historisch gesehen ein langsamer, teurer und oft gefährlicher Prozess. Um zu lernen, könnten Auszubildende an tierischem Gewebe oder an Leichen üben – Ressourcen, die endlich sind und nicht wiederverwendet werden können. Alternativ könnten sie Computersimulationen nutzen, doch diese haben lange Zeit damit gekämpft, so auszusehen und sich so zu verhalten wie das Original; sie versäumen es oft, einzufangen, wie sich weiches Gewebe kräuselt, blutet oder auf die Hitze eines chirurgischen Instruments reagiert. Jahrzehntelang blieb die Lücke zwischen dem digitalen Trainingsgelände und dem physischen Operationssaal weit, was Chirurgen dazu zwang, sich stark auf Intuition und begrenzte Übungsstunden zu verlassen.

Ein Team von Forschern von NVIDIA und CMR Surgical hat nun ein System entwickelt, das diese Lücke schließt und eine digitale Welt schafft, in der chirurgische Roboter in Echtzeit trainiert und getestet werden können. Sie nennen ihre Kreation Cosmos-H-Dreams. Im Gegensatz zu bisherigen Simulationen, die lediglich voraufgezeichnete Videos abspielen oder auf starren Physik-Engines basieren, die steif und künstlich wirken, generiert dieses System neue Videoframes on the fly, die sofort auf die Bewegungen eines Chirurgen oder eines Computerprogramms reagieren. Es handelt sich um ein generatives Modell, eine Art künstliche Intelligenz, die die Gesetze der Physik und das visuelle Erscheinungsbild der Chirurgie erlernt, indem sie tausende Stunden an echtem chirurgischem Videomaterial beobachtet. Das Ergebnis ist ein Simulator, der schnell genug läuft, um sich wie eine Live-Interaktion anzufühlen, was es einem Menschen ermöglicht, einen virtuellen Roboter mit einer Tastatur oder einem Headset zu steuern, oder einem Computeralgorithmus erlaubt, das Knüpfen eines Knotens zu lernen, ohne jemals ein physisches Instrument berühren zu müssen.

Der Kern dieser Errungenschaft ist eine zweiteilige Strategie, die das Bedürfnis nach hochwertiger Optik mit dem Bedürfnis nach Geschwindigkeit in Einklang bringt. Die Forscher trainierten zunächst ein massives „Lehrer“-Modell auf einer riesigen Sammlung chirurgischer Daten von neun verschiedenen Arten von Robotersystemen. Dieser Lehrer lernte, mit hoher Genauigkeit vorherzusagen, was als Nächstes in einer chirurgischen Szene passieren würde, war aber zu langsam für die Live-Interaktion; er benötigte zu lange, um jeden neuen Frame zu berechnen. Um dies zu lösen, entwickelten sie ein kleineres, schnelleres „Schüler“-Modell. Sie verwendeten eine Technik namens Destillation, bei der der Schüler lernt, die Vorhersagen des Lehrers nachzuahmen, dies jedoch auf eine wesentlich effizientere Weise tut. Indem sie den Schüler darauf trainierten, kurze Bursts von Videoframes in nur zwei Schritten statt in Dutzenden zu generieren, und die Software so optimierten, dass sie auf einem einzigen leistungsstarken Computerchip läuft, erzielte das Team einen Durchbruch in der Geschwindigkeit. Das System kann nun einen kontinuierlichen Strom realistischer chirurgischer Videos mit etwa 160 Bildern pro Sekunde auf einer einzelnen Workstation produzieren, was schnell genug ist, um die Verzögerung zu eliminieren, die das Virtual Reality normalerweise unverbunden erscheinen lässt.

Was dieses System wirklich einzigartig macht, ist seine Fähigkeit, Steuerung von jeder Quelle anzunehmen. Die Forscher demonstrierten, dass der Simulator durch eine Person, die eine Tastatur tippt, einen Chirurgen mit einem Virtual-Reality-Headset oder sogar eine kommerzielle chirurgische Roboterkonsole wie die Versius gesteuert werden kann. Er kann auch von einer KI-Policy gesteuert werden, die lernt, Aufgaben eigenständig auszuführen. In diesen Experimenten beobachtet die KI das von ihr generierte Video, entscheidet sich für eine Bewegung und sieht dann die unmittelbare visuelle Konsequenz dieser Bewegung, wodurch ein geschlossener Lernkreislauf entsteht. Dies ist das erste Mal, dass ein solch interaktives, Echtzeit-Weltmodell auf die Chirurgie angewendet wurde, was es sowohl Menschen als auch Maschinen ermöglicht, innerhalb einer synthetisierten Umgebung zu agieren und die Ergebnisse sofort zu beobachten.

Die Forscher testeten das System streng, um zu sehen, ob die digitale Welt sich wie die reale verhält. Sie ließen den Simulator durch tausende von Nahtaufgaben laufen und verglichen die Ergebnisse mit dem, was geschah, wenn dieselben Aufgaben an einem physischen Roboter durchgeführt wurden. Die Ergebnisse zeigten eine moderate Gesamteinigkeit zwischen der Simulation und den realen Ergebnissen, mit einer Pearson-Korrelation von 0,696 über die Aufgaben hinweg. Die Leistung variierte jedoch erheblich je nach spezifischem Eingriff. Das System zeigte eine relativ starke Übereinstimmung bei Aufgaben wie dem Aufheben und Werfen von Objekten, aber bei komplexeren Aufgaben wie der Übergabe und dem Knüpfen von Knoten war die Korrelation negativ, was darauf hindeutete, dass der Simulator manchmal Erfolg vorhersagte, wo der reale Roboter scheiterte, oder umgekehrt. Das System erfasste die Physik von weichem Gewebe und das Verhalten chirurgischer Instrumente in den meisten Szenarien korrekt. Die Studie verdeutlichte jedoch auch die Grenzen der Technologie. Wenn die Simulation extrem feine, überlappende Strukturen beinhaltete, wie etwa einen Faden, der sich während einer Knoten-Knüpf-Aufgabe über sich selbst faltet, unterlief dem System gelegentlich Fehler, indem es die Form des Fadens so halluzinierte, dass sie nicht mit der Realität übereinstimmte. Diese Fehler traten in der schnellen Echtzeit-Version häufiger auf als im langsameren, genaueren Lehrer-Modell, was darauf hindeutet, dass das System zwar ein leistungsstarkes Werkzeug für Training und Evaluation ist, aber noch nicht perfekt für jede einzelne Art der delikaten Manipulation ist.

Trotz dieser Einschränkungen sind die Auswirkungen dieser Arbeit bedeutsam. Durch die Bereitstellung einer sicheren, skalierbaren und fotorealistischen Umgebung bietet Cosmos-H-Dreams eine neue Grundlage für die chirurgische Ausbildung. Chirurgen können nun komplexe Eingriffe wiederholt üben, ohne die Notwendigkeit von Leichen oder Tieren zu haben, und Roboter-Policies können in einem digitalen Sandkasten trainiert und verfeinert werden, bevor sie jemals in einem Krankenhaus eingesetzt werden. Die Forscher haben den Code und das Modell der Öffentlichkeit zur Verfügung gestellt, in der Hoffnung, die Entwicklung sichererer chirurgischer Roboter und besserer Trainingswerkzeuge zu beschleunigen. Während sich das System derzeit auf Tabletop-Nahtaufgaben konzentriert, plant das Team, es auf vollständige klinische Eingriffe unter Einbeziehung komplexer Anatomie auszuweiten. Für den Moment steht es als ein Beweis dafür, dass die Zukunft der chirurgischen Ausbildung vielleicht nicht in einem physischen Labor liegt, sondern in einer Echtzeit-generativen Welt, in der Fehler sicher sind und das Lernen endlos ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →