← Neueste Arbeiten
💻 computer science

Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics

Die Studie stellt Open-H-Embodiment vor, den bisher größten offenen Datensatz für medizinische Robotik, der durch seine Vielfalt an Plattformen und Institutionen die Entwicklung fundamentaler Modelle wie GR00T-H und Cosmos-H-Surgical-Simulator ermöglicht, welche bahnbrechende Fortschritte in der autonomen chirurgischen Robotik und Simulation vorantreiben.

Ursprüngliche Autoren: Open-H-Embodiment Consortium (Brian), : (Brian), Nigel Nelson (Brian), Juo-Tung Chen (Brian), Jesse Haworth (Brian), Xinhao Chen (Brian), Lukas Zbinden (Brian), Dianye Huang (Brian), Alaa Eldin Abdel
Veröffentlicht 2026-04-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Open-H-Embodiment Consortium (Brian), : (Brian), Nigel Nelson (Brian), Juo-Tung Chen (Brian), Jesse Haworth (Brian), Xinhao Chen (Brian), Lukas Zbinden (Brian), Dianye Huang (Brian), Alaa Eldin Abdelaal (Brian), Alberto Arezzo (Brian), Ayberk Acar (Brian), Farshid Alambeigi (Brian), Carlo Alberto Ammirati (Brian), Yunke Ao (Brian), Pablo David Aranda Rodriguez (Brian), Soofiyan Atar (Brian), Mattia Ballo (Brian), Noah Barnes (Brian), Federica Barontini (Brian), Filip Binkiewicz (Brian), Peter Black (Brian), Sebastian Bodenstedt (Brian), Leonardo Borgioli (Brian), Nikola Budjak (Brian), Benjamin Calmé (Brian), Fabio Carrillo (Brian), Nicola Cavalcanti (Brian), Changwei Chen (Brian), Haoxin Chen (Brian), Sihang Chen (Brian), Qihan Chen (Brian), Zhongyu Chen (Brian), Ziyang Chen (Brian), Shing Shin Cheng (Brian), Meiqing Cheng (Brian), Min Cheng (Brian), Zih-Yun Sarah Chiu (Brian), Xiangyu Chu (Brian), Camilo Correa-Gallego (Brian), Giulio Dagnino (Brian), Anton Deguet (Brian), Jacob Delgado (Brian), Jonathan C. DeLong (Brian), Kaizhong Deng (Brian), Alexander Dimitrakakis (Brian), Qingpeng Ding (Brian), Hao Ding (Brian), Giovanni Distefano (Brian), Daniel Donoho (Brian), Anqing Duan (Brian), Marco Esposito (Brian), Shane Farritor (Brian), Jad Fayad (Brian), Zahi Fayad (Brian), Mario Ferradosa (Brian), Filippo Filicori (Brian), Chelsea Finn (Brian), Philipp Fürnstahl (Brian), Jiawei Ge (Brian), Stamatia Giannarou (Brian), Xavier Giralt Ludevid (Brian), Frederic Giraud (Brian), Aditya Amit Godbole (Brian), Ken Goldberg (Brian), Antony Goldenberg (Brian), Diego Granero Marana (Brian), Xiaoqing Guo (Brian), Tamás Haidegger (Brian), Evan Hailey (Brian), Pascal Hansen (Brian), Ziyi Hao (Brian), Kush Hari (Brian), Kengo Hayashi (Brian), Jonathon Hawkins (Brian), Shelby Haworth (Brian), Ortrun Hellig (Brian), S. Duke Herrell (Brian), Zhouyang Hong (Brian), Andrew Howe (Brian), Junlei Hu (Brian), Ria Jain (Brian), Mohammad Rafiee Javazm (Brian), Howard Ji (Brian), Rui Ji (Brian), Jianmin Ji (Brian), Zhongliang Jiang (Brian), Dominic Jones (Brian), Jeffrey Jopling (Brian), Britton Jordan (Brian), Ran Ju (Brian), Michael Kam (Brian), Luoyao Kang (Brian), Fausto Kang (Brian), Siddhartha Kapuria (Brian), Peter Kazanzides (Brian), Sonika Kiehler (Brian), Ethan Kilmer (Brian), Ji Woong (Brian), Kim, Przemysław Korzeniowski, Chandra Kuchi, Nithesh Kumar, Alan Kuntz, Federico Lavagno, Yu Chung Lee, Hao-Chih Lee, Hang Li, Zhen Li, Xiao Liang, Xinxin Lin, Jinsong Lin, Chang Liu, Fei Liu, Pei Liu, Yun-hui Liu, Wanli Liuchen, Eszter Lukács, Sareena Mann, Miles Mannas, Brett Marinelli, Sabina Martyniak, Francesco Marzola, Lorenzo Mazza, Xueyan Mei, Maria Clara Morais, Luigi Muratore, Chetan Reddy Narayanaswamy, Michał Naskręt, David Navarro-Alarcon, Cyrus Neary, Chi Kit Ng, Christopher Nguan, David Noonan, Ki Hwan Oh, Tom Christian Olesch, Allison M. Okamura, Justin Opfermann, Matteo Pescio, Doan Xuan Viet Pham, Tito Porras, Hongliang Ren, Ariel Rodriguez Jimenez, Ferdinando Rodriguez y Baena, Septimiu E. Salcudean, Asmitha Sathya, Preethi Satish, Lalithkumar Seenivasan, Jiaqi Shao, Yiqing Shen, Yu Sheng, Lucy XiaoYang Shi, Zoe Soulé, Stefanie Speidel, Mingwu Su, Jianhao Su, Idris Sunmola, Kristóf Takács, Yunxi Tang, Patrick Thornycroft, Yu Tian, Jordan Thompson, Mehmet K. Turkcan, Mathias Unberath, Pietro Valdastri, Carlos Vives, Quan Vuong, Martin Wagner, Farong Wang, Wei Wang, Lidian Wang, Chung-Pang Wang, Guankun Wang, Junyi Wang, Erqi Wang, Ziyi Wang, Tanner Watts, Wolfgang Wein, Yimeng Wu, Zijian Wu, Hongjun Wu, Luohong Wu, Jie Ying Wu, Junlin Wu, Victoria Wu, Kaixuan Wu, Mateusz Wójcikowski, Yunye Xiao, Nan Xiao, Wenxuan Xie, Hao Yang, Tianqi Yang, Yinuo Yang, Menglong Ye, Ryan S. Yeung, Nural Yilmaz, Chim Ho Yin, Michael Yip, Rayan Younis, Chenhao Yu, Sayem Nazmuz Zaman, Milos Zefran, Han Zhang, Yuelin Zhang, Yidong Zhang, Yanyong Zhang, Xuyang Zhang, Yameng Zhang, Joyce Zhang, Ning Zhong, Peng Zhou, Haoying Zhou, Xiuli Zuo, Nassir Navab, Mahdi Azizian, Sean D. Huver, Axel Krieger

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einen Roboter so trainieren, dass er wie ein erfahrener Chirurg operiert. Das Problem bisher war, dass wir ihm nur sehr wenige, sehr spezifische Beispiele gezeigt haben – wie ein Koch, der nur ein einziges Rezept kennt und bei der kleinsten Abweichung in der Küche scheitert.

Diese neue Arbeit, „Open-H-Embodiment", ändert das Spiel komplett. Hier ist die Erklärung in einfachen Worten, mit ein paar bildhaften Vergleichen:

1. Das Problem: Der „Ein-Rezept-Koch"

Bisher hatten Forscher nur winzige Datensätze. Stellen Sie sich vor, Sie wollen jemanden beibringen, ein Auto zu fahren, aber Sie geben ihm nur 3 Stunden Video von einer einzigen Person, die nur auf einer leeren Straße in einer einzigen Stadt fährt. Wenn dieser Fahrer dann plötzlich Regen, Schnee oder eine andere Stadt sieht, weiß er nicht mehr weiter.

Genau das war das Problem in der Robotik: Die Daten waren zu klein, zu einseitig (nur ein Roboter-Typ) und wurden nicht geteilt. Deshalb konnten die Roboter keine „allgemeine Intelligenz" entwickeln.

2. Die Lösung: Die „Super-Bibliothek"

Die Forscher haben sich zusammengeschlossen (49 Institutionen aus der ganzen Welt!) und eine riesige Bibliothek gebaut.

  • Die Größe: Sie haben 770 Stunden an Videomaterial gesammelt. Das ist wie ein ganzer Marathon an Operationen.
  • Die Vielfalt: Es ist nicht nur ein Roboter dabei. Es sind 20 verschiedene Roboter-Modelle vertreten – von riesigen Operationsrobotern (wie der da Vinci) bis hin zu kleineren, flexiblen Systemen.
  • Der Inhalt: Es geht nicht nur um das Schneiden. Die Roboter haben gesehen, wie man näht, wie man Ultraschall macht, wie man Gewebe bewegt und wie man Knoten bindet.

Die Analogie: Stellen Sie sich vor, statt einem Koch, der nur einen Kochkurs gemacht hat, haben Sie einen Koch, der in 49 verschiedenen Restaurants gearbeitet hat, mit 20 verschiedenen Herden gekocht hat und 770 Stunden lang jede Art von Gericht zubereitet hat. Dieser Koch versteht nun das Prinzip des Kochens, nicht nur ein Rezept.

3. Die zwei neuen „Super-Helden"

Mit dieser riesigen Bibliothek haben die Forscher zwei neue KI-Modelle trainiert:

A. GR00T-H: Der „Lernende Chirurg"

Das ist ein Roboter-Geist, der alles gesehen hat, was in der Bibliothek ist.

  • Was er kann: Er wurde getestet, ob er eine komplexe Aufgabe (Nähen) von Anfang bis Ende allein schafft.
  • Das Ergebnis: Während alle anderen Modelle (die nur wenig gelernt hatten) komplett versagten, schaffte es GR00T-H, in 25 % der Fälle die ganze Aufgabe perfekt zu Ende zu bringen.
  • Der Clou: Er braucht viel weniger Zeit, um neue Aufgaben zu lernen. Wenn man ihm zeigt, wie man etwas Neues macht, lernt er das viel schneller als seine Vorgänger, weil er schon so viel „Lebenserfahrung" hat. Er ist auch robuster: Wenn sich ein Roboterarm leicht abnutzt oder das Licht anders ist, gibt er nicht auf, sondern passt sich an.

B. Cosmos-H: Der „Träumer" (Der Simulator)

Stellen Sie sich vor, Sie könnten einen Roboter in einer virtuellen Welt trainieren, ohne ihn physisch zu bewegen.

  • Was er kann: Dieser Roboter schaut auf ein Bild und eine Bewegungsanweisung (z. B. „Greife das Skalpell") und träumt dann, was als Nächstes passiert. Er generiert ein Video davon.
  • Warum das toll ist: Man kann Millionen von Operationen simulieren, ohne echte Patienten oder teure Materialien zu verbrauchen. Er kann sogar für verschiedene Roboterarten simulieren, nicht nur für einen.
  • Die Analogie: Es ist wie ein Flugsimulator für Chirurgen. Der Simulator kann so realistisch aussehen, dass man darin trainieren kann, wie man mit Gewebe umgeht, bevor man es am echten Menschen tut.

4. Warum ist das wichtig für uns?

  • Sicherheit: Roboter können durch Simulationen so viel üben, dass sie sicherer werden, bevor sie überhaupt in ein Krankenhaus kommen.
  • Zugang: Wenn Roboter besser werden, können sie Ärzten helfen, besonders in Gegenden, wo es nicht genug spezialisierte Chirurgen gibt.
  • Offenheit: Das Wichtigste ist: Diese Daten und Modelle sind frei verfügbar. Jeder Forscher auf der Welt kann jetzt darauf aufbauen. Es ist wie ein offenes Fundament, auf dem die ganze Welt gemeinsam baut.

Zusammenfassung

Früher war die Ausbildung von medizinischen Robotern wie das Lernen mit einem verstaubten, kleinen Schulbuch. Mit Open-H-Embodiment haben sie eine riesige, lebendige Enzyklopädie gebaut, die 20 verschiedene Roboter-Typen und Tausende von Stunden an Erfahrung enthält.

Dank dieser Bibliothek können Roboter jetzt nicht nur einzelne Tricks lernen, sondern verstehen, wie Operationen im Allgemeinen funktionieren. Sie werden schneller, sicherer und können sich an neue Situationen anpassen – ein riesiger Schritt hin zu einer Zukunft, in der Roboter Ärzte unterstützen und Leben retten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →