← Neueste Arbeiten
💻 computer science

Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction

DEX-X ist ein Framework, das Simulation als haptische Vervollständigungsmaschine nutzt, um physikalisch fundierte Hand-Objekt-Interaktionen aus monokularen Humanvideos zu rekonstruieren, was das Training und den Zero-Shot-Einsatz von visuellen-taktilen dexteritätsbasierten Manipulationsrichtlinien in der realen Welt ermöglicht, ohne dass eine Datenerhebung auf der Roboterseite erforderlich ist.

Ursprüngliche Autoren: Ruoqu Chen, Feixiang Ruan, Liu Cao, Zihao Wang, Botian Xu, Shiqin Tong, Jiajun Liu, Mingzhi Pei, Chenyu Zhang, Wanli Xing, Kaifeng Zhang, Mengdi Xu

Veröffentlicht 2026-09-09
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ruoqu Chen, Feixiang Ruan, Liu Cao, Zihao Wang, Botian Xu, Shiqin Tong, Jiajun Liu, Mingzhi Pei, Chenyu Zhang, Wanli Xing, Kaifeng Zhang, Mengdi Xu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Fabrikhallen, die sich mit Präzision auf fest vorgegebenen Pfaden bewegen, um Autos zu montieren oder Kisten zu stapeln. Doch tritt man aus dieser kontrollierten Umgebung heraus, haben dieselben Maschinen oft Schwierigkeiten. Die menschliche Hand ist ein Wunderwerk der Anpassung, fähig, ein zerbrechliches Ei aufzuheben, einen Türknauf zu drehen oder einen Tisch zu schrubben, während sie sich ständig an den unsichtbaren Druck und Zug des Kontakts anpasst. Um dies zu replizieren, haben Wissenschaftler sich an zwei Hauptquellen für Daten gewandt: direkte Roboterversuche, die langsam und teuer sind, und menschliche Videos, die im Überfluss vorhanden und kostenlos sind. Die Herausforderung bestand schon immer in einem fehlenden Puzzleteil. Menschliche Videos zeigen uns, wie die Hände bei der Bewegung aussehen, aber sie verbergen die kritischste Information für einen Roboter: den Tastsinn. Ohne zu wissen, wie fest man drücken muss oder wann ein Objekt rutscht, kann ein Roboter nicht lernen, Werkzeuge zu handhaben oder mit der Welt auf die komplexen, kontaktintensiven Arten zu interagieren, wie es Menschen tun.

Ein Team von Forschern der Tsinghua-Universität und anderer Institutionen hat eine Lösung für diese Lücke vorgeschlagen und ein System namens DEX-X eingeführt. Ihre Arbeit stellt eine grundlegende Frage: Kann ein Roboter lernen, feine, taktile Aufgaben allein durch das Beobachten von menschlichen Videos auszuführen, ohne jemals zuvor eigene physische Daten sammeln zu müssen? Die Antwort, die sie fanden, beruht auf dem klugen Einsatz von Computersimulation. Anstatt zu versuchen, die fehlende taktile Information allein aus dem Video zu erraten, nutzen die Forscher das Video, um einen Roboter in einer virtuellen Welt zu führen. In diesem digitalen Sandkasten werden die physikalischen Gesetze streng durchgesetzt. Wenn der virtuelle Roboter ein Objekt berührt, berechnet der Computer die exakten beteiligten Kräfte und „füllt“ damit effektiv den fehlenden Tastsinn auf, den das ursprüngliche Video nicht besaß. Dieser Prozess verwandelt eine passive visuelle Aufzeichnung in eine aktive, physische Lektion.

Die Forscher begannen damit, Monovideoaufnahmen von Menschen zu verwenden, die verschiedene Aufgaben ausführen, wie etwa das Aufheben einer Tasse, das Benutzen eines Abziehers zum Reinigen eines Tisches oder das Hämmern eines Nagels. Sie nutzten Computer Vision, um die Bewegungen der menschlichen Hände und der von ihnen gehaltenen Objekte zu verfolgen und die Bewegung in drei Dimensionen zu rekonstruieren. Diese rekonstruierte Bewegung wurde dann auf einen digitalen Roboterarm und eine Roboterhand übertragen, die aus fünfundzwanzig beweglichen Teilen besteht und die Komplexität einer menschlichen Gliedmaße eng nachahmt. Doch das bloße Kopieren der menschlichen Bewegungen war nicht ausreichend. In der realen Welt scheitert ein Roboter, der blind dem Pfad eines Menschen folgt, oft, weil er nicht fühlen kann, ob er zu fest drückt oder ob ein Objekt gleitet. Um dies zu lösen, trainierte das Team einen „Lehrer“-Roboter innerhalb der Simulation. Dieser Lehrer beobachtete die menschliche Bewegung als Orientierungshilfe, war aber frei darin, seine eigenen Bewegungen basierend auf den simulierten Kräften zu erkunden und anzupassen, die er an seinen Fingerspitzen spürte. Durch tausende Versuche in der virtuellen Welt lernte dieser Lehrer, einen stabilen Griff aufrechtzuerhalten und Objekte zu manipulieren, indem er auf den unsichtbaren Druck und Zug des Kontakts reagierte – eine Fähigkeit, die das ursprüngliche menschliche Video allein nicht lehren konnte.

Nachdem der Lehrer diese Fähigkeiten in der Simulation gemeistert hatte, destillierten die Forscher dessen Wissen in eine „Schüler“-Policy. Dieser Schüler wurde entwickelt, um auf echter Hardware eingesetzt werden zu können. Im Gegensatz zum Lehrer, der Zugang zu perfektem Wissen innerhalb der Simulation hatte, musste sich der Schüler nur auf das verlassen, was ein echter Roboter wahrnehmen kann: eine Kameraansicht der Szene, die Position seiner eigenen Ggelenke und die Drucksensoren an seinen Fingerspitzen. Der Schüler lernte, eine Punktwolke, die die Welt um ihn herum repräsentiert, zu interpretieren, indem er die visuelle Form des Objekts mit den Sensordaten der Kraft verband. Dies ermöglichte es dem Schüler, ohne das perfekte, interne Wissen der Simulation zu operieren, was ihn bereit für die unordentliche Realität der physischen Welt machte.

Die Ergebnisse dieses Ansatzes wurden an einem echten Roboter getestet, der mit einer Hand und einem Arm mit fünfundzwanzig Freiheitsgraden ausgestattet war. Die Forscher ließen den Roboter Aufgaben ausführen, die er zuvor noch nie gesehen hatte, wobei sie nur die aus den menschlichen Videos und der Simulation gelernten Policies verwendeten. In einem Test zum Aufheben eines Würfels war der Roboter in achtundzwanzig von dreißig Versuchen erfolgreich, was einer Erfolgsquote von 93 Prozent entspricht. Er schaffte es auch, Wasser aus einer Tasse zu gießen und Objekte mit ähnlicher Zuverlässigkeit zu heben. Das System zeigte sogar die Fähigkeit, auf Objekte zu generalisieren, die es während des Trainings nicht kannte. Als ihm ein dünner Würfel oder eine Spielzeugente präsentiert wurde, die sich von den Trainingsobjekten unterschieden, gelang es dem Roboter dennoch, sie aufzuheben, wenn auch mit etwas geringeren Erfolgsraten, was bewies, dass die erlernten Fähigkeiten nicht bloß auswendig gelernte Bewegungen, sondern anpassungsfähige Strategien waren.

Dennoch ist das System nicht ohne Grenzen. Die Forscher stellten fest, dass Aufgaben, die einen langen, anhaltenden Kontakt erfordern, wie etwa das Reinigen eines Tisches mit einem Abzieher, schwieriger waren. Der Roboter war in etwa 53 Prozent dieser Versuche erfolgreich, wobei die Fehler oft auftraten, wenn der Roboter seinen Griff verlor oder während der Bewegung mit dem Tisch kollidierte. Dies deutet darauf an, dass die Komplexität der Aufrechterhaltung des Kontakts über einen längeren Zeitraum eine signifikante Hürde bleibt, auch wenn die Simulation eine leistungsstarke Brücke für das Lernen bildet. Das Team stellte zudem fest, dass das Entfernen entweder der visuellen Eingabe oder des taktilen Feedbacks die Leistung drastisch reduzierte, was bestätigte, dass beide Sinne essenziell sind, damit der Roboter die physische Welt effektiv navigieren kann.

Diese Arbeit legt nahe, dass simulierte physische Interaktion als wichtiges Bindeglied zwischen der riesigen Bibliothek verfügbarer menschlicher Videos im Internet und der Entwicklung leistungsfähiger, einsatzbereiter Roboter dienen kann. Durch die Nutzung der Simulation zur Generierung der fehlenden taktilen Daten haben die Forscher gezeigt, dass Roboter komplexe, kontaktreiche Fähigkeiten erlernen können, ohne dass eine teure, spezialisierte Datenerhebung erforderlich ist. Die Ergebnisse weisen den Weg nach vorn, auf dem Roboter aus der Fülle menschlicher Aktivitäten, die in Videos festgehalten sind, lernen können, indem sie diese visuellen Demonstrationen durch die rigorose Prüfung einer virtuellen Welt in physische Fähigkeiten übersetzen. Während bei den komplexesten Interaktionen weiterhin Herausforderungen bestehen, markiert die Fähigkeit, diese Fähigkeiten direkt auf echte Hardware zu übertragen, ohne weiteres Tuning, einen bedeutenden Schritt hin zu vielseitigeren und autonomeren Maschinen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →