← Neueste Arbeiten
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL ist ein physikalisch fundiertes, dexteres Vision-Language-Action-Modell, das eine Mixture-of-Transformers-Architektur mit adaptiver visuo-taktiler Fusion und latenter Co-Imagination nutzt, um durch die dynamische Integration von taktiler Wahrnehmung und der Modellierung physikalischer Dynamiken eine Spitzenleistung bei kontaktreichen Manipulationsaufgaben zu erzielen.

Ursprüngliche Autoren: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Veröffentlicht 2026-09-09
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Fabrikhallen, die schwere Objekte auf vorhersehbaren Pfaden mit starrer Präzision bewegen. Doch wenn wir sie bitten, in unsere Häuser zu kommen und die feinen, unordentlichen Aufgaben des täglichen Lebens zu erledigen – eine Glühbirne einzuschrauben, eine Vase abzuwischen oder einen Deckel von einer Flasche zu drehen –, geraten sie oft ins Straucheln. Die Welt ist kein sauberes, statisches Gitter; sie ist ein Ort ständiger, subtiler Reibung. Um erfolgreich zu sein, muss eine Maschine mehr tun als nur sehen; sie muss fühlen. Sie muss die unsichtbare Physik des Kontakts verstehen: den Moment, in dem ein Finger abrutscht, den erforderlichen Druck, um einen Knopf zu drehen, oder die Art und Weise, wie sich ein weiches Objekt unter Berührung verformt. Seit Jahrzehnten versuchen Wissenschaftler, diese Lücke zu schließen, indem sie Robotern sowohl Augen als auch Haut geben, doch einer Maschine beizubringen, diese Sinne zu einer einzigen, fließenden Intuition zu kombinieren, blieb eine der hartnäckigsten Herausforderungen der künstlichen Intelligenz.

Ein Forscherteam hat nun mit einem neuen System namens DeCAL einen bedeutenden Schritt nach vorn gemacht. Dies ist nicht bloß ein Roboter, der sehen und fühlen kann; es ist ein System, das darauf ausgelegt ist, die Zukunft einer physischen Interaktion zu imaginieren, bevor sie geschieht. Durch den Aufbau eines Modells, das Verständnis, Vorstellungskraft und Handeln vereint, schufen die Forscher eine Roboter-Policy, die die komplexe, kontaktreiche Welt der menschlichen Manipulation mit einem bisher nie gesehenen Maß an Geschicklichkeit bewältigen kann. Das System wurde bei sechs verschiedenen Aufgaben getestet, die vom Abwischen einer Vase bis hin zum Zusammenbauen kleiner Teile reichten, und es übertraf konsequent die fortschrittlichsten bestehenden Methoden. In diesen realen Versuchen erreichte DeCAL bei einfacheren Aufgaben eine Erfolgsquote von bis zu 100 Prozent und hielt eine robuste durchschnittliche Erfolgsquote von 71 Prozent über alle sechs Herausforderungen hinweg aufrecht, selbst wenn sich die Umgebung auf unerwartete Weise veränderte.

Das Kernproblem, das die Forscher angegangen sind, ist, dass die Sicht allein oft blind für die kritischsten Momente der Manipulation ist. Wenn eine Roboterhand nach einem Objekt greift, verdecken die Finger oft die Kameraperspektive und erzeugen so einen „blinden Fleck“ genau in dem Moment, in dem der Roboter es am nötigsten hat. Darüber hinaus können visuelle Daten einem Roboter nicht sagen, wie stark er drückt oder ob ein Objekt kurz davor ist abzugleiten. Während frühere Versuche, Roboter mit Tastsensoren auszustatten, diese oft als einfache Ergänzungen behandelten, integriert DeCAL taktile Informationen als fundamentalen Bestandteil seines Denkprozesses. Das System verwendet hochauflösende Sensoren an jeder Fingerspitze, die die Form der Oberfläche eines Objekts erkennen können, während sie sich unter Druck verformt, sowie die präzisen Kräfte, die ausgeübt werden. Dies ermöglicht es dem Roboter, die Welt auf eine Weise zu „fühlen“, die so reichhaltig und detailliert ist wie das, was er sieht.

Was DeCAL wirklich einzigartig macht, ist die Art und Weise, wie es diese Informationen verarbeitet. Anstatt einfach nur auf das zu reagieren, was es im gegenwärtigen Moment sieht oder fühlt, ist das System darauf trainiert, sich vorzustellen, was als Nächstes passieren wird. Es arbeitet mit drei unterschiedlichen, aber miteinander verbundenen Fähigkeiten. Erstens versteht es die aktuelle Situation, indem es die visuelle Szene betrachtet, eine Sprachanweisung liest und die Kontaktpunkte fühlt. Zweitens betreibt es eine Form der „Ko-Imagination“, bei der es vorhersagt, wie sich die visuelle Szene und die taktilen Empfindungen in den nächsten Sekunden entwickeln werden. Es fragt sich im Wesentlichen selbst: „Wenn ich den Deckel jetzt drehe, wie wird sich die Kraft verändern und wie wird das Objekt einen Moment später aussehen?“ Schließlich nutzt es diese imaginierte Zukunft, um die präzisen Bewegungen zu entscheiden, die nötig sind, um die Aufgabe zu vollenden. Dieser vorausschauende Ansatz ermöglicht es dem Roboter, seine Handlungen basierend auf der Physik der Interaktion zu planen, anstatt nur auf Basis vergangener Muster zu raten.

Um dies zu ermöglichen, entwickelten die Forscher eine spezielle Methode, um zu entscheiden, wann man dem Tastsinn vertrauen sollte. Bei vielen Aufgaben bewegt sich ein Roboter vielleicht durch die Luft, wo Berührung irrelevant ist, und stellt dann plötzlich Kontakt mit einem Objekt her. Wenn der Robot zu allen Zeiten den Taktilsignalen die gleiche Aufmerksamkeit schenken würde, wäre er durch das Rauschen der Luft oder den mangelnden Kontakt verwirrt. DeCAL verwendet einen intelligenten Gating-Mechanismus, der wie ein Lautstärkeregler für den Tastsinn fungiert. Wenn der Roboter nichts berührt, senkt das System die „Lautstärke“ der taktilen Signale ab und verlässt sich hauptsächlich auf die Sicht. In dem Moment, in dem Kontakt hergestellt wird, dreht das System die Lautstärke sofort hoch und lässt die taktilen Daten die Bewegung mit hoher Präzision leiten. Diese dynamische Anpassung stellt sicher, dass der Roboter den richtigen Sinn zur richtigen Zeit nutzt und verhindert, dass sich die sensorischen Eingaben gegenseitig behindern.

Das System wurde in einer Reihe strenger Experimente getest mit einem Paar Roboterarmen, die mit 22-fingrigen Händen ausgestattet waren. Die Forscher gaben dem Roboter sechs verschiedene Aktivitäten vor: das Abwischen einer Vase, das Wischen eines Whiteboards, das Zusammenbauen von Teilen, das Drehen eines Deckels, das Pipettieren von Flüssigkeit und das Einschrauben einer Glühbirne. Diese Aufgaben wurden gewählt, weil sie alle eine feingliedrige Kontrolle und ständigen physischen Kontakt erfordern. Der Roboter wurde mit mehreren anderen State-of-the-Art-Modellen verglichen, darunter solche, die nur auf Vision basierten und andere, die zwar Tastsinn nutzten, aber nicht die Fähigkeit besaßen, zukünftige Zustände zu imaginieren. Die Ergebnisse waren eindeutig: DeCAL war wesentlich erfolgreicher darin, die Aufgaben zu vollenden, als alle anderen Systeme. Beispielsweise gelang es DeCAL bei der Aufgabe, eine Glühbirne einzuschrauben – wo die Sicht oft durch die Hand blockiert ist und die Aufgabe ein präzises Drehmoment erfordert – in 40 Prozent der Fälle, während das nächstbeste Modell nur 35 Prozent erreichte. Bei der Aufgabe, eine Vase abzuwischen, erreichte DeCAL eine perfekte Erfolgsquote von 100 Prozent, während das beste konkurrierende rein visuelle Modell nur in 30 Prozent der Fälle erfolgreich war.

Noch beeindruckender war die Fähigkeit des Systems, Situationen zu bewältigen, die es zuvor noch nie gesehen hatte. Die Forscher testeten DeCAL in Umgebungen mit unterschiedlichen Hintergründen, in Clustern mit zufälligen Objekten, unter schwachem Licht und mit völlig neuen Objekten, die andere Formen und Größen hatten. In diesen „Out-of-Distribution“-Szenarien, in denen der Roboter sich nicht auf memorierte Muster verlassen konnte, agierte DeCAL weiterhin stark. Als er angewiesen wurde, einen Deckel auf einem neuen, unbekannten Becher zu drehen, war das System in 75 Prozent der Fälle erfolgreich, was seine Konkurrenten deutlich übertraf. Dies deutet darauf hin, dass der Roboter nicht einfach nur einen spezifischen Satz von Bewegungen auswendig lernt, sondern tatsächlich die zugrunde liegenden physikalischen Prinzipien der Interaktion von Objekten lernt, was es ihm ermöglicht, sich an neue Herausforderungen anzupassen.

Die Forscher untersuchten auch genau, wie das System lernte, die Zukunft vorherzusagen. Durch die Analyse der internen Vorhersagen des Roboters fanden sie heraus, dass er die Kräfte und Verformungen, die während einer Interaktion auftreten würden, präzise vorhersagen konnte. Wenn der Roboter vorhersagte, wie viel Kraft zum Drehen eines Deckels nötig wäre oder wie sich eine weiche Oberfläche verformen würde, stimmten diese Vorhersagen eng mit der tatsächlichen physikalischen Realität überein. Diese Fähigkeit, die Physik der Welt intern zu simulieren, ist es, die dem Roboter seinen „gesunden Menschenverstand“ verleiht. Es ermöglicht dem System zu verstehen, dass es, wenn es zu fest drückt, das Objekt abrutschen könnte, oder wenn es zu langsam dreht, die Aufgabe zu lange dauern wird. Dieses implizite Wissen über die Physik, das aus der Kombination von Sehen und Fühlen resultiert, ist es, was den Roboter befähigt, mit solcher Fluidität und Zuversicht zu handeln.

Trotz dieser Erfolge weisen die Autoren vorsichtig auf die Einschränkungen ihrer Arbeit hin. Das System ist stark von der Genauigkeit seiner Tastsensoren abhängig, und wenn diese Sensoren verrauscht oder falsch kalibriert sind, könnte die Leistung des Roboters sinken. Zudem erfordert der aktuelle Aufbau einen menschlichen Operator, der die Aufgaben mittels eines Teleoperationssystems demonstriert, welches dem Operator jedoch keinen Tastsinn vermittelt. Das bedeutet, dass die Trainingsdaten möglicherweise nicht perfekt die subtilen Anpassungen erfassen, die ein Mensch vornehmen würde, wenn er das Objekt selbst fühlen könnte. Die Forscher weisen auch darauf hin, dass ihr Modell noch nicht auf einer massiven Skala diverser taktiler Daten trainiert wurde, was darauf hindeutet, dass zukünftige Verbesserungen durch die Exposition des Systems gegenüber einer noch breiteren Vielfalt physikalischer Interaktionen erzielt werden könnten.

Die Arbeit stellt einen Wandel in der Art und Weise dar, wie wir über Roboterintelligenz denken. Anstatt Roboter zu bauen, die einfach nur schneller oder stärker sind, konzentriert sich dieser Ansatz darauf, Maschinen zu bauen, die die physische Welt als einen dynamischen, interaktiven Ort verstehen können. Indem man dem Roboter die Fähigkeit gibt, die Konsequenzen seines Handelns zu imaginieren und seine Sinne der Situation anzupassen, haben die Forscher ein System geschaffen, das sich weniger wie eine Maschine anfühlt, die einem Skript folgt, und mehr wie ein Agent, der zu echter Interaktion fähig ist. Wenn diese Technologie reift, ist die Hoffnung, dass diese Systeme schließlich in der Lage sein werden, die komplexen, kontaktreichen Aufgaben, die so vieles unseres menschlichen Lebens definieren – vom Kochen und Putzen bis hin zur Pflege von älteren Menschen –, mit einer Geschicklichkeit zu bewältigen, die der unseren entspricht. Der Weg nach vorn besteht darin, diese Sensoren zu verfeinern, die Trainingsdaten zu erweitern und weiterhin die Lücke zwischen Sehen, Fühlen und Handeln zu schließen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →