VGGT-DP: Generalizable Robot Control via Vision Foundation Models
VGGT-DP ist ein verallgemeinerbares Robotersteuerungs-Framework, das die Leistung visuomotorischer Policys verbessert, indem es geometrische Prioren aus einem vortrainierten 3D-Perzeptionsmodell mit propriozeptivem Feedback integriert und gleichzeitig Frame-basierten Token-Reuse sowie zufälliges Token-Pruning einsetzt, um die räumliche Verankerung, Robustheit und Inferenz-Effizienz zu steigern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter haben schon lange damit zu kämpfen, sich mit der fließenden Zuversicht eines Lebewesens zu bewegen. Jahrzehntelang programmierten Ingenieure Maschinen mit starren, handgeschriebenen Regeln, die ihnen genau vorschrieben, wie sie ihre Arme in jeder denkbaren Situation bewegen sollten. Dieser Ansatz funktionierte in kontrollierten Fabriken gut, scheiterte jedoch kläglich, sobald sich die Welt auch nur geringfügig veränderte. In den letzten Jahren hat ein neuer Ansatz Fuß gefasst: Roboter durch Beispiele lehren, ganz so, wie ein Kind durch das Beobachten eines Elternteils lernt. Der Roboter beobachtet einen Menschen bei der Ausführung einer Aufgabe und versucht, die Bewegungen zu kopieren. Diese Lernsysteme lassen jedoch oft ein tiefes Verständnis für den Raum vermissen. Sie können ein Objekt zwar erkennen, scheitern aber häufig daran, zu erfassen, wie dieses Objekt in einem dreidimensionalen Raum relativ zum eigenen Körper des Roboters positioniert ist. Diese Lücke im räumlichen Verständnis schränkt die Fähigkeit eines Roboters ein, komplexe Aufgaben zu bewältigen oder sich anzupassen, wenn sich der Kamerawinkel verschiebt oder die Umgebung verändert.
Ein Forschungsteam hat ein neues System entwickelt, das darauf abzielt, diese Lücke zu schließen, indem es sich von der Funktionsweise der biologischen Sichtweise inspirieren lässt. In der Natur verlassen sich Tiere nicht auf einen einzigen Sinn, um zu navigieren; sie kombinieren das, was sie sehen, mit einem ständigen internen Gefühl für die eigene Körperposition, bekannt als Propriozeption. Diese interne Rückkopplung ermöglicht es einer Fliege, auf einem bewegten Blatt zu landen, oder einer Katze, auf einem schmalen Vorsprung zu laufen, ohne zu fallen. Die Forscher, angeführt von Shijia Ge und Kollegen von der Tsinghua-Universität und anderen Institutionen, entwickelten ein Framework namens VGGT-DP, das diese biologische Strategie nachahmt. Anstatt sich auf Sprachinstruktionen oder einfache visuelle Hinweise zu verlassen, fusioniert ihr System ein leistungsstarkes, vortrainiertes visuelles Modell mit den internen Zustandssensoren des Roboters. Diese Kombination ermöglicht es dem Roboter, eine robuste, dreidimensionale Karte seiner Umgebung aufzubauen und genau zu verstehen, wo sich seine eigenen Gliedmaßen innerhalb dieses Raums befinden.
Der Kern dieses neuen Systems ist eine visuelle Engine, die auf massiven Mengen an 3D-Rekonstruktionsdaten trainiert wurde. Während Standard-Roboter-Sehen-Modelle oft klein und schnell konzipiert sind und Details zugunsten der Geschwindigkeit opfern, verwendet dieses System ein groß angelegtes Modell, das in der Lage ist, Tiefe, Kamerawinkel und die präzise Position jedes Punktes in einer Szene vorherzusagen. Die Forscher fanden heraus, dass der Roboter durch die Verwendung dieses leistungsstarken visuellen Modells ein wesentlich stärkeres Verständnis für Geometrie gewann. Das Ausführen eines solch schweren Modells in Echtzeit ist jedoch rechenintensiv und langsam. Um dies zu lösen, erfand das Team einen cleveren Trick namens „frame-wise token reuse“ (rahmenweise Token-Wiederverwendung). In einem typischen Videofeed überschneiden sich viele Einzelbilder erheblich; der Hintergrund und die meisten Objekte ändern sich von einem Millisekunden-Intervall zum nächsten nicht. Das neue System erkennt dies und hört auf, die visuellen Merkmale für Teile des Bildes neu zu berechnen, die sich nicht verändert haben. Es verarbeitet nur die neuen Informationen, die im aktuellen Frame eintreffen, und nutzt die zwischengespeicherten Daten der vorangegangenen Momente wieder. Dieser Ansatz reduzierte die Zeit, die der Roboter zum „Denken“ benötigt, drastisch und machte das leistungsstarke visuelle Modell praktikabel für den realen Einsatz.
Um sicherzustellen, dass die Sicht des Roboters mit seiner physischen Realität übereinstimmte, fügten die Forscher eine Ebene der internen Überwachung hinzu. Sie brachten dem visuellen System bei, die eigenen Gelenkwinkel und die Handposition des Roboters allein basierend auf dem zu sagen, was es sah. Wenn das Auge des Roboters eine Hand sah, die nach einem Becher griff, musste das System in der Lage sein, korrekt vorherzusagen, wo sich diese Hand im Raum befand. Dies zwang das visuelle Modell dazu, sich perfekt mit dem internen Zustand des Roboters abzugleichen, wodurch eine enge Feedbackschleife entstand. Das letzte Puzzleteil war eine Methode namens „random token pruning“ (zufälliges Token-Pruning), bei der das System während des Trainings absichtlich kleine, zufällige Teile der visuellen Daten ignoriert. Diese Technik wirkt wie eine Form des Stresstests, der den Roboter dazu zwingt, die allgemeine Form und Struktur einer Szene zu lernen, anstatt spezifische Details auswendig zu lernen, was ihn resistenter gegenüber fehlenden Informationen oder Rauschen macht.
Bei Tests mit einer Reihe anspruchsvoller Aufgaben zur Manipulation, wie etwa dem Herauspicken von Objekten aus Löchern, dem Kehren von Gegenständen in einen Korb oder dem Ziehen eines Stocks, zeigte das neue System bemerkenswerte Verbesserungen gegenüber bestehenden Methoden. In schwierigen Szenarien, die präzises räumliches Denken erfordern, erreichte der neue Ansatz deutlich höhere Erfolgsraten als bisherige Top-Modelle. So gelang dem neuen System beispielsweise in einer Aufgabe, die das Herauspicken eines Objekts aus einem tiefen Loch erforderte, in 55 % der Versuche, während die bisher beste Methode (DP3) lediglich 14 % erreichte. Das System erwies sich auch als äußerst effektiv bei Aufgaben wie dem Zusammenkehren von Gegenständen zu einem Haufen, wobei es in 44 % der Fälle erfolgreich war, verglichen mit nur 15 % beim nächstbesten Konkurrenten. Diese Ergebnisse legen nahe, dass ein tiefes, geometrieorientiertes Verständnis des Raums für komplexe Manipulationen weitaus entscheidender ist als das bloße Hinzufügen von Sprachfähigkeiten.
Die Forscher merkten jedoch vorsichtig an, wo das System noch Schwächen aufweist. Während es bei Aufgaben hervorragend abschnitt, die komplexes räumliches Denken erforderten, war es nicht immer besser als ältere, einfachere Modelle bei sehr grundlegenden Aufgaben, wie etwa dem Greifen nach einem nahen Objekt. In diesen einfachen Szenarien führte das schwere visuelle Modell manchmal unnötige Komplexität ein. Noch bedeutender war, dass das System Schwierigkeiten bekam, wenn sich der Kamerawinkel auch nur geringfügig änderte. Als die Forscher den Roboter mit einer um nur fünf Grad rotierten Kamera testeten, sank die Erfolgsrate dramatisch von fast 40 % auf nahezu Null. Dies deutet darauf hin, dass das System zwar gelernt hat, den 3D-Raum gut zu verstehen, aber noch nicht flexibel genug gelernt hat, um mit Perspektiven umzugehen, die nicht in seinen Trainingsdaten enthalten waren. Die Forscher schlagen vor, dass zukünftige Arbeiten darauf abzielen müssen, diese visuellen Repräsentationen robuster gegenüber Perspektivwechseln zu machen.
Die Studie kommt zu dem Schluss, dass der Weg zu fähigeren Robotern nicht darin liegt, sie durch Sprache intelligenter zu machen, sondern ihr Sehen stärker in der physischen Realität zu verankern. Durch die Kombination eines groß angelegten visuellen Modells, das die 3D-Geometrie versteht, mit dem internen Gefühl des Roboters für seinen eigenen Körper, schufen die Forscher ein System, das die Welt mit einer Präzision manipulieren und navigieren kann, die im Bereich des Imitationslernens bisher unerreicht war. Die Arbeit zeigt, dass der Schlüssel zu einer generalisierbaren Robotersteuerung in einem tiefen, räumlichen Verständnis der Umgebung liegt, unterstützt durch ein internes Bewusstsein über den eigenen Zustand des Roboters. Obwohl weiterhin Herausforderungen bestehen, insbesondere im Umgang mit unerwarteten Änderungen der Kamerawinkel, bieten die Ergebnisse eine klare Richtung für die Zukunft der Robotersteuerung: Priorisieren Sie die räumliche Verankerung und biologische Inspiration gegenüber linguistischer Komplexität.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.