Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
Das Papier stellt VLAct vor, einen repräsentationszentrierten Ansatz für das kontinuierliche Pre-Training von Vision-Language-Action-Modellen, der heterogene Multi-Embodiment-Daten nutzt, um eine überlegene Transferierbarkeit und Leistung über vielfältige Aufgaben und ungesehene Roboter hinweg zu erreichen, selbst bei moderaten Rechenbudgets und begrenzten Downstream-Daten.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter haben schon lange damit zu kämpfen, aus Erfahrung zu lernen, so wie es Menschen tun. Während ein Kind einem Elternteil zusehen kann, wie er ein Glas Wasser einschenkt, und die Bewegung versteht, benötigt ein Roboter typischerweise tausende spezifische, handcodierte Anweisungen, um dieselbe Aufgabe auszuführen. Jahrelang haben Wissenschaftler versucht, dies zu lösen, indem sie Roboter mit massiven Mengen an Daten fütterten, in der Hoffnung, dass schiere Volumina ihnen das Bewegen lehren würden. Dieser Ansatz stützt sich auf Vision-Language-Action-Modelle, also Computersysteme, die ein Bild sehen, einen Satz verstehen und eine physische Bewegung entscheiden können. Die vorherrschende Überzeugung war, dass das System von Natur aus klug genug werden würde, um jede Situation zu bewältigen, wenn man einfach genügend Roboterbewegungen sammelt. Das Sammeln von Roboterdaten ist jedoch unglaublich schwierig und teuer; im Gegensatz zu Fotos oder Texten im Internet müssen Roboterbewegungen in der realen physischen Welt aufgezeichnet werden, oft indem Menschen die Maschinen führen. Diese Knappheit bedeutet, dass selbst die größten Roboterdatensätze winzig und spärlich sind im Vergleich zur Unermesslichkeit der physischen Welt.
Ein Forscherteam hat nun einen anderen Weg vorgeschlagen und legt nahe, dass die Qualität dessen, was ein Roboter lernt, wichtiger ist als die Quantität der Daten, die er sieht. Sie argumentieren, dass ein Robotergehirn, anstatt nur spezifische Bewegungen auswendig zu lernen, ein tiefes, flexibles Verständnis dafür entwickeln muss, wie Objekte und Handlungen miteinander in Beziehung stehen. Durch die Konzentration auf diese „Repräsentation“ – die interne Karte, die der Roboter von der Welt aufbaut – haben sie eine neue Trainingsmethode entwickelt, die es Robotern ermöglicht, viel besser zu generalisieren. Ihre Arbeit zeigt, dass ein System mit einer klügeren Art, das Kerngehirn des Roboters zu lehren, in der Lage ist, komplexe Aufgaben auf Robotern auszuführen, die es noch nie zuvor gesehen hat, und zwar mit nur einem Bruchteil der Daten, die zuvor als notwendig erachtet wurden.
Das Team von Forschern, das unter dem Namen VLAct arbeitet, begann mit einer grundlegenden Frage: Warum scheitern Roboter an der Generalisierung? Wenn ein Roboter auf einen spezifischen Satz von Bewegungen trainiert wird, wird er oft zu spezialisiert und lernt, die exakten Muster nachzuahmen, die er gesehen hat, anstatt die zugrunde liegende Physik der Aufgabe zu verstehen. Um dies zu untersuchen, betrachtete das Team, wie verschiedene Arten der Unterrichtung eines Roboters dessen internes Verständnis beeinflussten. Sie fanden heraus, dass ein Roboter „festgefahren“ ist, wenn er darauf trainiert wird, Handlungen unter Verwendung nur einer spezifischen Methode vorherzusagen. Es ist wie ein Schüler, der lernt, Matheaufgaben mit nur einer spezifischen Formel zu lösen; wenn die Prüfung das Format der Frage ändert, scheitert der Schüler, weil er nie das Konzept selbst gelernt hat. Die Forscher entdeckten, dass dieses „Festfahren“ eintritt, wenn das Gehirn des Roboters gezwungen wird, sein Wissen in eine einzige, starre Struktur einzupassen.
Um dies zu beheben, entwickelte das Team ein neues Trainingsrezept, das das Gehirn des Roboters flexibel hält. Sie begannen mit einem leistungsstarken Vision-Language-Modell, einer Art künstlicher Intelligenz, die bereits auf riesigen Mengen an Internetbildern und Texten trainiert wurde und somit ein breites Verständnis der Welt besitzt. Anstatt das Robotertraining dieses breiten Wissens überschreiben zu lassen, schützten sie die unteren Schichten des Gehirns, die für die grundlegende visuelle Erkennung zuständig sind. Sie führten dann eine einzigartige Technik ein, bei der der Roboter gebeten wurde, dieselben physischen Bewegungen gleichzeitig mit drei verschiedenen mathematischen Methoden vorherzusagen. Indem sie den Roboter dazu zwangen, alle drei Methoden gleichzeitig zu erfüllen, verhinderten die Forscher, dass er sich auf nur eine einzige spezialisiert. Dieser Ansatz stellte sicher, dass der Roboter ein universelles Verständnis von Handlung erlernte, anstatt eine enge Fertigkeit, die an eine einzige Art der Bewegungsberechnung gebunden war.
Darüber hinaus befasste sich das Team mit dem Problem unterschiedlicher Roboterkörper. Ein Roboter mit zwei Armen bewegt sich anders als ein Roboter mit einem Arm, und ein Roboter mit einem Greifer bewegt sich anders als einer mit einer Hand. Frühere Methoden behandelten diese Unterschiede oft als separate Probleme und trainierten ein einzigartiges Gehirn für jeden Robotertyp. Das VLAct-Team hingegen schuf eine gemeinsame Sprache für die Bewegung. Sie lehrten den Roboter, dass das Öffnen eines Greifers an einer Maschine dasselbe Konzept ist wie das Öffnen eines Greifers an einer anderen, selbst wenn die physischen Mechaniken unterschiedlich sind. Sie erreichten dies, indem sie die Teile der Handlung, die physisch ähnlich sind, wie das Öffnen und Schließen einer Hand, aufeinander abstimmten, während sie die einzigartigen Teile jedes Roboterkörpers separat ließen. Dies ermöglichte es dem Roboter, das Gelernte über einen Typ von Maschine auf einen völlig anderen Typ von Maschine zu übertragen, den er zuvor noch nie encountert hatte.
Die Ergebnisse dieses Ansatzes waren beeindruckend. Bei Tests über eine breite Palette von Aufgaben hinweg übertraf das neue System konsistent bestehende Modelle, einschließlich derer, die auf viel größeren Datensätzen trainiert wurden. In einem Simulations-Benchmark namens LIBERO-Plus, der testet, wie gut ein Roboter mit Änderungen in Beleuchtung, Kameraperspektiven und Objektplatzierung umgeht, erreichte das neue System eine Erfolgsquote von 82,6 Prozent. Dies war signifikant höher als bei anderen führenden Systemen und bewies, dass der Roboter ein robustes Verständnis der Aufgabe erlernt hatte, anstatt nur ein spezifisches Szenario auswendig zu lernen. In einem anderen Benchmark namens RoboTwin 2.0, bei dem zwei Roboterarme zusammenarbeiten, erreichte das System eine Erfolgsquote von 92,5 Prozent und übertraf damit groß angelegte industrielle Systeme, die auf proprietären Daten und massiver Rechenleistung basieren.
Der vielleicht überzeugendste Beweis für die Leistungsfähigkeit dieser Methode kam aus einem Test mit einem humanoiden Roboter, der völlig neu in den Trainingsdaten war. Die Forscher trainierten ihr System mit Daten von Standard-Roboterarmen und baten es dann, einen humanoiden Roboter mit Beinen und einem Torso zu steuern – eine Maschine, die es zuvor noch nie gesehen hatte. Unter Verwendung von nur 20 Prozent der Daten, die normalerweise erforderlich wären, um einen Roboter für diesen spezifischen Körper zu trainieren, schnitt das System besser ab als ein Baseline-Modell, das mit 100 Prozent der Daten trainiert wurde. Dies deutet darauf hin, dass der Roboter ein fundamentales Konzept des „Wie man sich bewegt“ gelernt hat, das auf jeden Körper angewendet werden kann, anstatt nur die spezifischen Bewegungen der Arme auswendig zu lernen, auf denen er trainiert wurde.
Die Forscher testeten ihr System auch in der realen Welt, wobei sie physische Roboterarme nutzten, um Aufgaben wie das Stapeln von Blöcken, das Reinigen von Tischen und das Falten von Kleidung auszuführen. In diesen realen Experimenten übertraf das System die Baseline weiterhin und zeigte eine größere Stabilität und Präzision. Es bewältigte erfolgreich neuartige Objekte, die es zuvor noch nie gesehen hatte, wie etwa das Aufheben einer Paprika anstelle einer Karotte, und bewältigte komplexe, mehrstufige Aufgaben wie das Schöpfen von Bohnen und das Gießen in eine Schüssel, ohne Schritte auszulassen. Das System zeichnete sich auch bei der Koordination zweier Arme aus, um zusammenzuarbeiten, wie etwa das Halten einer Steckdose, während ein Stecker gezogen wird, was ein Maß an Synchronisation demonstrierte, mit dem frühere Modelle Schwierigkeiten hatten.
Was diese Arbeit besonders bedeutsam macht, ist, dass dies mit nur Open-Source-Daten und einer moderaten Menge an Rechenleistung erreicht wurde, konkret mit einem Setup aus 16 Grafikprozessoren. Dies steht im Gegensatz zu vielen der leistungsfähigsten Systeme auf diesem Gebiet, die auf proprietären Datensätzen und massiven industriellen Rechenressourcen beruhen. Die Forscher zeigten, dass es möglich ist, leistungsfähigere und anpassungsfähigere Roboter zu bauen, indem man sich darauf konzentriert, wie der Roboter die Welt intern repräsentiert, anstatt nur die Menge der Daten zu skalieren. Ihre Erkenntnisse legen nahe, dass die Zukunft des Roboterlernens nicht im Sammeln endloser Datenströme liegt, sondern im Design von Trainingsmethoden, die dem Roboter helfen, ein tieferes, flexibleres Verständnis der physischen Welt aufzubauen.
Die Studie kommt zu dem Schluss, dass die Art und Weise, wie ein Roboter unterrichtet wird, genauso wichtig ist wie das, was ihm beigebracht wird. Indem man das breite Wissen eines vortrainierten Gehirns bewahrt und es ermutigt, Handlungen auf eine Weise zu lernen, die nicht an eine einzige Methode oder einen einzigen Körpertyp gebunden ist, können Forscher Systeme schaffen, die weitaus besser in der Lage sind, die unvorhersehbare Natur der realen Welt zu bewältigen. Dieser Ansatz bietet einen vielversprechenden Pfad zu universell einsetzbaren Robotern, die neue Aufgaben schnell lernen und sich an neue Umgebungen anpassen können, ohne dass enorme Mengen an neuen Daten erforderlich sind. Die Arbeit wurde der Öffentlichkeit zur Verfügung gestellt, damit andere Wissenschaftler auf diesen Erkenntnissen aufbauen und weiter erforschen können, wie man Maschinen hilft, sich mit derselben Flexibilität und demselben Verständnis wie Lebewesen zu bewegen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.