← Neueste Arbeiten
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLA ist ein Wake/Sleep-Framework, das durch das Clusterung von Aktionsfragmenten mittels eines verhaltensäquivalenzbasierten Kernels und eines latenten Weltmodells wiederverwendbare, typisierte Motorprogramme lernt und dadurch durch einen bibliotheksbedingten Decoder sowie eine Trainingszielsetzung, die die Clustering-Qualität gegenüber der Modellkapazität priorisiert, eine Spitzenleistung bei langfristigen LIBERO-Aufgaben erzielt.

Ursprüngliche Autoren: Riyaaz Shaik, Chandru Venkataraman

Veröffentlicht 2026-09-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Riyaaz Shaik, Chandru Venkataraman

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter werden immer besser darin, die Welt zu sehen und sich in ihr zu bewegen, aber sie haben immer noch Schwierigkeiten mit der Art von komplexen, mehrstufigen Aufgaben, die Menschen mit Leichtigkeit bewältigen. Wenn ein Mensch ein Sandwich zubereitet, denkt er nicht über jeden einzelnen Muskelzucken nach, der erforderlich ist, um das Brot zu greifen, die Butter zu streichen oder die Tomate zu schneiden. Stattdessen verlassen sie sich auf eine mentale Bibliothek vertrauter Handlungen – Greifen, Streichen, Schneiden –, die sie in unterschiedlicher Reihenfolge aneinanderreihen können. Aktuelle KI-Modelle für Roboter besitzen diese Fähigkeit zur Organisation von Abläufen oft nicht. Sie neigen dazu, rohe, momentane Befehle zu generieren, ohne sie in wiederverwendbare, gut definierte Fertigkeiten zu gruppieren. Dies macht es für sie schwierig, im Voraus für lange Aufgaben zu planen oder zu erklären, was sie gelernt haben. Forscher versuchen nun, Maschinen beizubringen, ihre eigenen internen Bibliotheken von Fertigkeiten aufzubauen, die es ihnen ermöglichen, komplizierte Aufgaben in kleinere, handhabbare Teile zu zerlegen, die wiederverwendet und kombiniert werden können.

Ein Team von Forschern bei Apple hat ein neues System namens REFACTOR-VLA entwickelt, das versucht, dieses Problem zu lösen, indem es einen Roboter lehrt, seine eigenen Fertigkeiten ohne menschliche Kennzeichnungen zu entdecken. Das System arbeitet in zwei abwechselnden Phasen, ganz ähnlich wie ein Mensch, der eine neue Bewegung übt und sich dann ausruht, um das Gehirn die Erinnerung organisieren zu lassen. In der ersten Phase lernt der Roboter vorherzusagen, was als Nächstes passieren wird, wenn er eine bestimmte Sequenz von Bewegungen ausführt. Er baut ein mentales Modell der Welt auf und versteht, wie seine Handlungen die Umgebung verändern. In der zweiten Phase analysiert das System die riesige Menge an Bewegungsdaten, die es gesammelt hat, und versucht, Muster zu finden. Es stellt eine einfache, aber schwierige Frage: Produzieren zwei verschiedene Sequenzen von Bewegungen das gleiche Ergebnis? Wenn ein Roboter seinen Arm in einem Kreis bewegt, um eine Tasse aufzunehmen, oder in einer geraden Linie, um dasselbe zu tun, muss das System erkennen, dass beide Pfade dasselbe Ziel erreichen.

Um dies zu beantworten, entwickelten die Forscher ein spezielles Werkzeug, das das Ergebnis von Handlungen misst, statt nur deren Erscheinungsbild. Anstatt nur das rohe Video des sich bewegenden Roboters zu betrachten, simuliert das System die Aktion in seinem gelernten mentalen Modell, um zu sehen, wo der Roboter landet und welche Belohnung er erhält. Wenn zwei verschiedene Bewegungspfade zum selben Endzustand und zur gleichen Belohnung führen, betrachtet das System sie als äquivalent. Es gruppiert diese ähnlichen Pfade dann zu einer einzigen, wiederverwendbaren Fertigkeit zusammen. Sob�

Sobald eine Gruppe gebildet wurde, versucht das System, ein einfaches, strukturiertes Programm zu schreiben, das das gemeinsame Muster dieser Fertigkeit beschreibt. Dieses Programm wird dann einer Bibliothek hinzugefügt. Der Roboter kann diese Bibliothek später nutzen, um neue Aufgaben zu planen, indem er auf diese vorgefertigten Fertigkeiten zurückgreift, anstatt jede winzige Bewegung von Grund auf neu zu berechnen.

Die Forscher testeten diesen Ansatz an einem Standard-Set von Roboteraufgaben in einer simulierten Umgebung. Sie entdeckten etwas Überraschendes darüber, wie diese Systeme lernen. Ein verbreiteter Glaube in der künstlichen Intelligenz ist, dass die Vergrößerung und Komplexität eines Modells immer zu einer besseren Leistung führt. Doch als die Forscher die Größe ihres Weltmodells von etwa 188 Millionen Parametern auf 430 Millionen erhöhten, schnitt das System in jedem einzelnen Testpaket schlechter ab. Das größere Modell versagte dabei, die Fertigkeiten korrekt zu organisieren, was darauf hindeutet, dass das bloße Hinzufügen von mehr Rechenleistung nicht die Lösung ist.

Stattdessen lag der Schlüssel zum Erfolg in der Art und Weise, wie das Modell trainiert wurde. Die Forscher fanden heraus, dass das Hinzufügen eines spezifischen Typs von Lernziel während der initialen Trainingsphase die Ergebnisse drastisch verbesserte. Dieses Lernziel half dem System, zwischen verschiedenen Aufgaben klarer zu unterscheiden, was es ihm ermöglichte, ähnliche Bewegungen wesentlich effektiver zu gruppieren. Mit dieser Änderung übertraf das System die stärksten bestehenden Methoden in allen vier großen Testpaketen und verbesserte seine Durchschnittspunktzahl um eine signifikante Marge. Das System baute erfolgreich eine Bibliothek aus drei distinkten, wiederverwendbaren Fertigkeiten für eine spezifische Aufgabe auf, und ein Roboter, der diese Bibliothek nutzte, war in der Lage, jede einzelne Demonstration, die er gesehen hatte, unter Verwendung dieser neuen Fertigkeiten neu zu schreiben.

Die Studie zeigte auch, dass die Fähigkeit des Systems, diese Fertigkeiten zu finden, stark von der Art der Daten abhängt, die es analysiert. Während das System erfolgreich eine Bibliothek von sprachbasierten Anweisungen erstellte, wie etwa „nehme das Objekt auf und platziere es in den Korb“, gelang es ihm nicht, wiederverwendbare Muster in den rohen Motorbefehlen selbst zu finden. Dies deutet darauf hin, dass das System besser darin ist, die übergeordneten Ziele einer Aufgabe zu verstehen als die niederschwelligen physischen Details der Ausführung. Die Forscher maßen die Konsistenz ihrer Ergebnisse über viele verschiedene Trainingsläufe hinweg und fanden heraus, dass das System zuverlässig ähnliche Fertigkeitsgruppierungen entdeckte, mit einem hohen Grad an Übereinstimmung zwischen verschiedenen Versionen des Modells.

Diese Arbeit zeigt, dass die Art und Weise, wie ein Roboter seine Erfahrungen organisiert, wichtiger ist als die schiere Größe seines Gehirns. Indem es sich auf die Ergebnisse von Handlungen konzentriert und eine strukturierte Methode verwendet, um diese zu gruppieren, kann das System eine Bibliothek von Fertigkeiten aufbauen, die ihm hilft, komplexe, langfristige Aufgaben anzugehen. Die Ergebnisse stellen die Vorstellung infrage, dass größer immer besser ist, und weisen den Weg zu einer Zukunft, in der Roboter lernen können, in Begriffen von wiederverwendbaren Handlungen zu denken, genau wie Menschen. Die Forscher haben ihren Code und ihre Daten zur Verfügung gestellt, damit andere diese Ergebnisse verifizieren und auf diesem neuen Ansatz der robotergestützten Lernprozesse aufbauen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →