AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
Das Papier stellt AnyWorld vor, ein faktorisierendes Weltmodellierungs-Framework, das durch die Entkopplung von Aktions-, Kamera- und Embodiment-Faktoren vielfältige, roboterübergreifende Erfahrungen aus einzelnen menschlichen Ego-Perspektiven-Videos synthetisiert und dadurch eine steuerbare Datengenerierung ermöglicht, die Manipulations-Policies sowohl auf simulierten als auch auf realen humanoiden Robotern signifikant verbessert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter lernen, mehr zu tun als nur in geraden Linien zu fahren; sie lernen, die Welt um sie herum zu manipulieren, Objekte aufzuheben, Türen zu öffnen und Teile zusammenzubauen. Um diese Fähigkeiten zu erlernen, benötigt ein Roboter Erfahrung. Er muss tausende Beispiele davon sehen, wie eine Hand nach einer Tasse greift, wie ein Greifer einen Schwamm zusammendrückt und wie ein Werkzeug über einen Tisch gleitet. Lange Zeit war der einzige Weg, diese Erfahrung zu sammeln, darin, dass ein Roboter die Aufgabe selbst immer und immer wieder ausführte. Das ist langsam, teuer und begrenzt durch die Anzahl der Roboter, die ein Labor sich leisten kann zu bauen, und die Stunden, die sie ohne Defekte laufen können.
Eine vielversprechende Alternative ist aus einer unerwarteten Quelle entstanden: menschlichen Videos. Jeden Tag nehmen Menschen Videos auf, in denen sie kochen, putzen und Dinge bauen. Diese Videos sind voller reicher, physischer Interaktionen, von denen Roboter lernen könnten. Es gibt jedoch ein großes Problem. Ein Video, das einen Menschen beim Kochen zeigt, zeigt eine menschliche Hand, einen menschlichen Körper und eine menschliche Perspektive. Ein Roboter hat keinen menschlichen Körper und sieht die Welt nicht aus einem menschlichen Kopf heraus. Wenn ein Robot versucht, ein menschliches Video direkt zu kopieren, könnte er scheitern, weil der menschliche Arm länger ist, die Kamera des Roboters an einer anderen Stelle sitzt oder der Greifer des Roboters anders funktioniert. Die Herausforderung für Wissenschaftler besteht darin, herauszufinden, wie man die nützliche „Geschichte“ dessen, was in einem menschlichen Video geschieht, nimmt und sie so neu erzählt, dass sie für einen Roboter Sinn ergibt.
Ein Team von Forschern hat ein neues System namens AnyWorld entwickelt, um dieses Problem zu lösen. Anstatt zu versuchen, ein menschliches Video exakt zu kopieren, zerlegt das System das Video in drei separate Zutaten: die ausgeführte Aktion, die Art und Weise, wie sich die Kamera bewegt, und den Körper sowie die Szene, die die Arbeit verrichten. Stellen Sie sich die Aktion als das Skript dessen vor, was passiert, die Kamerabewegung als die Regie der Einstellung und den Körper sowie die Szene als die Schauspieler und das Set vor. Durch die Trennung dieser Elemente können die Forscher ein einzelnes Video eines Menschen, der eine Aufgabe ausführt, nehmen und diese Zutaten neu kombinieren, um ein brandneues Video zu erstellen. In diesem neuen Video ist der „Schauspieler“ ein Roboter, das „Set“ ist die Umgebung eines Roboters und die „Kamera“ ist das Auge eines Roboters, aber das „Skript“ der Aktion bleibt gleich.
Die Forscher trainierten ihr System mit einer massiven Sammlung von menschlichen Videos, in denen Menschen mit Objekten interagierten. Sie brachten dem Modell bei, den Unterschied zwischen der Bewegung der Aufgabe und dem spezifischen Körper, der sie ausführt, zu verstehen. Nachdem das Modell dies gelernt hatte, testeten sie es, indem sie ihm ein menschliches Video fütterten und es baten, eine Version derselben Aufgabe generieren zu lassen, die von einem Roboter ausgeführt wird. Sie benötigten keine Videos, die einen Menschen und einen Roboter nebeneinander dieselbe Aufgabe ausführen lassen. Das System nahm einfach die Bewegungen des Menschen und den Pfad der Kamera und tauschte dann einen Roboterkörper und eine Roboterszene ein. Das Ergebnis war ein Video, das wie ein Roboter aussah, der die Aufgabe ausführt, komplett mit der korrekten Perspektive und den physikalischen Einschränkungen dieser spezifischen Maschine.
Das Team testete diese Fähigkeit, den Körper, den Kamerawinkel und die Szene zu ändern. Sie zeigten, dass das System ein menschliches Video nehmen und eine Version generieren kann, in der ein Roboter namens RoboCasa GR1 die Aufgabe ausführt, sowie eine andere Version, in der ein anderer Roboter namens IRON sie ausführt. Sie zeigten auch, dass sie den Roboter und die Aufgabe gleich lassen und den Kamerawinkel ändern konnten, wodurch eine Ansicht aus einer anderen Perspektive entstand. Entscheidend war, dass das System die Logik der Interaktion bewahrte. Wenn ein Mensch im Originalvideo eine Tasse aufhob und sie in ein Regal stellte, zeigte das generierte Roboter-Video, dass der Roboter genau dieselbe Sequenz von Bewegungen ausführte, nur angepasst an seinen eigenen Körper und seine Kameraposition.
Um zu beweisen, dass diese generierten Videos tatsächlich nützlich waren, nutzten die Forscher sie, um echte Roboter zu trainieren. Sie nahmen ein Standard-Roboterlernsystem und gaben ihm zusätzliches Training durch die von AnyWorld erstellten Videos. Sie testeten dies an einer Simulation eines Roboterarms und an einem echten, physischen humanoiden Roboter. In der Simulation verbesserte sich die Erfolgsquote des Roboters beim Aufheben und Platzieren von Objekten nach dem Training mit den generierten Daten signifikant. Beim echten Roboter war die Verbesserung sogar noch dramatischer. Ein Roboter, der zuvor nur in 20 Prozent der Versuche erfolgreich eine Banane greifen konnte, sprang nach dem Training mit den Human-to-Robot-Videos auf eine Erfolgsquote von 55 Prozent. Dies zeigte, dass das System nicht nur hübsche Bilder erzeugte, sondern valide Trainingsdaten schuf, die dem Roboter halfen, besser zu lernen.
Die Forscher untersuchten auch genau, warum dies funktionierte. Sie wollten wissen, ob es ausreichte, dem Roboter lediglich zu sagen, welche Aktion er ausführen soll, oder ob die visuelle Szene ebenfalls notwendig war. Sie führten einen Test durch, bei dem sie dem Roboter die korrekten Aktionsbefehle gaben, aber die visuellen Trainingsdaten aus den ursprünglichen, unveränderten Roboter-Videos beibehielten. Dieser Ansatz scheiterte daran, dem Roboter beizubringen, spezifische Anweisungen zu befolgen, wie zum Beispiel die linke Banane statt der rechten zu wählen. Jedoch, als sie das volle System verwendeten, um sowohl die neue visuelle Szene als auch die korrekte Aktion zu generieren, lernte der Roboter, den Anweisungen zuverlässig zu folgen. Dies bewies, dass die visuelle Rekombination essenziell war. Der Roboter musste die Welt aus seiner eigenen Perspektive sehen, um die Aktion anwenden zu können.
Die Studie legt nahe, dass diese Methode des Zerlegens von Interaktionen in separate Faktoren es ermöglicht, eine einzige menschliche Erfahrung viele Male wiederzuverwenden. Ein menschliches Video, das einst auf einen menschlichen Körper und eine menschliche Kamera beschränkt war, kann zu einer Quelle von Trainingsdaten für viele verschiedene Arten von Robotern in vielen verschiedenen Umgebungen werden. Die Forscher merkten an, dass das System zwar leistungsfähig ist, aber auch Grenzen hat. Es kann noch nicht das Gefühl des Tastsinns oder die exakte Kraft erfassen, die zum Zusammendrücken eines weichen Objekts nötig ist, da dies physische Sensoren erfordert, die die Videogenerierung nicht bereitstellt. Zudem ist das System darauf angewiesen, dass die menschlichen Bewegungen klar verfolgt werden können; wenn das Video zu wackelig ist oder die Person hinter einem Objekt verborgen ist, hat das System Schwierigkeiten.
Trotz dieser Einschränkungen bietet die Arbeit einen neuen Weg für das Lernen von Robotern. Sie deutet darauf an, dass die riesige Bibliothek menschlicher Videos im Internet, die für Roboter aufgrund der Unterschiede in Körpern und Blickwinkeln bisher schwer nutzbar war, nun angezapft werden kann. Indem sie ein Modell verwenden, das versteht, wie man die Aktion vom Akteur trennt, können Wissenschaftler menschliche Erfahrungen in Robotererfahrungen verwandelt, ohne jede einzelne Aufgabe mit jedem einzelnen Roboter aufnehmen zu müssen. Dies könnte es Robotern ermöglichen, komplexe Fähigkeiten viel schneller zu erlernen, indem sie die reichlich vorhandenen Daten des menschlichen Alltags als Fundament für ihre eigenen Fähigkeiten nutzen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.