Motus2: A Self-Evolving General World Model for Dexterous Manipulation
Motus2 ist ein selbstentwickelndes, allgemeines Weltmodell für geschickte Manipulation, das Policy, Simulation und Evaluierung in einem geschlossenen Entscheidungs- und Lernkreislauf vereint und dabei skalierte Modellarchitekturen sowie progressiv erweiterte multimodale Datensätze nutzt, um durch sowohl Experten-Demonstrationen als auch selbst generierte Interaktionsdaten eine kontinuierliche Verbesserung zu ermöglichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Um einen Roboter zu bauen, der die chaotische, unvorhersehbare Welt menschlicher Aufgaben wirklich bewältigen kann, suchen Wissenschaftler schon lange nach einem System, das mehr tut, als nur einer Liste von Anweisungen zu folgen. Das Ziel ist es, eine Maschine zu erschaffen, die ihre Umgebung wahrnehmen, sich vorstellen kann, was als Nächstes passieren könnte, eine Aktion ausführt und dann aus dem Ergebnis lernt, um es beim nächsten Mal besser zu machen. Dieses Konzept, bekannt als „Weltmodell“, fungiert wie ein interner Simulator für den Roboter. Anstatt nur auf das zu reagieren, was er gerade sieht, führt der Roboter mentale Simulationen durch, um das Ergebnis seiner Bewegungen zu erraten, bevor er sie tatsächlich ausführt. Während frühere Versionen dieser Systeme zwar die Zukunft vorhersagen oder einen Zug vorschlagen konnten, arbeiteten sie oft in einer geraden Linie: sehen, raten, handeln und anhalten. Ihnen fehlte eine Möglichkeit, auf ihre eigenen Vorhersagen zurückzuschauen, zu beurteilen, ob diese gut oder schlecht waren, und dieses Urteil zu nutzen, um ihre Entscheidungsfähigkeiten zu verbessern, ohne jedes Mal auf einen Menschen angewiesen zu sein, der ihnen den richtigen Weg zeigt.
Ein Forschungsteam hat nun ein System namens Motus2 vorgestellt, ein sich selbst entwickelndes „Robotergehirn“, das speziell für feine, komplexe Aufgaben wie die Verwendung von Werkzeugen oder den Umgang mit Objekten mit menschenähnlichen Händen entwickelt wurde. Dieses System stellt einen bedeutenden Fortschritt dar, da es den Kreislauf zwischen Denken und Lernen schließt. Anstatt nur ein passiver Beobachter oder ein einfacher Befehlsempfänger zu sein, agiert Motus2 als sein eigener Lehrer. Es schlägt eine Serie möglicher Bewegungen vor, simuliert, wie diese Bewegungen in der Zukunft aussehen würden, und bewertet dann, ob diese vorgestellten Ergebnisse zum Erfolg führen würden. Wenn die Simulation eine Fehlleistung zeigt, lernt der Roboter aus diesem Fehler. Wenn sie einen Erfolg zeigt, verstärkt er diesen Pfad. Dieser Zyklus ermöglicht es dem Roboter, seine eigene „Policy“, also seinen Satz an Handlungsregeln, zu verbessern, indem er seine eigenen Ideen ständig testet und verfeinert, selbst wenn er keinen Menschen hat, der ihn bei jedem Schritt leitet.
Das Fundament dieses Systems basiert auf einer massiven Menge an Daten, die von menschlichen Händen gesammelt wurden. Die Forscher begannen damit, dem Roboter beizubringen, wie Menschen mit der Welt interagieren, indem sie Videos aus der Ich-Perspektive verwendeten, als wäre die Kamera am Kopf der Person montiert. Sie begannen mit einfachen, einlinsigen Videos, die eine große Vielfalt an Aufgaben zeigten, vom Kochen bis zum Organisieren, und gingen dann zu fortgeschritteneren, synchronisierten Stereo-Videos über, die ein Gefühl für die Tiefe vermitteln, ähnlich dem menschlichen binokularen Sehen. Dies ermöglichte es dem Roboter, die subtile Physik zu erlernen, wie Hände Objekte greifen, heben und manipulieren. Doch bloßes Beobachten von Menschen reicht für einen Roboter mit einem anderen Körper nicht aus. Die Forscher führten das System dann durch eine mittlere Trainingsphase, in der es lernte, jene menschlichen Bewegungen in die spezifische Mechanik seiner eigenen Roboterarme und -hände zu übersetzen. Dieser Prozess beinhaltete das Zeigen von tausenden Stunden menschlicher Daten, gefolgt von spezifischen Beispielen dafür, wie Menschen und Roboter zusammenarbeiten können, wodurch die Lücke zwischen menschlicher Intuition und roboterhafter Ausführung effektiv überbrückt wurde.
Was Motus2 einzigartig macht, ist die Art und Weise, wie es dieses Wissen nutzt. Das System basiert auf einem einzigen, einheitlichen Modell, das gleichzeitig drei verschiedene Hüte trägt. Erstens agiert es als „Policy“, die vorschlägt, welche Aktion als Nächstes zu treffen ist. Zweitens agiert es als Simulator, der vorhersagt, wie die Welt nach dieser Aktion aussehen wird. Drittens agiert es als Evaluator, der beurteilt, ob diese vorhergesagte Zukunft gut oder schlecht ist. In traditionellen Systemen sind diese Funktionen oft getrennt oder entkoppelt, aber hier sind sie eng miteinander verwoben. Wenn der Roboter eine Bewegung in Erwägung zieht, führt er sofort eine mentale Simulation durch, um die Konsequenzen zu sehen. Er fragt sich dann selbst, ob diese Konsequenz wünschenswert ist. Wenn die Antwort „Nein“ lautet, verwirft er diesen Pfad und versucht einen anderen. Wenn die Antwort „Ja“ lautet, führt er die Aktion aus. Dieser interne Dialog geschieht so schnell, dass der Roboter mehrere Schritte im Voraus planen kann und den besten Weg wählt, bevor er auch nur einen Muskel bewegt.
Die Forscher testeten dieses System auf einer voll robotergestützten Plattform, die mit zwei Armen, zwei geschickten Händen und Sensoren ausgestattet ist, die Berührung fühlen können, ähnlich den menschlichen Fingerspitzen. Sie forderten den Roboter mit einer Reihe schwieriger Aufgaben heraus, wie etwa das Platzieren eines Balls an einer bestimmten Stelle, das Einschrauben einer Glühbirne in eine Fassung oder das Anbringen eines Radiergummis an einem Stift. In diesen Tests erwies sich die Fähigkeit des Systems, aus seinen eigenen Simulationen zu lernen, als entscheidend. Als das System die Möglichkeit erhielt, seinen internen Evaluator zu nutzen, um die besten Optionen während einer Aufgabe auszuwählen, verbesserte sich seine Erfolgsquote signifikant. Noch beeindruckender war, dass das System noch besser bei der Aufgabe wurde, wenn es seine eigenen Vorhersagen nutzen durfte, um seine eigenen Lernregeln zu aktualisieren. Der Roboter hatte nicht einfach nur Glück; er lernte tatsächlich, Fehler zu vermeiden, die er simuliert hatte, und Aktionen zu wiederholen, die er als erfolgreich simuliert hatte.
Ein wesentlicher Teil dieses Erfolgs war die Fähigkeit des Roboters, sich an das zu erinnern, was früher in einer Aufgabe geschah, selbst wenn diese Informationen vorübergehend nicht sichtbar waren. Um viele komplexe Aufgaben zu bewältigen, könnte eine Hand die Sicht auf ein Objekt blockieren, oder ein kritischer Schritt könnte lange vor dem endgültigen Ergebnis stattgefunden haben. Um dies zu handhaben, gaben die Forscher dem Roboter eine Form von Arbeitsgedächtnis, das wichtige visuelle Details aus der Vergangenheit festhalten konnte. Sie testeten verschiedene Wege, dieses Gedächtnis zu verwalten, vom Beibehalten eines kurzen, rollenden Fensters jüngster Ereignisse bis hin zur Pflege einer längeren, detaillierteren Historie. Die Ergebnisse zeigten, dass der Zugriff auf eine solche längere Historie es dem Roboter ermöglichte, Aufgaben zu lösen, die das Erinnern an eine Sequenz von Ereignissen über einen längeren Zeitraum erforderten, was bewies, dass die Fähigkeit, die Vergangenheit abzurufen, ebenso wichtig ist wie die Vorhersage der Zukunft.
Das System beinhaltete auch ein spezialisiertes Modul für den Tastsinn. Während die Sicht mächtig ist, kann sie nicht immer sagen, ob ein Griff rutscht oder ob eine Oberfläche zu weich ist. Der Roboter war mit einem leichtgewichtigen Expertensystem ausgestattet, das sich der Verarbeitung taktiler Rückmeldungen widmete. Dies ermöglichte es ihm, seine Bewegungen in Echtzeit zu verfeinern und seinen Griff in dem Moment anzupassen, in dem er ein Rutschen oder eine Änderung des Drucks spürte. Diese Kombination aus Sehen, Fühlen, Denken und Lernen schuf ein robustes System, das in der Lage war, die Ungewissheit der realen Welt zu bewältigen.
Die Ergebnisse legen nahe, dass der Weg zu wirklich fähigen Robotern nicht nur in der Sammlung von mehr Daten liegt, sondern im Bau von Systemen, die in der Lage sind, diese Daten zu nutzen, um sich selbst zu hinterfragen und zu verbessern. Durch die Kombination von groß angelegten menschlichen Interaktionsdaten mit einer selbstkorrigierenden Schleife aus Vorhersage und Evaluierung demonstrierte Motus2, dass Roboter in der Lage sind, die physische Welt mit einem Maß an Anpassungsfähigkeit zu manipulieren, das zuvor unerreichbar war. Die Forscher fanden heraus, dass mit zunehmender Menge an Stereo-Videodaten, die für das Training verwendet wurden, die Fähigkeit des Roboters, menschliche Handlungen vorherzusagen, auf eine konsistente, vorhersehbare Weise anstieg. Diese Skalierung deutet darauf hin, dass diese Systeme mit noch mehr Daten sogar noch leistungsfähiger werden könnten. Letztendlich zeigt die Arbeit, dass ein Roboter nicht mit jeder möglichen Lösung für jedes mögliche Problem programmiert werden muss. Wenn er stat nachdem in der Lage ist, die Zukunft zu simulieren, das Ergebnis zu beurteilen und aus der Differenz zu lernen, kann er seine eigenen Fähigkeiten entwickeln, um den Herausforderungen einer komplexen, geschickten Welt zu begegnen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.