CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
CLAP ist ein neuartiges Framework, das eine Zero-Shot-Physiksimulation über diverse Roboter- und menschliche Embodiments hinweg ermöglicht, indem es auf heterogenen Internet-Scale-Videos trainiert und durch ein Curriculum-basiertes Lernrezept unterschiedliche Aktionsräume vereinheitlicht, um eine State-of-the-Art-Leistung bei der Few-Shot-Adaption und dem verallgemeinerbaren Verständnis von Physik zu erzielen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter haben schon lange damit zu kämpfen, die physische Welt so zu verstehen, wie es Menschen tun. Während ein Kind lernt, dass ein Becher herunterfällt, wenn man ihn von einem Tisch stößt, oder dass ein Handtuch gefaltet werden kann, indem man an seinen Ecken zieht, benötigen Roboter oft tausende spezifische Beispiele, um selbst die einfachsten dieser Regeln zu lernen. Diese Schwierigkeit rührt daher, dass die meisten Lernsysteme für Roboter auf Daten eines einzigen Maschinentyps trainiert werden. Ein Roboter mit einem langen, dünnen Arm lernt die Physik anders als ein Robot mit einem Greifer oder einer menschlichen Hand, was eine Barriere schafft, durch die das von einem gewonnen an Wissen nicht einfach mit einem anderen geteilt werden kann. Um dies zu überwinden, haben Wissenschaftler begonnen, sich auf Videogenerationsmodelle zu konzentrieren – Computerprogramme, die fähig sind, sich vorzustellen, was als Nächstes in einer Szene passiert. Wenn ein Roboter ein Video beobachten und die zukünftige Bewegung von Objekten vorhersagen könnte, könnte er seine Handlungen planen, ohne sie zuerst physisch ausprobieren zu müssen. Diese prädiktiven Modelle waren jedoch historisch gesehen auf einzelne Robotertypen beschränkt, was verhinderte, dass sie von der riesigen, vielfältigen Bibliothek an menschlichen und robotischen Videos im Internet lernen konnten.
Ein Team von Forschern der Princeton University hat ein neues Framework namens CLAP entwickelt, um diese Lücke zu schließen. Ihre Arbeit zeigt, dass ein einziges Videomodell die universellen physikalischen Gesetze lernen kann, indem es an einer massiven Mischung aus Videos trainiert wird, die sowohl Menschen als auch viele verschiedene Arten von Robotern zeigen. Der Kern der Idee ist, dass eine menschliche Hand, ein Roboterarm und ein Greifer zwar alle unterschiedlich aussehen, aber alle denselben physikalischen Regeln folgen, wenn sie Objekte bewegen. Indem die Forscher einen Computer darauf trainierten, die Zukunft einer Szene vorherzusagen, unabhängig davon, wer oder was die Handlung ausführt, schufen sie ein System, das die zugrunde liegende Mechanik der Welt versteht, anstatt nur die spezifischen Bewegungen einer einzelnen Maschine. Dieser Ansatz ermöglicht es dem Modell, aus unbeschrifteten Internetvideos zu lernen, in denen keine Anweisungen gegeben werden, sowie aus detaillierten Robotendaten, was zu einem viel reicheren Verständnis darüber führt, wie Dinge sich bewegen und interagieren.
Die Forscher standen vor einer erheblichen Hürde, da die Daten, die sie verwenden wollten, ungeordnet und inkonsistent waren. Videos von Menschen kommen nicht mit Anweisungen dazu, wie sich ihre Hände bewegt haben, und verschiedene Roboter nutzen unterschiedliche Wege, um ihre Bewegungen zu beschreiben. Um dies zu lösen, entwickelte das Team eine Methode, um all diese verschiedenen Sprachen der Bewegung in ein gemeinsames Format zu übersetzen. Sie nutzten drei Hauptwerkzeuge: die präzise Position einer Roboterhand, einfache Textbeschreibungen der Bewegung und eine verborgene, gelernte Repräsentation von Aktion, die der Computer selbstständig ermittelt. Die effektivste Strategie beinhaltete einen schrittweisen Lernprozess. Zuerst lernte das Modell die grundlegenden Regeln der Physik, indem es unbeschriftete Videos unter Verwendung der verborgenen Aktionsrepräsentationen beobachtete. Sobald es die grundlegende Dynamik verstanden hatte, verfeinerten die Forscher sein Wissen mithilfe präziser Daten von Robotern mit beschrifteten Bewegungen. Dieser zweistufige Ansatz ermöglichte es dem System, sich mithilfe der riesigen Menge an Internetvideos zu skalieren und gleichzeitig präzise genug zu bleiben, um echte Roboter zu steuern.
Die Ergebnisse dieser Arbeit zeigen, dass das neue System so gut wie – und oft sogar besser als – die besten existierenden Modelle performt, die nur auf einem einzigen Typ von Roboter trainiert wurden. In anspruchsvollen Testumgebungen konnte das Modell die zukünftigen Frames eines Videos mit hoher Genauigkeit vorhersagen und korrekt simulieren, wie Objekte fallen, gleiten oder manipuliert werden. Entscheidend war, dass das System in der Lage war, dieses Wissen auf reale Aufgaben zu generalisieren, ohne dafür jedes Mal neu trainiert werden zu müssen. Als es an einem einarmigen Roboter getestet wurde, half das System dem Roboter erfolgreich bei der Planung seiner Handlungen, um verschiedene Objekte wie Klebeband, Fisch oder Hummer aufzuheben, wobei es Standard-Roboter-Policies übertraf. Noch beeindruckender war, dass das System auf einen zweiarmigen Roboter und einen humanoiden Roboter mit einer anderen Körperstruktur angewendet werden konnte, obwohl es nie mit Daten von diesen spezifischen Maschinen trainiert worden war. Durch die bloße Anpassung der letzten Schicht des Modells an die Bewegungen des neuen Roboters behielt das System sein tiefes Verständnis der Physik bei und lieferte weiterhin genaue Vorhersagen.
Diese Forschung legt nahe, dass der Weg zu leistungsfähigeren Robotern nicht darin besteht, für jede neue Maschine ein einzigartiges Gehirn zu bauen. Stattdessen kann ein einziges Modell durch das Training an einer vielfältigen Mischung von Daten einen allgemeinen Satz physikalischer Prinzipien lernen, die für fast jeden Akteur gelten. Die Forscher fanden heraus, dass relative Bewegungen, die Veränderungen statt Positionen beschreiben, gut für textbasierte Anweisungen funktionierten, aber absolute Positionen für die präzise Steuerung mit Roboterarmen notwendig waren. Sie entdeckten auch, dass menschliche Videos hervorragend geeignet waren, um dem Modell die Grundlagen der Physik beizubringen, während Daten von tatsächlichen Robotern essenziell waren, um dieses Wissen in erfolgreiche reale Handlungen zu übersetzen. Die Arbeit etabliert eine neue Art, Roboter zu trainieren, weg von isolierten, einzweckigen Systemen hin zu einem einheitlicheren Ansatz, bei dem das Lernen von einer Verkörperung direkt einer anderen zugutekommt. Obwohl das System nicht perfekt ist und gelegentlich Fehler in seinen Vorhersagen machen kann, stellt es einen bedeutenden Schritt nach vorn dar, um Maschinen durch Beobachtung und Vorstellungskraft das Verständnis der physischen Welt beizubringen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.