Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
Das Papier schlägt Tok vor, einen neuartigen Multi-Head-Multi-Codebook-Aktions-Tokenizer, der den Rekonstruktionsfehler signifikant reduziert und die Leistung von Vision-Language-Action-Modellen verbessert, indem er latente Merkmale in spezialisierte Heads mit unabhängigen Codebooks zerlegt, um die feingliedrige Aktionsdynamik besser zu erfassen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter haben lange Zeit damit gekämpft, sich mit der fließenden Anmut einer menschlichen Hand zu bewegen. Während moderne künstliche Intelligenz heute Gedichte schreiben, Krankheiten diagnostizieren und atemberaubende Bilder generieren kann, bleibt die Fähigkeit einer Maschine, die physische Welt zu manipulieren, eine hartnäckige Herausforderung. Der Kern des Problems liegt darin, wie Computer Bewegung verstehen. Im Gegensatz zu Text, der aus distinkten Buchstaben besteht, oder Bildern, die aus Pixeln bestehen, sind die physischen Handlungen eines Roboterarms kontinuierliche Datenströme. Ein Roboterarm springt nicht einfach von einer Position zur nächsten; er fließt durch eine unendliche Anzahl winziger Zwischenpositionen. Um einen Roboter mit den leistungsfähigen Sprachmodellen zu lehren, die die heutige KI antreiben, müssen Ingenieure diese fließende, kontinuierliche Bewegung zuerst in eine Serie diskreter Schritte übersetzen, ganz so, als würde man einen fließenden Fluss in eine Kette einzelner Perlen verwandelt. Dieser Übersetzungsprozess wird als Tokenisierung bezeichnet. Wenn die Übersetzung zu grob ist, verliert der Roboter die feinen Details seiner Bewegung, was zu ruckartigen, unpräzisen Aktionen führt, die bei empfindlichen Aufgaben scheitern. Wenn die Übersetzung zu komplex ist, kann der Computer sie nicht schnell genug verarbeiten, um in Echtzeit zu reagieren.
Jahrelang haben Forscher versucht, dieses Übersetzungsproblem zu lösen, aber bestehende Methoden versuchen oft, ein quadratisches Loch in ein rundes zu pressen. Einige Ansätze behandeln jede Bewegung als eine einfache Liste fester Kategorien, was die subtile zeitliche Abstimmung und die Beziehungen zwischen den Schritten ignoriert. Andere versuchen, die Daten zu komprimieren, indem sie Bewegungen zusammenfassen, aber dabei gehen sie oft die spezifischen Details verloren, die für eine präzise Steuerung erforderlich sind, wie etwa der exakte Winkel eines Handgelenks oder das sanfte Zusammendrücken eines Greifers. Dieser Detailverlust schafft einen Flaschenhals, der verhindert, dass Roboter komplexe Fähigkeiten erlernen, wie das Stapeln zerbrechlicher Objekte oder das Montieren komplizierter Teile. Das Ergebnis ist ein Roboter, der breite, einfache Aufgaben ausführen kann, aber bei den nuancierten Anforderungen der realen Welt stolpert.
Ein Team von Forschern hat nun einen neuen Weg vorgeschlagen, um dieses Übersetzungsproblem zu handhaben, der eine Methode bietet, welche die Reichhaltigkeit der Bewegung bewahrt und gleichzeitig die Daten kompakt genug hält, damit moderne KI sie verarbeiten kann. Sie nennen ihr System M2Tok, ein Werkzeug, das darauf ausgeftellen ist, den kontinuierlichen Strom von Roboteraktionen in ein Format zu zerlegen, das Sprachmodelle verstehen können, ohne die feingliedrige Dynamik zu verlieren, die für den Erfolg erforderlich ist. Anstatt den gesamten Körper des Roboters als einen einzigen, monolithischen Block von Daten zu behandeln, unterteilt ihr Ansatz die Bewegung in separate, spezialisierte Kanäle. Stellen Sie sich einen Roboterarm vor, der Schulter, Ellbogen, Handgelenk und Greifer gleichzeitig bewegen muss. Ältere Methoden würden versuchen, all diese verschiedenen Bewegungen in einen einzigen Code zu komprimieren, was das System oft dazu zwingt, sich zwischen Genauigkeit für den Arm und Genauigkeit für den Greifer zu entscheiden. Die neue Methode hingegen trennt diese Bewegungen in unterschiedliche Gruppen auf, sodass sich die KI auf die spezifischen Nuancen jedes Teils unabhängig konzentrieren kann.
Die Forscher erreichten dies, indem sie die Bewegungsdaten des Roboters in mehrere „Heads“ (Köpfe) unterteilten, wobei jeder Head für einen anderen Asenpekt der Bewegung verantwortlich ist. Ein Head könnte die Position des Arms verfolgen, während ein anderer das Öffnen und Schließen des Greifers überwacht. Entscheidend ist, dass jeder dieser Heads über sein eigenes, unabhängiges Wörterbuch für Bewegungscodes verfügt. Durch die Verwendung mehrerer paralleler Wörterbücher erschafft das System eine enorme Anzahl an möglichen Kombinationen, weit mehr, als ein einzelnes Wörterbuch jemals bieten könnte. Diese kombinatorische Kraft ermöglicht es dem System, eine viel größere Vielfalt an Bewegungen mit hoher Präzision darzustellen. Es ist vergleichbar damit, wie ein Musiker eine unendliche Anzahl von Melodien kreieren kann, indem er eine begrenzte Anzahl von Noten über verschiedene Instrumente hinweg kombiniert; das neue System kombiniert begrenzte Sätze von Bewegungscodes über die verschiedenen „Instrumente“ des Roboterkörpers, um komplexe Aktionen mit bemerkenswerter Treue zu rekonstruieren.
Um diese Idee zu testen, trainierten die Forscher ihr System auf einer großen Sammlung simulierter Roboteraufgaben, die vom Hämmern auf einen Block bis hin zum Aufheben verschiedener Flaschen und dem Platzieren von Behältern auf Tellern reichten. Sie verglichen ihre neue Methode mit mehreren bestehenden Techniken, die in diesem Bereich eingesetzt werden. Die Ergebnisse zeigten einen klaren Vorteil für den neuen Ansatz. In einer Serie von zwölf verschiedenen Simulationsaufgaben war der Roboter, der die neue Methode verwendete, in 51 Prozent seiner Versuche erfolgreich, was die nächstbeste Methode, die in nur 45 Prozent der Fälle erfolgreich war, deutlich übertraf. Die Verbesserung war bei schwierigen Aufgaben, die eine hohe Präzision erforderten, sogar noch dramatischer. Beispielsweise war die neue Methode bei einer Aufgabe, bei der eine Dose in einen Topf bewegt werden musste, fast doppelt so oft erfolgreich wie der bisher beste Ansatz. In einer anderen Aufgabe, bei der eine Burger- und Pommes-Box auf ein Tablett gelegt wurde, erreichte die neue Methode eine Erfolgsquote von 64 Prozent, während die bisher beste Methode lediglich 52 Prozent erreichte.
Die Forscher testeten das System auch in einem anderen Satz von simulierten Umgebungen, um zu sehen, ob die Fähigkeiten auf neue Situationen übertragbar sind. Hier zeigte die neue Methode erneut eine überlegene Leistung und erreichte eine Erfolgsquote von 28 Prozent im Vergleich zu 21 Prozent der führenden Alternative. Der markanteste Unterschied zeigte sich bei einer Aufgabe, die erforderte, dass der Roboter eine Aubergine aufhebt und in einen Korb legt. Die Aubergine ist ein unregelmäßig geformtes Objekt, das schwer zu greifen ist, und bisherige Methoden konnten diese Aufgabe überhaupt nicht lösen. Die neue Methode war jedoch in 33 Prozent der Fälle erfolgreich, was darauf hindeutet, dass ihre Fähigkeit, feine Details zu erfassen, es ihr ermöglichte, die komplexe Geometrie des Objekts dort zu bewältigen, wo andere versagten.
Um sicherzustellen, dass diese Ergebnisse nicht nur ein Produkt der Simulation waren, nahmen das Team ihre trainierten Modelle und testete sie an realen Robotern. Sie verwendeten eine mobile Plattform, die mit vier Roboterarmen und einer Kamera ausgestattet war, und baten die Roboter, drei verschiedene Aufgaben auszuführen: eine Glocke zu läuten, einen Behälter auf einen Teller zu stellen und verschiedene Flaschen aufzuheben. Dies waren Zero-Shot-Tests, was bedeutet, dass die Roboter diese spezifischen realen Objekte oder Umgebungen noch nie gesehen hatten; sie mussten sich rein auf das verlassen, was sie in der Simulation gelernt hatten. Die neue Methode übertraf auch hier die anderen und erreichte eine durchschnittliche Erfolgsquote von 33 Prozent über die drei Aufgaben hinweg, verglichen mit maximal 28 Prozent für die beste Alternative. Die visuellen Beweise aus diesen Tests zeigten, dass die Roboter die Positionen der Objekte erfolgreich identifizierten und präzise Greifvorgänge ausführten, was bestätigte, dass die hochwertige Übersetzung der Bewegungsdaten Bestand hatte, als die Roboter den Computer verließen und in die physische Welt eintraten.
Über die Genauigkeit hinaus untersuchten die Forscher auch, wie schnell das System laufen konnte. Damit ein Roboter nützlich ist, muss er Entscheidungen schnell genug treffen, um auf seine Umgebung zu reagieren. Die neue Methode ermöglichte es dem Roboter, mit einer Frequenz von über 8 Hertz zu arbeiten, was bedeutet, dass er mehr als acht Entscheidungen pro Sekunde treffen konnte. Dies ist eine signifikante Verbesserung gegenüber älteren Methoden, die lediglich mit 2 Hertz arbeiteten. Darüber hinaus konnte der Forscher das System durch eine spezialisierte Processing-Engine für Geschwindigkeit optimieren, wodurch der Roboter eine Frequenz von 56 Hertz erreichte, was die Geschwindigkeit, die für die meisten Echtzeit-Manipulationsaufgaben erforderlich ist, bei weitem übersteigt. Diese Kombination aus hoher Präzision und hoher Geschwindigkeit deutet darauf an, dass die neue Methode eine praktische Lösung für den Einsatz fortschrittlicher Roboter in dynamischen Umgebungen sein könnte.
Der Erfolg dieser Arbeit beruht auf einem grundlegenden Wandel in der Art und Weise, wie Bewegungsdaten verarbeitet werden. Indem sie die Vorstellung ablehnten, dass alle Bewegungen in einen einzigen, einheitlichen Code komprimiert werden müssen, ermöglichten es die Forscher dem System, die einzigartige Natur der verschiedenen Teile des Roboterkörpers zu respektieren. Die Trennung der Bewegung in unabhängige Kanäle, kombiniert mit der Verwendung mehrerer spezialisierter Wörterbücher, schuf ein System, das die subtilen, hochfrequenten Details der Bewegung erfassen konnte, die vorherige Methoden übersehen hatten. Dieser Ansatz erforderte keine Änderung der zugrunde liegenden Architektur der Sprachmodelle, die die Roboter antreiben; stattdessen bot er einen besseren Weg, die Daten in sie einzuspeisen. Das Ergebnis ist ein Roboter, der komplexe physische Aufgaben mit einem Maß an Geschicklichkeit ausführen und verstehen kann, das zuvor unerreichbar war, und damit die Lücke zwischen der digitalen Intelligenz von Sprachmodellen und der physischen Realität der Welt, die sie navigieren sollen, schließt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.