← Neueste Arbeiten
💻 computer science

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA ist eine Vision-Language-Action-Policy mit 1,2 Milliarden Parametern, die durch das Verketten aufeinanderfolgender Abfragen über einen einheitlichen, revidierbaren Ausführungszustand, der rekurrentes Arbeitsgedächtnis für den Aufgabenfortschritt und Motion Tailing für die kontinuierliche Aktionsgenerierung kombiniert, eine überlegene Langzeit-Manipulationsleistung erzielt.

Ursprüngliche Autoren: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

Veröffentlicht 2026-08-04
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, Ihr unordentliches Zimmer aufzuräumen. Sie geben ihm einen einfachen Befehl: „Räum das Spielzeug weg.“ Ein Roboter, der in winzigen, isolierten Schritten denkt, würde vielleicht auf den Boden schauen, einen roten Block aufheben und ihn in eine Kiste legen. Dann hält er inne. Er vergisst, dass er gerade den Block aufgehoben hat. Er schaut wieder auf den Boden, sieht einen blauen Block und hebt diesen auf. Aber was wäre, wenn der rote Block eigentlich unter dem blauen liegen sollte? Oder was, wenn der Roboter sich merken müsste, dass er die linke Seite des Zimmers bereits aufgeräumt hat, damit er nicht wieder dorthin geht? Dies ist die Herausforderung der „Long-Horizon Manipulation“ (langfristige Manipulation). Es geht nicht nur darum, einen Arm zu bewegen; es geht darum, eine laufende Geschichte im Kopf zu behalten, während die Hände beschäftigt sind.

In der Welt der Robotik verwenden Wissenschaftler etwas, das man „Vision-Language-Action“ (VLA)-Policies nennt. Betrachten Sie diese als das Gehirn des Roboters, das durch die Kamera sieht (Vision), Ihre Anweisungen liest (Language) und entscheidet, was zu tun ist (Action). Normalerweise arbeiten diese Gehirne in kurzen Intervallen. Sie erstellen einen Plan für die nächsten Sekunden, führen diese Bewegungen aus und hören dann sofort auf, um einen neuen Plan von Grund auf zu erstellen. Es ist, als würde man versuchen, einen Roman zu schreiben, indem man einen Satz schreibt, das Gedächtnis an den vorherigen Satz löscht und dann versucht, den nächsten Satz allein basierend auf der aktuellen Seite zu erraten. Das Problem ist, dass der Roboter oft den Faden der Geschichte verliert. Er vergisst, was er gerade erreicht hat, oder wird verwirrt, weil sein neuer Plan mit der Bewegung kollidiert, die er gerade ausführte. Diese Arbeit fragt: Wie können wir einen Roboter erschaffen, der sich an seine Geschichte erinnert und seine Bewegungen flüssig hält, während er gleichzeitig in Echtzeit die Welt betrachtet?


Der Roboter mit Gedächtnis und Schwung

Lernen Sie ChainVLA kennen. Es ist eine neue Art von Robotergehirn, das von Forschern entwickelt wurde, um das Problem des „vergesslichen Roboters“ zu lösen. Stellen Sie sich vor, Sie fahren mit dem Fahrrad einen gewundenen Pfad hinunter. Um aufrecht zu bleiben, benötigen Sie zwei Dinge: Sie müssen sich erinnern, wo Sie waren (Sind Sie gerade nach links abgebogen? Kommt ein Hügel?) und Sie müssen kontinuierlich in die Pedale treten, damit Sie nicht schwanken und stürzen. ChainVLA wurde gebaut, um genau das für Roboterarme zu tun.

Die meisten Robotergehirne von heute arbeiten wie ein Mensch, der ein Foto macht, eine Entscheidung trifft, das Foto weglegt, ein neues Foto macht und eine neue Entscheidung trifft. Sie tragen das „Gefühl“ der vorherigen Entscheidung nicht in die nächste hinein. ChainVLA ändert das Spiel, indem es diese Entscheidungen aneinanderreiht. Es erstellt einen speziellen „Execution State“ (Ausführungszustand), der wie ein Rucksack fungiert, den der Roboter trägt. Dieser Rucksack hat zwei sehr wichtige Fächer:

  1. Das „Story“-Fach (Progress Context): Dieses hält das Gedächtnis darüber, was der Roboter bereits erreicht hat. Es ist wie eine mentale Checkliste. Wenn der Roboter gerade einen Block nach links bewegt hat, merkt sich dieses Fach: „Okay, die linke Seite ist frei.“ Es kombiniert ein schnelles Arbeitsgedächtnis (was gerade passiert) mit einem spärlichen Langzeitgedächtnis (wichtige Ereignisse, die vor einer Weile stattgefunden haben, wie „Ich habe zuerst den roten Block bewegt“). Dies hilft dem Roboter zu wissen, wo er sich im großen Bild der Aufgabe befindet.
  2. Das „Momentum“-Fach (Motion Tail): Das ist der coole Teil. Wenn der Roboter beschließt, sich zu bewegen, sagt er nicht einfach nur „bewege dich vorwärts“. Er sagt eine ganze Sequenz von Bewegungen für die nächsten Sekunden voraus. Aber er führt nur die ersten paar Bewegungen tatsächlich aus, bevor er stoppt, um wieder nachzudenken. Der „Motion Tail“ ist der Teil dieser Vorhersage, der noch nicht ausgeführt wurde. ChainVLA speichert diesen unvollendeten Plan und speist ihn für den nächsten Schritt wieder in das Gehirn des Roboters ein. Es ist wie ein Läufer, der, selbst nachdem er kurz anhält, um die Schuhe zu binden, sich genau erinnert, wie schnell er gelaufen ist und in welche Richtung, damit er nicht bei Null anfangen muss.

Wie es in der Praxis funktioniert

Die Forscher haben diese Idee bei einigen schwierigen Aufgaben getestet. Eine der schwierigsten war die Aufgabe „Put Back Block“ (Block zurücklegen). Stellen Sie sich vor, ein Roboter muss einen Block an eine Stelle bewegen, dann ein anderes Objekt bewegen und schließlich den Block wieder auf den ursprünglichen Platz legen. Das Problem? Bis der Roboter bereit ist, den Block zurückzulegen, könnte der ursprüngliche Platz durch das neue Objekt von der Kamera verdeckt sein. Ein normaler Roboter würde in die Kamera schauen, nichts sehen und verwirrt sein. Er würde vergessen, wo der Platz war.

ChainVLA hingegen nutzt sein „Story“-Fach, um sich zu erinnern: „Hey, ich habe diesen Block vorhin dort platziert, auch wenn ich ihn jetzt nicht sehen kann.“ Gleichzeitig stellt das „Momentum“-Fach sicher, dass der Roboterarm beim Zurücklegen nicht ruckartig in eine seltsame, neue Richtung springt, die im Widerspruch dazu steht, wohin der Arm gerade zeigte.

Die Ergebnisse waren ziemlich dramatisch. In einem schwierigen Test namens RMBench war ChainVLA in 62,8 % der Fälle erfolgreich. Vergleichen Sie das mit anderen intelligenten Robotern:

  • Wenn man die „Story“ (Progress Context) entfernt, stürzt die Erfolgsquote auf 3,0 % ab. Der Roboter vergisst die Aufgabe komplett.
  • Wenn man das „Momentum“ (Motion Tail) entfernt, sinkt die Erfolgsquote auf 11,2 %. Der Roboter erinnert sich zwar an die Aufgabe, bewegt sich aber so ungeschickt, dass er scheitert.

Dies zeigt, dass beide Teile essenziell sind. Die „Story“ sagt dem Roboter, was er tun soll, und das „Momentum“ hilft ihm, dies flüssig zu tun, ohne über seine eigenen Füße zu stolpern.

Warum es wichtig ist

Die Arbeit legt nahe, dass das Lebendighalten der „unvollendeten Bewegung“ tatsächlich entscheidend dafür ist, sich an die Aufgabe zu erinnern. Es ist ein wenig wie ein Tanz: Wenn man zwischen den Schritten komplett aufhört zu tanzen, vergisst man vielleicht den Rhythmus. Aber wenn man den Rhythmus beibehält (der Motion Tail), kann das Gehirn die Choreografie (der Progress Context) besser behalten.

Als die Forscher versuchten, die Ungeschicklichkeit des Roboters zu beheben, indem sie lediglich die Bewegungen glätteten, nachdem der Roboter bereits entschieden hatte, was zu tun ist (ein gängiger Trick bei anderen Robotern), funktionierte es nicht. Der Roboter scheiterte trotzdem. Dies beweist, dass das Geheimnis nicht nur darin besteht, die Bewegungen schön aussehen zu lassen, sondern darin, die Idee der nächsten Bewegung in das Gehirn des Roboters einzuspeisen, bevor er eine neue Entscheidung trifft.

Kurz gesagt: ChainVLA legt nahe, dass Roboter, um langfristige, komplizierte Aufgaben bewältigen zu können, weniger wie eine Kamera sein sollten, die Schnappschüsse macht, sondern eher wie ein Geschichtenerzähler, der niemals den Platz im Buch verliert, während er gleichzeitig die Füße zum Takt der Musik bewegt. Dies ist ein kleiner Schritt in Richtung Roboter, die uns tatsächlich bei den unordentlichen, mehrstufigen Aufgaben des echten Lebens helfen können, ohne verwirrt zu werden oder alles fallen zu lassen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →