← Neueste Arbeiten
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

Dieses Paper stellt **In-Context VLA** vor, ein Framework, das Vision-Language-Action-Modelle dadurch verbessert, dass es die freiformatige Chain-of-Thought-Generierung durch In-Context-Post-Training auf strukturierten perzeptuellen Evidenzen und agentischem Werkzeuggebrauch ersetzt und somit eine fundierte Sprachverarbeitung für eine überlegene Low-Level-Steuerung sowie Bestleistungen in Simulations- und realen Manipulationsaufgaben ermöglicht.

Ursprüngliche Autoren: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Veröffentlicht 2026-08-07
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, Hausarbeiten zu erledigen, wie zum Beispiel ein Sandwich zuzubereiten oder ein unordentliches Zimmer aufzuräumen. Lange Zeit haben Wissenschaftler versucht, diese Maschinen zu lehren, indem sie ihnen Videos von Menschen zeigten, die die Aufgabe erledigen, und dem Roboter sagten: „Kopiere exakt das, was du siehst.“ Das funktioniert ganz gut für einfache Aufgaben, aber es ist, als würde man versuchen, eine neue Sprache zu lernen, indem man nur einen einzigen, starren Satz auswendig lernt. Wenn man den Roboter bittet, „den roten Becher aufzuheben“, dann aber sagt: „Greif nach der purpurroten Tasse“, könnte der Roboter verwirrt sein, weil er nie gelernt hat, die Bedeutung hinter den Worten zu verstehen, sondern nur, die spezifischen Klänge zu matchen, die er während des Trainings gehört hat.

Um dies zu beheben, versuchten Forscher kürzlich, Robotern einen „Denk“-Schritt zu geben, ähnlich wie Menschen mit sich selbst sprechen, bevor sie handeln. Sie hofften, dass der Roboter zuerst einen Plan aufschreibt wie: „Okay, der Becher steht auf dem Tisch, und ich muss meine Hand nach links bewegen“, und dann handelt. Dies wird als „Chain-of-Thought“ bezeichnet. Aber hier ist die Wendung: Für Roboter macht zu viel Reden vor der Bewegung sie eigentlich schlechter in ihrer Arbeit. Es ist, als würde man versuchen, ein Auto zu fahren, während man einen Roman über die Straße schreibt; bis man seinen Satz beendet hat, hat man die Abzweigung bereits verpasst. Der Roboter bleibt in einer Schleife stecken, in der er seine eigenen Gedanken kommentiert, anstatt tatsächlich das Objekt zu greifen, und er erfindet oft Fakten darüber, wo sich Dinge befinden, weil er rät, anstatt hinzusehen.

Dieses Paper stellt eine neue Art vor, Roboter zu lehren, die sich VLA-Talker nennt. Anstatt den Roboter zu zwingen, seine eigenen Gedanken aufzuschreiben, geben die Forscher dem Roboter einen „intelligenten Assistenten“, der das Hinsehen und Berichten für ihn übernimmt. Denken Sie an einen Roboter mit einer superpowered Brille und einem hilfreichen Co-Piloten. Wenn der Roboter wissen muss, wo ein Löffel ist, rät er nicht oder schreibt einen Absatz darüber. Stattdessen fragt er seinen Co-Piloten (der spezielle Werkzeuge wie Tiefenkameras und Objekterkennung nutzt) sofort, welcher ihm sagt: „Der Löffel ist 42 Pixel rechts und etwas tiefer als deine Hand.“ Der Roboter liest dann diesen klaren, faktischen Bericht und handelt sofort.

Die Forscher fanden heraus, dass diese Methode ein Game-Changer ist. Indem sie den Roboter dazu bringen, klare, fundierte Sprache von seinen Werkzeugen zu konsumieren, anstatt seine eigene verwirrende Plauderei zu generieren, wird der Roboter viel schneller und genauer. In ihren Tests war dieser Ansatz nicht nur besser, sondern er war fast 4,6 Mal schneller als die alten „Denk“-Methoden, weil der Roboter keine Zeit damit verschwendete, Aufsätze zu schreiben, bevor er sich bewegte. Sie testeten dies in komplexen Computersimulationen und sogar an einem echten, menschenähnlichen Roboter, und er löste konsistent Aufgaben, mit denen andere Roboter zu kämpfen hatten, was bewies, dass es manchmal die beste Art zu denken ist, jemand anderem zuzuhören, der die Fakten kennt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →