OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
Die Arbeit stellt OneTwoVLA vor, ein einheitliches Vision-Language-Action-Modell, das durch adaptives Wechseln zwischen direkter Aktionsausführung und explizitem Schlussfolgern sowie durch eine skalierbare Datenpipeline für das Co-Training überlegene Fähigkeiten in der langfristigen Aufgabenplanung, Fehlerbehebung und allgemeinen Manipulation demonstriert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
OneTwoVLA: Der Roboter, der sowohl denkt als auch handelt
Stellen Sie sich vor, Sie bereiten ein kompliziertes Gericht zu, zum Beispiel einen Cocktail oder ein Hotpot-Essen. Was tun Sie? Sie schauen sich die Zutaten an, planen die Reihenfolge („Zuerst den Sirup, dann den Saft"), führen die Handlung aus (Einschenken) und prüfen dann: „Habe ich genug eingefüllt? Ist alles noch da?" Wenn etwas schiefgeht, stoppen Sie, überlegen kurz („Oh, die Flasche ist verrutscht, ich muss sie fester halten") und passen Ihre Handlung an.
Das ist genau das, was menschliche Intelligenz ausmacht: Denken und Handeln sind keine getrennten Prozesse, sondern ein fließender Tanz.
Bisherige Roboter waren oft wie zwei getrennte Personen, die an einem Tisch sitzen:
- Der „Denker" (System 2): Ein sehr schlauer, aber langsamer KI-Experte, der Pläne macht.
- Der „Händler" (System 1): Ein schneller, aber etwas dümmerer Roboterarm, der nur ausführt, was ihm gesagt wird.
Das Problem? Der Denker versteht nicht, was der Händler wirklich kann (er plant vielleicht etwas Unmögliches), und der Händler wartet oft zu lange auf neue Anweisungen. Das führt zu Verzögerungen und Fehlern.
Die Lösung: OneTwoVLA
Die Forscher von der Tsinghua-Universität haben einen neuen Roboter namens OneTwoVLA entwickelt. Man kann sich ihn wie einen Schachgroßmeister vorstellen, der gleichzeitig die Figuren bewegt.
Er ist ein einheitliches Gehirn, das zwei Modi hat und zwischen ihnen hin- und herschaltet, je nachdem, was gerade passiert:
- Der „Reflex-Modus" (Handeln): Wenn alles glatt läuft (z. B. „Glas greifen und heben"), denkt der Roboter nicht lange nach. Er handelt schnell und effizient, wie ein erfahrener Koch, der automatisch schneidet.
- Der „Denk-Modus" (Überlegen): An kritischen Punkten – wenn ein Schritt abgeschlossen ist, wenn etwas schiefgeht oder wenn ein Mensch etwas Neues sagt – schaltet er automatisch in den Denk-Modus. Er sagt sich dann: „Moment mal, ich habe gerade den Sirup eingefüllt. Was kommt als Nächstes? Ach ja, Orangensaft. Aber Moment, die Flasche ist verrutscht! Ich muss sie neu greifen."
Wie lernt dieser Roboter so gut zu denken?
Ein Roboter lernt normalerweise nur durch Nachahmen von Bewegungen (wie ein Kind, das nur zuschaut, wie man einen Ball wirft). OneTwoVLA lernt aber auch, wie man über das Werfen nachdenkt.
Die Forscher haben eine clevere Methode entwickelt, um dem Roboter beizubringen, nicht nur zu tun, sondern auch zu verstehen:
- Sie haben eine Art „Schulbuch für Roboter" erstellt.
- Statt nur Videos von Bewegungen zu zeigen, haben sie mit Hilfe von KI tausende von Szenarien simuliert (z. B. Tische mit verschiedenen Gegenständen).
- Für diese Szenarien haben sie nicht nur die Bewegung, sondern auch den Gedankengang generiert: „Ich sehe eine rote Tasse links und eine blaue rechts. Der Befehl lautet: 'Hole die Tasse für Tee'. Also muss ich die blaue Tasse nehmen."
- Der Roboter wurde dann mit echten Roboterdaten und diesen simulierten „Denk-Übungen" trainiert.
Was kann OneTwoVLA besonders gut?
- Langfristige Pläne: Er kann komplexe Aufgaben wie „Mach mir einen Vodka Sunrise" oder „Koche ein Hotpot" bewältigen. Er behält den Überblick, auch wenn er schon fünf Schritte gemacht hat.
- Fehlerkorrektur: Wenn er eine Flasche fallen lässt, merkt er das sofort, denkt nach („Ich muss fester greifen") und versucht es erneut, anstatt einfach weiterzumachen und die Aufgabe zu vermasseln.
- Natürliche Gespräche: Wenn Sie ihm mitten in der Aufgabe sagen: „Nimm lieber Zitronen-Vodka statt Orangen-Vodka", versteht er das sofort, passt seinen Plan an und macht weiter. Andere Roboter würden hier oft stecken bleiben.
- Verstehen von Sprache: Er versteht nicht nur „Hole das rote Ding", sondern auch „Hole das Ding, das man für Computerarbeiten braucht" (eine Maus) oder „Hole das Objekt, das wie ein kleiner Hut aussieht".
Fazit
OneTwoVLA ist wie ein Roboter, der endlich gelernt hat, nicht nur zu gehorchen, sondern mitzudenken. Er ist schnell, wenn es sein muss, und hält inne, wenn er nachdenken muss. Durch diese Kombination aus schnellem Handeln und klugem Überlegen wird er zu einem viel besseren Helfer im echten Leben, der komplexe Aufgaben wie das Kochen eines Essens oder das Mischen von Getränken meistern kann – und das sogar dann, wenn die Situation sich ändert oder etwas schiefgeht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.