← Neueste Arbeiten
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA ist ein Vision-Language-Action-Modell mit weniger als einer Milliarde Parametern, das durch die Nutzung strukturierter Aufsichtstechniken – einschließlich dualer zeitlicher Eingaben, hierarchischer Chain-of-Thought-Destillation und Paraphrasierung-Augmentierung – anstelle einer Erhöhung der Modellgröße eine führende Robustheit auf dem LIBERO-Plus-Benchmark erreicht.

Ursprüngliche Autoren: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Veröffentlicht 2026-07-29
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Roboter nicht nur willenlose Maschinen sind, die einem starren Code folgen, sondern hilfreiche Begleiter, die unsere gesprochenen Worte verstehen und in der Lage sind, ihre eigenen Arme zu bewegen, um Aufgaben zu erledigen. Dies ist der Traum der „Embodied AI“ (verkörperte KI) – ein Bereich, in dem Computer lernen, die Welt durch Kameras zu sehen, menschliche Sprache zu verstehen und diese beiden Dinge in physische Handlungen zu übersetzen. Lange Zeit benötigten die klügsten Roboter riesige Gehirne – Computermodelle mit Milliarden von „Neuronen“ –, um dies zu bewältigen. Diese gigantischen Modelle waren wie Supercomputer, die riesige, teure Server zum Ausführen benötigten, was es unmöglich machte, sie in einen kleinen Roboter einzubauen, der durch ein Haus rollen oder in einer Küche helfen könnte. Die große Frage, die sich Forscher gestellt haben, lautete: Können wir einen Roboter bauen, der genauso intelligent und zuverlässig ist, aber klein genug, um in einen Rucksack zu passen?

Dieses Paper stellt ein neues Robotergehirn namens CoTinyVLA vor. Betrachten Sie es als ein winziges, supereffizientes Robotergehirn, das es schafft, die massiven, schweren Modelle, die derzeit führend auf diesem Gebiet sind, zu übertreffen, und das dabei nur einen Bruchteil des Speichers nutzt. Die Forscher haben das Gehirn nicht einfach nur geschrumpft; sie haben ihm eine bessere Art des Denkens beigebracht. Anstatt zu versuchen, jede mögliche Situation auswendig zu lernen, gaben sie dem Roboter einen „Spickzettel“ für das logische Denken. Sie lehrten ihn, eine große Aufgabe in einen einfachen Plan (wie eine To-Do-Liste) zu unterteilen und dann über jeden kleinen Schritt nachzudenken, bevor er handelt. Sie gaben ihm auch ein spezielles Paar Augen – eines, das aus der Ferne schaut, um den ganzen Raum zu sehen, und eines an seinem Handgelenk, um genau zu sehen, was seine Hand berührt – und brachten ihm bei, ein kurzes Video der letzten Sekunden zu beobachten, um Bewegungen zu verstehen. Das Ergebnis ist ein Robotermodell mit nur 0,9 Milliarden Parametern (winzig im Vergleich zu den 7-Milliarden-Parameter-Giganten), das komplizierte, chaotische Situationen in der realen Welt besser bewältigen kann als Modelle, die achtmal so groß sind.

Das Problem: Große Gehirne, kleine Roboter

Seit Jahren sind die besten Roboter für das Befolgen von Anweisungen wie riesige, schwere Panzer. Um einen Befehl wie „Hebe die blaue Tasse auf und stelle sie auf den Tisch“ zu verstehen, nutzen diese Roboter massive Computermodelle mit 3 bis 7 Milliarden Parametern. Obwohl diese Modelle unglaublich intelligent sind, sind sie auch riesig. Sie benötigen etwa 20 Gigabyte Computerspeicher allein für den Betrieb. Das ist so, als würde man versuchen, eine ganze Bibliothek in einen Rucksack zu packen; es passt einfach nicht auf die kleinen, batteriebetriebenen Computer, die in mobilen Robotern oder Assistenzgeräten zu finden sind.

Die Forscher wollten wissen: Brauchen wir wirklich ein so riesiges Gehirn, um intelligent zu sein? Oder können wir einen winzigen, effizienten Roboter bauen, der genauso gut darin ist, mit dem unerwarteten Chaos der realen Welt umzugehen?

Die Lösung: Ein winziges Gehirn mit einer großen Strategie

Das Team baute CoTinyVLA, ein Robotergehirn mit nur 0,9 Milliarden Parametern. Um dieses winzige Modell so stark wie die Giganten zu machen, haben sie es nicht nur mit mehr Daten gefüttert; sie änderten die Art und Weise, wie es lernte und worauf es seine Aufmerksamkeit richtete. Sie nutzten drei Haupttricks, die sie „strukturierte Supervision“ nennen, um den Roboter besser denken zu lehren.

1. Das „Zwei-Augen“-Zeitreise-Prinell
Stellen Sie sich vor, Sie versuchen, einen Ball zu fangen. Wenn Sie nur ein Bild des Balls sehen, wissen Sie nicht, ob er auf Sie zukommt oder sich von Ihnen entfernt. Sie müssen ein kurzes Video sehen, um die Bewegung zu verstehen.
CoTinyVLA wird beigebracht, die Welt gleichzeitig durch zwei verschiedene „Augen“ zu betrachten:

  • Das Beobachter-Auge (Third-Person Eye): Eine Kamera, die den ganzen Raum betrachtet, um zu sehen, wo sich alles befindet.
  • Das Handgelenk-Auge (Wrist Eye): Eine Kamera an der Hand des Roboters, um genau zu sehen, was der Greifer berührt.
    Anstatt nur den aktuellen Moment zu betrachten, sieht der Roboter einen kurzen „Film“ der letzten 16 Frames (8 von jedem Auge). Dies gibt ihm ein Gefühl für Zeit und Bewegung und hilft ihm zu verstehen, wie schnell sich Dinge bewegen und wohin sie gehen.

2. Der „Plan und Denken“-Spickzettel
Dies ist der wichtigste Trick. Bevor der Roboter sich bewegt, wird er gelehrt, eine Geschichte zu schreiben.

  • Der Plan: Zu Beginn einer Aufgabe schreibt der Robot eine übergeordnete „To-Do-Liste“ (z. B. „Zuerst greife die Tasse. Zweitens hebe sie an. Drittens stelle sie auf den Tisch“). Dieser Plan bleibt für die gesamte Aufgabe gleich.
  • Das Denken: Vor jeder kleinen Bewegung schreibt der Roboter eine kurze Notiz darüber, was er gerade tut (z. B. „Ich schließe meinen Greifer“ oder „Ich hebe die Tasse an“).
    Der Roboter lernt dies, indem er einem viel größeren, intelligenteren Roboter (einem 35-Milliarden-Parameter-„Lehrer“) dabei zusieht, wie dieser dieselben Aufgaben löst. Der winzige Roboter kopiert den Denkprozess des Lehrers. Dies hilft dem winzigen Roboter zu verstehen, warum er etwas tut, und nicht nur, was er tun soll.

3. Das „Paraphrasieren“-Spiel
Roboter werden oft verwirrt, wenn man dasselbe auf eine andere Weise sagt. Wenn ein Roboter nur auf den Satz „Hebe die Tasse auf“ trainiert wurde, könnte er stecken bleiben, wenn man sagt „Greif den Becher“.
Um dies zu beheben, haben die Forscher den Roboter mit 40 Basis-Anweisungen trainiert und diese in 800 verschiedene Versionen erweitert. Sie tauschten Wörter aus (wie „greifen“ gegen „nehmen“ oder „anheben“), änderten die Beschreibungen der Objekte (wie „schwarze Schale“ zu „dunkle Schale“) und fügten sogar höfliche Phrasen hinzu (wie „Könntest du bitte...“). Dies lehrte den Roboter, die Bedeutung des Befehls zu verstehen, nicht nur die spezifischen Wörter.

Die Ergebnisse: Winzig gewinnt groß

Die Forscher testeten CoTinyVLA auf LIBERO-Plus, einer anspruchsvollen Testsuite, die darauf ausgelegt ist, zu prüfen, wie gut Roboter mit Veränderungen in der Welt umgehen. Der Test umfasst über 10.000 verschiedene Szenarien, in denen Dinge durcheinander sind: Der Roboter startet in einer seltsamen Position, das Licht ändert sich, der Hintergrund ist anders oder die Anweisungen sind seltsam formuliert.

Die Ergebnisse waren überraschend. CoTinyVLA, mit seinen winzigen 0,9 Milliarden Parametern, schlug die stärksten 7-Milliarden-Parameter-Modelle in allen vier Hauptkategorien:

  • Spatial (Räumlich): 90,8 % Erfolgsquote (übertrifft die großen Modelle um 4,7 Punkte).
  • Object (Objekt): 87,3 % Erfolgsquote (übertrifft die großen Modelle um 2,8 Punkte).
  • Goal (Ziel): 86,6 % Erfolgsquote (übertrifft die großen Modelle um gewaltige 15,9 Punkte).
  • Long (Langfristig): 80,7 % Erfolgsquote (übertrifft die großen Modelle um 3,0 Punkte).

Der größte Sieg war in der Kategorie „Goal“, in der der winzige Roboter fast 16 Punkte besser war als der beste riesige Roboter. Dies ist besonders beeindruckend, da der winzige Roboter auf einem Computer läuft, der nur 2,25 GiB Speicher benötigt, was klein genug ist, um auf vielen realen Robotern Platz zu finden.

Warum es wichtig ist

Das Paper zeigt, dass man kein massives Gehirn braucht, um ein intelligenter Roboter zu sein. Indem man einem kleinen Roboter beibringt, auf eine strukturierte Weise zu „denken“ (Pläne zu erstellen und seine Schritte zu überprüfen) und ihm die richtige Art von visueller und sprachlicher Ausbildung gibt, kann er mit der chaotischen, unvorhersehbaren realen Welt besser umgehen als viel größere Modelle.

Die Forscher fanden auch heraus, dass der „Plan“-Teil des Denkprozesses entscheidend ist. Wenn man dem Roboter die Fähigkeit nimmt, einen Plan zu schreiben, sinkt seine Erfolgsquote um 40 bis 45 Punkte. Dies beweist, dass der Roboter nicht nur rät, sondern tatsächlich den Plan nutzt, um seine Handlungen zu leiten.

Kurz gesagt: CoTinyVLA beweist, dass mit den richtigen Lehrmethoden ein kleiner, effizienter Roboter genauso fähig sein kann wie ein riesiger Supercomputer, was uns einen Schritt näher zu hilfreichen, intelligenten Robotern in unseren Häusern und Arbeitsplätzen bringt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →