← Neueste Arbeiten
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

Das Papier schlägt CAST vor, eine Methode, die Vision-Language-Modelle nutzt, um kontrafaktische Labels zur Augmentierung von Roboter-Datensätzen zu generieren, wodurch die Befolgung von Instruktionen durch Vision-Language-Action-Modelle signifikant verbessert wird, ohne dass zusätzliche Datenerhebung erforderlich ist.

Ursprüngliche Autoren: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Veröffentlicht 2026-06-10
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, wie er sich in einem Haus bewegt oder Gegenstände aufhebt. Sie zeigen ihm ein Video eines Roboters, der einen Flur entlangläuft und nach rechts abbiegt. Sie sagen dem Roboter: „So sieht ‚geradeaus gehen‘ aus.“

Das Problem ist, dass der Roboter ein etwas fauler Schüler ist. Er bemerkt, dass der Roboter im Video jedes Mal nach rechts abbiegt, wenn er einen Flur sieht. Also lernt er eine Abkürzung: „Wenn ich einen Flur sehe, biege ich rechts ab.“ Er hört auf, auf Ihre spezifischen Anweisungen zu achten (wie „biege links am blauen Tisch ab“), weil er glaubt, dass das Bild des Flurs ihm bereits alles sagt, was er wissen muss. In den technischen Begriffen der Arbeit wird dies als „Posterior Collapse“ bezeichnet – der Roboter ignoriert Ihre Stimme und rät stattdessen einfach basierend auf dem, was er sieht.

Die CAST-Lösung: Das „Was wäre wenn?“-Spiel

Die Autoren dieser Arbeit, von der UC Berkeley und Princeton, haben einen cleveren Trick erfunden, um dies zu beheben. Sie nennen ihn CAST (Counterfactual Labels Improve Instruction Following).

Stellen Sie sich CAST wie einen kreativen Schreibcoach für Roboter vor. Anstatt dem Roboter nur den einen Pfad zu zeigen, den er tatsächlich genommen hat, lässt der Coach den Roboter ein „Was wäre wenn?“-Spiel spielen.

So funktioniert es, Schritt für Schritt:

  1. Die ursprüngliche Szene: Der Roboter hat ein Video von sich selbst, wie er einen Flur entlangläuft.
  2. Die „Was wäre wenn?“-Frage: Die Forscher nutzen eine superintelligente KI (ein Vision-Language-Modell), um denselben Flur zu betrachten und zu fragen: „Hey, was hätte der Roboter hier sonst noch tun können?“
    • Original: „Gehe geradeaus.“
    • Kontrafaktisch (Was wäre wenn): „Biege rechts am orangefarbenen Tisch ab“ oder „Bewege dich entlang der Wand auf der linken Seite.“
  3. Den Pfad erfinden: Die KI erfindet nicht nur einen Satz; sie erfindet auch einen fiktiven Videopfad, der zu diesem neuen Satz passt. Sie stellt sich vor: „Okay, wenn der Roboter rechts am orangefarbenen Tisch abbiegt, wie würden die nächsten paar Sekunden aussehen?“
  4. Die neue Lektion: Nun hat der Roboter zwei Lektionen für denselben Flur:
    • Lektion A: „Gehe geradeaus“ (das echte Video).
    • Lektion B: „Biege rechts am orangefarbenen Tisch ab“ (das erfundene Video).

Warum das alles verändert

Vor diesem Trick sah der Roboter einen Flur und dachte: „Das kenne ich! Ich biege rechts ab!“ Er brauchte Ihren Worten nicht zuzuhören.

Nach dem CAST-Trick sieht der Roboter denselben Flur, aber erkennt: „Warte, manchmal gehe ich geradeaus und manchmal biege ich rechts am orangefarbenen Tisch ab. Das Bild allein sagt mir nicht, was ich tun soll. Ich muss den spezifischen Worten zuhören, die du mir gibst, um zu wissen, welchen Pfad ich nehmen soll.“

Die Ergebnisse

Die Forscher testeten dies an zwei Arten von Robotern:

  • Navigationsroboter: Roboter, die sich im Innenbereich und im Freien bewegen.
  • Manipulationsroboter: Roboterarme, die Dinge wie Brokkoli oder Löffel aufheben.

Sie fanden heraus, dass die Roboter durch die Verwendung dieser „Was wäre wenn?“-Daten (ohne neue reale Videos sammeln zu müssen) viel besser darin wurden, Anweisungen zu befolgen.

  • In der Navigation verdoppelte sich die Erfolgsquote im Vergleich zu Robotern, die ohne diesen Trick trainiert wurden.
  • Bei Manipulationsaufgaben (wie dem Aufheben von Gegenständen, wenn ablenkende Objekte in der Nähe sind) verbesserten sie sich um 27 %.

Das Fazit

CAST ist wie das Geben einer Bibliothek von „alternativen Realitäten“ an einen Roboter. Indem man dem Roboter zeigt, dass dieselbe Szene je nach Anweisung zu vielen verschiedenen Ergebnissen führen kann, zwingt man ihn, aufzuhören zu raten und stattdessen zuzuhören. Es verwandelt einen Roboter, der nur „sieht und rät“, in einen Roboter, der wirklich „zuhört und handelt“.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →