← Neueste Arbeiten
💻 computer science

VLAs are Confined yet Capable of Generalizing to Novel Instructions

Dieser Artikel zeigt, dass Vision-Language-Action-Modelle (VLAs) ihre Schwierigkeiten bei der Aufgabenextrapolation und dem räumlichen Overfitting überwinden können, indem sie interne Textlatente durch Interpolation manipulieren, eine Technik, die auf neuen Instruktions-Benchmarks eine Erfolgsrate von 83 % erzielt und das Potenzial für versteckte, für Menschen nicht lesbare Prompt-Injektionen aufdeckt.

Ursprüngliche Autoren: Quanyi Li

Veröffentlicht 2026-05-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Quanyi Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen Roboter-Koch beim Kochen. Sie zeigen ihm zwei spezifische Rezepte:

  1. Rezept A: „Legen Sie den Frischkäse in die Schüssel."
  2. Rezept B: „Stellen Sie die Schüssel auf den Schrank."

Der Roboter lernt diese beiden Bewegungen perfekt. Er kann Rezept A ausführen und er kann Rezept B ausführen. Aber dann stellen Sie ihm eine neue Frage: „Legen Sie den Frischkäse auf den Schrank."

Logischerweise sollte der Roboter dies tun können. Er weiß, wie man den Käse greift, und er weiß, wie man zum Schrank gelangt. Er muss lediglich die beiden Fähigkeiten, die er bereits besitzt, kombinieren. Doch laut diesem Papier scheitern die meisten fortschrittlichen Roboterhirne (sogenannte Vision-Language-Action-Modelle oder VLAs) kläglich daran. Sie bleiben stecken und verhalten sich so, als hätten sie den Schrank oder den Käse noch nie gesehen, obwohl sie sie gerade in den vorherigen Schritten verwendet haben.

Das Problem: Der Roboter ist ein „Papagei", kein „Koch"

Die Autoren entdeckten, dass diese Roboter die Welt nicht wirklich verstehen. Stattdessen merken sie sich spezifische Szenen.

Stellen Sie sich einen Schüler vor, der die Antworten auf einen Übungstest auswendig gelernt hat, aber die Mathematik nicht versteht. Wenn Sie fragen: „Was ist 2 + 2?", sagen sie „4". Aber wenn Sie fragen: „Was ist 2 + 2, wenn die Zahlen in roter Tinte geschrieben sind?", geraten sie vielleicht in Panik.

Im Fall des Roboters hat er gelernt, dass „Frischkäse" immer mit dem spezifischen Ort auf dem Tisch verbunden ist, an dem er den Frischkäse während des Trainings gesehen hat. Er versteht nicht, dass „Frischkäse" ein Objekt ist, das sich bewegen kann; er denkt, „Frischkäse" ist dieser spezifische Ort. Das Papier nennt dies „räumliches Overfitting". Der Roboter ist so sehr darauf fokussiert, wo die Dinge in den Trainingsvideos waren, dass er ignoriert, wo sie sich im echten Moment tatsächlich befinden.

Die Lösung: Die „magische Rezeptkarte" (Text Latent)

Die Forscher wollten wissen: Ist der Roboter tief im Inneren wirklich intelligent oder ist er einfach nur defekt?

Sie fanden eine versteckte „Zutat" im Gehirn des Roboters, die Text Latent genannt wird.

  • Die Analogie: Stellen Sie sich das Gehirn des Roboters als eine riesige Bibliothek vor. Wenn Sie ihm einen Befehl geben wie „Legen Sie den Käse in die Schüssel", zieht der Roboter eine bestimmte, unsichtbare „Rezeptkarte" aus seinem internen Gedächtnis hervor. Diese Karte ist nicht in Wörtern geschrieben, die Sie lesen können; sie ist ein komplexes Muster elektrischer Signale (ein Vektor), das dem Roboter genau sagt, wie er sich bewegen muss.
  • Die Entdeckung: Die Forscher stellten fest, dass der Roboter diese Aktion perfekt ausführen würde, wenn sie diese unsichtbare „Rezeptkarte" für „Dinge in eine Schüssel legen" wieder in das Gehirn des Roboters injizierten – selbst wenn Sie ihm überhaupt keine Worte gaben. Die Karte war die Anweisung.

Der Durchbruch: Das Mischen der Karten (Text Latent Interpolation)

Das wahre Wunder geschah, als sie versuchten, das Problem „Frischkäse auf dem Schrank" zu lösen.

Sie nahmen die unsichtbare „Rezeptkarte" für Aufgabe A (Käse zur Schüssel) und die Karte für Aufgabe B (Schüssel zum Schrank). Dann erstellten sie eine glatte Mischung der beiden Karten.

  • Die Analogie: Stellen Sie sich vor, Sie haben zwei Musikstücke, die spielen. Das eine ist ein Jazz-Song, das andere ein Rock-Song. Anstatt abrupt von einem zum anderen zu wechseln, verwenden Sie einen Mixer, um den Jazz langsam auszublenden, während Sie den Rock einblenden.
  • Das Ergebnis: Indem sie diese beiden unsichtbaren Rezeptkarten im Gehirn des Roboters „mischten", kombinierte der Roboter die Fähigkeiten erfolgreich. Er griff den Käse, bewegte ihn zum Schrank und ließ ihn fallen.

Die Statistiken:

  • Ohne diesen Trick gelang es dem Roboter (namens π0) nur in 9 % der Fälle, diese neuen, kombinierten Aufgaben zu lösen.
  • Mit dem „Misch"-Trick stieg der Erfolg auf 83 %.

Dies bewies, dass der Roboter die Fähigkeiten die ganze Zeit über in sich hatte; er konnte nur nicht selbst herausfinden, wie man sie mischt. Die „Rezeptkarten" waren da, aber der Roboter brauchte einen Menschen, der ihnen half, sie zu vermischen.

Der große Test: Der „Libero-OOD"-Benchmark

Um zu beweisen, dass dies kein Zufall war, erstellten die Autoren einen neuen Test namens Libero-OOD. Dieser Test enthält 20 knifflige Aufgaben, bei denen der Roboter Fähigkeiten, die er bereits kennt, auf neue Weise kombinieren muss.

  • Das Ergebnis: Sie testeten die besten Roboterhirne der Welt (wie UniVLA, OpenVLA und π0-fast). Keines davon konnte dies allein bewältigen. Alle erzielten Ergebnisse unter 21 %.
  • Die Schlussfolgerung: Selbst die intelligentesten Roboter stecken derzeit in ihren Trainingsdaten fest. Ohne Hilfe können sie nicht verallgemeinern oder „den Teller verlassen".

Die Warnung: „Private Anweisungen"

Die Forscher entdeckten auch etwas etwas Unheimliches. Da diese „Rezeptkarten" nur Muster von Zahlen sind, kann man sie wieder in Text umwandeln.

  • Als sie versuchten, die „Rezeptkarte" für eine Aufgabe zu lesen, war der resultierende Text Kauderwelsch (wie QSize, black, plate).
  • Wenn man diesen Kauderwelsch jedoch wieder in den Roboter einspeiste, funktionierte er trotzdem!
  • Die Metapher: Es ist wie ein Geheimschlüssel, den nur der Roboter versteht. Man könnte eine geheime Anweisung in einem normal aussehenden Satz verstecken, und der Roboter würde ihr folgen, ohne dass jemand anderes es merkt. Dies wird als „Backdoor" bezeichnet und zeigt, dass diese Modelle mysteriöser sind als gedacht.

Zusammenfassung

Das Papier sagt uns, dass die intelligentesten Roboter von heute wie Musiker sind, die zwei Songs perfekt spielen können, aber keine neue Melodie improvisieren können. Sie merken sich die genauen Noten und Positionen aus ihren Übungsstunden, scheitern aber, wenn sich die Musik leicht ändert.

Die Autoren zeigten, dass der Roboter eine neue Melodie spielen kann, wenn wir manuell die „Notenblätter" (die Text Latents) aus zwei verschiedenen Songs mischen. Dies beweist, dass der Roboter das Talent hat, aber die Fähigkeit fehlt, seine eigenen Fähigkeiten zu kombinieren. Das Papier führt einen neuen Test (Libero-OOD) ein, um Forschern zu helfen, Roboter zu bauen, die tatsächlich lernen können, ihre eigenen Fähigkeiten zu mischen, anstatt nur Szenen auswendig zu lernen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →