← Nieuwste papers
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

Het artikel stelt CAST voor, een methode die vision-language modellen gebruikt om contrafactuele labels te genereren voor het uitbreiden van robotdatasets, waardoor de instructievolgende capaciteiten van vision-language-action modellen aanzienlijk worden verbeterd zonder dat er aanvullende gegevensverzameling nodig is.

Oorspronkelijke auteurs: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Gepubliceerd 2026-06-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij door een huis moet navigeren of objecten moet oppakken. Je laat de robot een video zien van een robot die door een gang loopt en naar rechts afslaat. Je zegt tegen de robot: "Dit is hoe 'rechtdoor gaan' eruitziet."

Het probleem is dat de robot een beetje een luie student is. Hij merkt dat elke keer dat hij een gang ziet, de robot in de video naar rechts afslaat. Dus leert de robot een kortere weg: "Als ik een gang zie, sla ik rechts af." Hij stopt met luisteren naar je specifieke instructies (zoals "ga links bij de blauwe tafel") omdat hij denkt dat het beeld van de gang hem al alles vertelt wat hij moet weten. In de technische termen van het artikel wordt dit "posterior collapse" genoemd — de robot negeert je stem en gokt gewoon op basis van wat hij ziet.

De CAST-oplossing: Het "Wat als?"-spelletje

De auteurs van dit artikel, van UC Berkeley en Princeton, hebben een slim trucje bedacht om dit op te lossen. Ze noemen het CAST (Counterfactual Labels Improve Instruction Following).

Zie CAST als een creatieve schrijfcoach voor robots. In plaats van de robot alleen het ene pad te laten zien dat hij daadwerkelijk heeft afgelegd, vraat de coach de robot om een spelletje "Wat als?" te spelen.

Zo werkt het, stap voor stap:

  1. De originele scène: De robot heeft een video van zichzelf terwijl hij door een gang loopt.
  2. De "Wat als?"-vraag: De onderzoekers gebruiken een superintelligent AI-model (een Vision-Language Model) om naar diezelfde gang te kijken en te vragen: "Hé, wat had de robot hier nog meer kunnen doen?"
    • Origineel: "Ga rechtdoor."
    • Counterfactual (Wat als): "Sla rechts af bij de oranje tafel," of "Beweeg langs de muur aan de linkerkant."
  3. Het uitvinden van het pad: De AI verzint niet alleen een zin; de AI verzint ook een nep-videopad dat bij die nieuwe zin past. De AI stelt zich voor: "Oké, als de robot rechts zou afslaan bij de oranje tafel, hoe zouden de volgende paar seconden er dan uitzien?"
  4. De nieuwe les: Nu heeft de robot twee lessen voor precies dezelfde gang:
    • Les A: "Ga rechtdoor" (de echte video).
      B: "Sla rechts af bij de oranje tafel" (de verzonnen video).

Waarom dit alles verandert

Vóór deze truc zag de robot een gang en dacht: "Dit ken ik! Ik sla rechts af!" Hij had je woorden niet nodig.

Na de CAST-truc ziet de robot dezelfde gang, maar realiseert hij zich: "Wacht even, soms ga ik rechtdoor, en soms sla ik rechts af bij de oranje tafel. Het beeld alleen vertelt me niet wat ik moet doen. Ik moet echt luisteren naar de specifieke woorden die je geeft om te weten welk pad ik moet nemen."

De resultaten

De onderzoekers hebben dit getest op twee soorten robots:

  • Navigatierobots: Robots die binnen en buiten rondlopen.
  • Manipulatierobots: Robotarmen die dingen oppakken, zoals broccoli of lepels.

Ze ontdekten dat de robots door het gebruik van deze "Wat als?"-data (zonder dat er nieuwe echte video's verzameld hoefden te worden) veel beter werden in het opvolgen van instructies.

  • Bij navigatie verdubbelde het succespercentage vergeleken met robots die getraind waren zonder deze truc.
  • Bij manipulatietaken (zoals het oppakken van items wanneer er afleidende objecten in de buurt zijn), verbeterden de robots met 27%.

De kern van het verhaal

CAST is alsover een bibliotheek van "alternatieve realiteiten" geven aan een robot. Door de robot te laten zien dat dezelfde scène tot veel verschillende uitkomsten kan leiden afhankelijk van de instructie, dwing je de robot om te stoen met gokken en te beginnen met luisteren. Het verandert een robot die gewoon "kijkt en gokt" in een robot die echt "luistert en handelt."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →