← Nieuwste papers
💻 computer science

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

Dit paper introduceert **DeLock**, een methode die voorkomt dat vision-language-action (VLA) modellen hun algemene vaardigheden verliezen tijdens training met kleine datasets (het zogenaamde 'lock-in' effect), door gebruik te maken van de interne voorkennis van het model en contrastieve sturing tijdens de testfase.

Oorspronkelijke auteurs: Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotarm hebt die bijna alles kan. Hij kan koffiekopjes oppakken, deuren openen en blokken stapelen. Maar er is een probleem: zodra je hem een klein beetje "bijscholen" voor een specifieke taak, wordt hij een soort koppige specialist.

Dit is wat onderzoekers van Stanford hebben ontdekt, en hoe ze het hebben opgelost. Hier is het verhaal van de "DeLock" methode.

Het Probleem: De "Koppige Specialist" (Lock-In)

Stel je voor dat je een nieuwe stagiair in de keuken hebt. Je leert hem één ding: "Pak de groene mok en zet hem op het bord." Je doet dit vijf keer. De stagiair leert het razendsnel!

Maar de volgende dag komt er een klant binnen en zegt: "Pak de rode mok en zet hem op het bord." Wat doet de stagiair? Hij negeert de opdracht en pakt alsnog de groene mok. Of nog erger: hij pakt de rode mok, maar zet hem op de verkeerde plek omdat hij "gewend" is dat alles altijd links op het bord gaat.

In de robotwereld noemen we dit Lock-In. De robot is zo gefocust op de kleine hoeveelheid training die hij heeft gekregen, dat hij "vergeet" hoe hij naar nieuwe woorden of nieuwe plekken moet kijken. Hij zit vast in een tunnelvisie.

  • Concept Lock-In: De robot ziet alleen de objecten die hij tijdens zijn training heeft gezien (hij ziet alleen "groen", geen "rood").
  • Spatial Lock-In: De robot is geobsedeerd door de plek waar hij tijdens de training werkte (hij denkt dat "op het bord" altijd "links op het bord" betekent).

De Oplossing: DeLock (De "Brede Blik" Methode)

De onderzoekers hebben een slimme manier bedacht om deze tunnelvisie te doorbreken zonder dat de robot duizenden uren extra training nodig heeft. Ze gebruiken twee trucjes:

1. De "Geheugensteun" (Weight-Drift Regularization)

Normaal gesproken, als je een robot bijscholt, verandert hij zijn hele "brein" om de nieuwe taak te leren. Daarbij gooit hij per ongeluk zijn oude, algemene kennis weg.

DeLock werkt als een coach die zegt: "Leer die nieuwe taak, maar vergeet niet hoe de rest van de wereld eruitziet!" Ze gebruiken een wiskundige rem die voorkomt dat de visuele sensor van de robot te veel verandert. Hierdoor behoudt de robot zijn "brede blik" en blijft hij begrijpen wat een "rode mok" of een "linker kant" is, zelfs als hij die tijdens zijn korte training niet heeft gezien.

2. De "Contrast-Kompas" (Contrastive Prompt Guidance)

Dit is het meest magische onderdeel. Tijdens het werk gebruikt de robot een soort intern kompas om de juiste richting te bepalen.

Stel dat de robot de opdracht krijgt: "Pak de rode mok." De robot is nog steeds een beetje twijfelachtig door zijn training. DeLock laat de robot op dat moment twee scenario's in zijn hoofd vergelijken:

  1. Scenario A (De oude gewoonte): "Pak de groene mok."
  2. Scenario B (De nieuwe opdracht): "Pak de rode mok."

De robot kijkt naar het verschil tussen die twee. Hij denkt: "Oké, het enige verschil tussen deze twee opdrachten is de kleur. Dus ik moet mijn beweging aanpassen op basis van die kleur-informatie." Door dit contrast te gebruiken, kan hij zichzelf tijdens het uitvoeren van de taak corrigeren en de juiste kant op sturen.

Waarom is dit belangrijk?

In plaats van dat we een robot miljoenen euro's aan data moeten geven om hem alles te leren, kunnen we nu met een heel klein beetje informatie (een paar demonstraties) een robot maken die:

  • Flexibel is: Hij begrijpt nieuwe kleuren en vormen.
  • Slimme ruimtelijke logica heeft: Hij snapt het verschil tussen links en rechts, ook al deed hij dat tijdens de training nooit.

Kortom: DeLock zorgt ervoor dat een robot niet verandert in een koppige specialist, maar een slimme leerling blijft die kan meebewegen met de wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →