← Nieuwste papers
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

Dit artikel introduceert **In-Context VLA**, een framework dat Vision-Language-Action-modellen verbetert door de vrij vorm van chain-of-thought-generatie te vervangen door in-context post-training op gestructureerd perceptueel bewijs en agentic toolgebruik, waardoor gegrondelde taalconsumptie mogelijk wordt voor superieure low-level controle en state-of-the-art prestaties in simulatie- en real-world manipulatietaken.

Oorspronkelijke auteurs: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Gepubliceerd 2026-08-07
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om huishoudelijke taken uit te voeren, zoals het maken van een broodje of het opruimen van een rommelige kamer. Lange tijd hebben wetenschappers geprobeerd deze machines te leren door hen video's te laten zien van mensen die de taak uitvoeren en tegen de robot te zeggen: "Kopieer exact wat je ziet." Dit werkt redelijk voor eenvoudige taken, maar het is alsof je een nieuwe taal probeert te leren door slechts één enkele, rigide zin uit het hoofd te leren. Als je de robot vraagt om "de rode mok op te pakken", maar daarna zegt: "grijp die karmijnrode beker", kan de robot in de war raken omdat hij nooit heeft geleerd om de betekenis achter de woorden te begrijpen, maar alleen om de specifieke klanken te matchen die hij tijdens de training hoorde.

Om dit op te lossen, hebben onderzoekers onlangs geprobeerd robots een "denkstap" te geven, vergelijkbaar met hoe mensen tegen zichzelf praten voordat ze handelen. Ze hoopten dat de robot eerst een plan zou uitschrijven zoals: "Oké, de beker staat op de tafel, en ik moet mijn hand naar links bewegen," en dan pas zou handelen. Dit wordt "Chain-of-Thought" genoemd. Maar hier is de twist: voor robots maakt te veel praten voordat men beweegt de machine juist slechter in zijn werk. Het is alsof je probeert een auto te besturen terwijl je een roman over de weg schrijft; tegen de tijd dat je je zin hebt afgemaakt, heb je de afslag gemist. De robot raakt gevangen in een lus van het narreren van zijn eigen gedachten in plaats van daadwerkelijk het object te pakken, en hij verzint vaak feiten over waar dingen zich bevinden omdat hij gokt in plaats van echt te kijken.

Dit artikel introduceert een nieuwe manier om robots te onderwijzen genaamd VLA-Talker. In plaats van de robot te dwingen zijn eigen gedachten op te schrijven, geven de onderzoekers de robot een "slimme assistent" die het kijken en rapporteren voor hem doet. Denk aan een robot met een superkrachtige bril en een behulpzame co-piloot. Wanneer de robot moet weten waar een lepel is, gokt hij niet of schrijft hij geen paragraaf over de locatie. In plaats daarvan vraat hij direct aan zijn co-piloot (die speciale hulpmiddelen gebruikt zoals dieptecamera's en objectdetectoren) om te zeggen: "De lepel is 42 pixels naar rechts en iets lager dan je hand." De robot leest vervolgens dit heldere, feitelijke rapport en handelt direct.

De onderzoekers ontdekten dat deze methode een game-changer is. Door de robot te laten consumeren van heldere, gegronde taal van zijn hulpmiddelen in plaats van zijn eigen verwarrende geklets te laten genereren, wordt de robot veel sneller en nauwkeuriger. In hun tests werkte deze aanpak niet alleen beter, maar was hij bijna 4,6 keer sneller dan de oude "denk"-methoden, omdat de robot geen tijd verspilde aan het schrijven van essays voordat hij bewoog. Ze testten dit in complexe computersimulaties en zelfs op een echte mensvormige robot, en het loste consistent taken op waar andere robots moeite mee hadden, wat bewees dat soms de beste manier om na te denken is om te luisteren naar iemand anders die de feiten kent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →