← Nieuwste papers
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA verenigt taal-, visuele taal- en visuele instructiemodi tot één Vision-Language-Action-model door deze te canonicaliseren naar tekstprompts en deictische maskers, waarmee het een superieure generalisatie naar onbekende objecten en expressies demonstreert vergeleken met alleen op taal gebaseerde baselines.

Oorspronkelijke auteurs: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Gepubliceerd 2026-08-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robotarm voor die in een keuken staat, klaar om te helpen. Om de robot te vertellen wat hij moet doen, kan een mens zeggen: "Pak de rode beker aan de linkerkant op." Dit lijkt simpel, maar voor een machine is de wereld vaak rommelig met veel rode bekers, of bekers die bijna identiek zijn. Als de mens probeert specifieker te zijn door te zeggen: "Pak de derde rode beker van links, degene naast de blauwe servet," kan de robot nog steeds in de war raken. Moderne robots worden beter in het begrijpen van taal, maar ze worstelen vaak wanneer de instructies te gedetailleerd zijn of wanneer de objecten voor hen niet precies overeenkomen met de exacte plaatjes die ze tijdens hun training hebben gezien. Ze kunnen het verkeerde voorwerp pakken, simpelweg omdat het er iets bekender uitziet, waarbij ze de specifieke woorden die de mens net sprak negeren.

Om dit op te lossen, verkennen onderzoekers een andere manier om met machines te communiceren: het maken van een wijzend gebaar. Net zoals een mens kan zeggen: "Pak deze hier," terwijl hij met een vinger naar het object wijst, kan een robot leren om een klik op een scherm te begrijpen als een direct commando. Deze aanpak, bekend als een deictische geste, omzeilt de verwarring van taal door de robot precies te laten zien wat er bedoeld wordt. Tot nu toe waren robots echter meestal getraind om alleen naar woorden te luisteren, of om naar woorden te luisteren terwijl er naar iets werd gewezen, maar zelden om al deze manieren van communiceren tegelijkertijd te verwerken. Een nieuwe studie introduceert een systeem dat deze methoden verenigt, waardoor een enkele robotintelligentie naadloos kan schakelen tussen het luisteren naar een zin, het luisteren naar een zin terwijl er naar iets wordt gewezen, of simpelweg het volgen van een aanwijzing zonder woorden.

De onderzoekers, werkend met een type kunstmatige intelligentie dat een Vision-Language-Action-model wordt genoemd, ontwikkelden een systeem dat ze DeicticVLA noemen. Deze modellen zijn als het brein van een robot dat miljoenen boeken heeft gelezen en miljoenen afbeeldingen heeft gezien, waardoor het heeft geleerd hoe het ziet wat het moet doen. De uitdaging was om dit brein flexibel genoeg te maken om drie verschillende soorten input te accepteren: een tekstcommando, een tekstcommando gecombineerd met een wijzend gebaar, of alleen een wijzend gebaar. In de eerste modus typt de gebruiker een volledige zin. In de tweede modus typt de gebruiker een zin die woorden bevat zoals "dit" of "daar" en klikt op het scherm om te definiëren waarnaar dat woord verwijst. In de derde modus klikt de gebruader op het object dat verplaatst moet worden en op de plek waar het heen moet, zonder iets te zeggen.

Om dit werkend te krijgen, creëerde het team een vertaalstap die al deze drie verschillende inputs omzet in hetzelfde interne formaat. Wanneer een gebruiker op een scherm klikt, gebruikt het systeem een krachtig beeldanalysetool om die enkele klik om te zetten in een precieze omtrek van het object, een masker dat precies benadrukt wat de mens aanraakt. Dit masker wordt vervolgens gecombineerd met een tekstprompt. Als de gebruiker sprak, is de tekstprompt hun woorden. Als de gebruiker alleen klikte, gebruikt het systeem een standaardzin zoals "volg de visuele instructie." Op deze manier ontvangt het brein van de robot altijd een consistent pakket: een tekstinstructie en een visuele highlight van het doelwit. De onderzoekers hebben verschillende manieren getest om deze visuele highlight in het brein van de robot te voeden. Ze probeerden een kader rond het object op de camerabeelden te schilderen, de rest van de scène te vervagen om het object eruit te laten springen, of de omtrek als een aparte laag informatie in te voeren die de robot samen met de afbeelding verwerkt.

Het team testte deze ideeën eerst in een gesimuleerde omgeving, een digitale wereld waarin robots duizenden keren kunnen oefenen zonder iets kapot te maken. Ze ontdekten dat het systeem succesvol kon leren om alle drie de instructiemodi tegelijkertijd te hanteren. Wanneer de robot werd gevraagd taken uit te voeren die hij nog nooit eerder had gezien, zoals het oppakken van een object uit een nieuwe meubelopstelling of het identificeren van een object op basis van een nieuwe ruimtelijke beschrijving, werkten de wijzende methoden aanzienlijk beter dan woorden alleen. In een test met identieke zwarte kommen, waarbij de robot degene moest pakken die naast een specifiek referentieobject stond, faalde de taal-alleen benadering meestal. Echter, wanneer de gebruiker naar de juiste kom wees, slaagde de robot bijna elke keer. De studie toonde aan dat de tweefasen-trainingsmethode cruciaal was: de robot leerde eerst tekstcommando's te volgen, en daarna leerde hij die commando's te combineren met wijzende gebaren. Deze volgorde hielp de robot om zijn vermogen om taal te begrijpen te behouden, terwijl hij de nieuwe vaardigheid kreeg om een aanwijzing te volgen.

Om te zien of dit ook in de echte wereld werkte, bouwden de onderzoekers een fysieke opstelling met een robotarm, een camera en een tablet. Ze leerden de robot blokken op te pakken, in kommen te plaatsen en knuffeldiertjes te organiseren. Ze testten de robot met instructies die hij nog nooit eerder had gehoord, zoals het vragen om de "meest linkse" blok op te pakken wanneer hij alleen getraind was op "meest rechtse" instructies, of het vragen om een specifiek type speelgoed te verplaatsen dat hij nog nooit had gezien. In deze moeilijke scenario's worstelde de robot die alleen op taal vertrouwde, waarbij hij vaak fouten maakte of niet in staat was te handelen. Maar wanneer de gebruiker naar het doelwit wees, schoot het succespercentage van de robot omhoog. In een test met volledig nieuwe categorieën knuffeldiertjes slaagde de taal-alleen robot slechts ongeveer één zesde van de tijd. De wijzende methoden behaalden echter een perfect succespercentage. De robot had de naam van het speelgoed of de categorie waartoe het behoorde niet nodig te weten; hij hoefde alleen maar te zien waar de mens naar wees.

De resultaten suggereren dat de toekomst van mens-robotinteractie niet gaat over het kiezen tussen praten en wijzen, maar over het beschikbaar hebben van beide tegelijkertijd. Het systeem stelt een gebruiker in staat om met een zin te beginnen, en als de robot verward lijkt, simpelweg te wijzen om duidelijkheid te scheppen. Of, voor een snelle, routinematige taak, kan de gebruiker gewoon wijzen zonder een woord te zeggen. Het onderzoek geeft aan dat hoewel taal krachtig is voor het beschrijven van complexe ideeën, wijzen een betrouwbaardere manier is om specifieke objecten te identificeren in een rommelige, veranderende wereld. Door deze methoden te verenigen in één enkel systeem, hebben de onderzoekers een flexibelere en robuustere manier gecreëerd voor mensen om machines aan te sturen, wat ervoor zorgt dat de robot niet alleen begrijpt wat we zeggen, maar ook wat we bedoelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →