← Nieuwste papers
💻 computer science

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA is een instructiebewuste ruimtelijke representatie-uitlijndingsmethode die Vision-Language-Action-modellen verbetert door de latente representaties specifiek uit te lijnen met de 3D-geometrie van doelobjecten die door taalinstructies worden geïdentificeerd, waardoor de prestaties op taken met fijnmazige manipulatie en geoccludeerde doelobjecten aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

Gepubliceerd 2026-08-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters in herhaling, in staat om dezelfde precieze beweging duizenden keren zonder fouten uit te voeren. Toch struikelen ze vaak wanneer ze gevraagd wordt door een rommelige kamer te navigeren of een specifiek voorwerp uit een stapel vergelijkbare objecten te pakken. De uitdaging ligt niet alleen in het zien van de wereld, maar in het begrijpen van de driedimensionale vorm en positie van het specifieke object dat een mens hen heeft gevraagd aan te raken. Moderne robots worden steeds vaker geleid door Vision-Language-Action modellen, systemen die een visuele scène en een gesproken commando nemen en vervolgens een fysieke beweging beslissen. Hoewel deze systemen opmerkelijk goed zijn geworden in algemene taken, worstelen ze vaak wanneer het doelobject gedeeltelijk verborgen is of wanneer de robot moet onderscheid maken tussen twee bijna identieke items. De kern van de moeilijkheid is dat deze modellen de neiging hebben om de gehele visuele scène als één uniforme blok informatie te behandelen, in plaats van hun geometrische begrip te richten op het specifieke item dat de mens noemde.

Een nieuwe aanpak genaamd Mind-VLA pakt deze beperking aan door robots te leren aandacht te schenken aan het specifieke object dat in een commando wordt genoemd. In plaats van te proberen de 3D-geometrie van een hele kamer in kaart te brengen, leert het systeem het doelobject dat in de taalinstructie wordt beschreven te isoleren en een gedetailleerd mentaal model van alleen dat item op te bouwen. Deze methode stelt de robot in staat om de vorm en positie van een aardappel te begrijpen, zelfs als deze naast een vergelijkbaar uitziende appel ligt, of om een banaan te grijpen die gedeeltelijk bedekt is door een doek. Door de focus te verschuiven van de hele scène naar het specifieke doel, krijgt de robot een scherper gevoel van waar hij moet reiken en hoe hij het object moet vasthouden, wat leidt tot een betrouwbaardere prestatie in complexe, realistische situaties.

De onderzoekers achter dit werk identificeerden een fundamenteel gebrek in de manier waarop huidige 3D-bewuste robots worden getraind. Bestaande methoden stemmen het interne begrip van de robot vaak af op de geometrie van de gehele scène, ongeacht wat de mens vraagt te doen. Als een persoon zegt: "pak de aardappel", kan de trainingsdata van de robot de robot dwingen om de 3D-structuur van de tafel, de achterwand en de andere vruchten op het aanrecht samen met de aardappel te coderen. Dit creëert een modderig signaal waarbij de belangrijkste informatie — de vorm van de aardappel zelf — verloren gaat in de ruis van de omgeving. Dit probleem wordt kritiek wanneer het doelobject gedeeltelijk wordt afgeschermd of verborgen is voor het zicht, omdat de robot niet expliciet is getraind om de 3D-structuur van het specifieke item dat het moet manipuleren te behouden.

Om dit op te lossen, ontwikkelde het team een trainingsproces dat werkt als een spotlight, die alleen het object van belang verlicht. Wanneer de robot een commando ontvangt, analyseert het systeem eerst de taal om het doelobject en de beoogde volgorde van interactie te identificeren. Vervolgens construeert het een reeks standaard- of canonieke weergaven van dat specifieke object, waardoor effectief een schoon, 3D-blauwdruk van het item in isolatie wordt gecreëerd. Tijdens de trainingsfase wordt de robot deze geïsoleerde weergaven getoond en gevraagd om zijn interne begrip af te stemmen op de geometrie van het doel, terwijl de rest van de scène wordt genegeerd. Dit proces omvat twee hoofdstappen: het voorspellen van de verborgen 3D-structuur van het doel vanuit het visuele uiterlijk en het afstemmen van de tussenliggende verwerkingslagen van de robot op de gedetailleerde geometrische kenmerken van dat specifieke object. Cruciaal is dat dit extra trainings-toezicht alleen wordt gebruikt terwijl de robot leert; zodra de training voltooid is, werkt de robot net zoals voorheen, zonder dat er extra 3D-sensoren of complexe verwerking nodig zijn tijdens het eigenlijke werk.

De resultaten van deze aanpak werden getest in zowel gesimuleerde omgevingen als op echte fysieke robots. In een reeks standaard benchmarks die ontworpen zijn om robotmanipulatie te testen, behaalde de nieuwe methode een succespercentage van 94,4 procent, waarmee zij eerdere modellen die dezelfde onderliggende architectuur gebruikten, overtrof. De verbetering was bijzonder merkbaar in taken die fijnmazige discriminatie vereisten, waarbij de robot moest kiezen tussen vergelijkbare objecten. In de CALVIN-benchmark, die het vermogen van een robot test om een sequentie van vijf verschillende taken achter elkaar te voltooien, voltooide het systeem gemiddeld 4,47 taken, een lichte maar betekenisvolle verbetering ten opzichte van de vorige beste prestatie. Deze cijfers suggereren dat door de focus te leggen op het specifieke doel in plaats van de hele scène, de robot nauwkeuriger wordt en minder vatbaar is voor verwarring.

De echte test van deze methode kwam echter toen de onderzoekers de robot in een realistische scenario plaatsten waar het doelobject gedeeltelijk verborgen was. Ze zetten een dual-arm robot op en vroegen hem om items zoals aardappelen en bananen op te pakken en te plaatsen, waarbij soms ongeveer 25 procent van het doel werd bedekt door een obstructie. Onder deze uitdagende omstandigheden slaagde het nieuwe systeem 54 procent van de tijd. Dit was een aanzienlijke sprong vergeleken met een controleversie van dezelfde robot die de traditionele, scène-brede aanpak gebruikte, die slechts 28 procent van de tijd slaagde. Het verschil van 26 procentpunten benadrukt de waarde van instructie-bewust ruimtelijk begrip; wanneer het doel gedeeltelijk geblokkeerd is, kan de robot die precies weet waar hij naar moet kijken, nog steeds de vorm en positie ervan afleiden, terwijl de robot die naar de hele scène kijkt vaak faalt in het reconstrueren van de ontbrekende delen van het doel.

Buiten de cijfers om toonde de studie aan dat de robot daadwerkelijk leerde de geometrie van het specifieke object te representeren. Wanneer de onderzoekers de interne lagen van het model analyseerden, vonden ze dat het systeem veel gedetailleerdere informatie over de vorm van het doel codeerde dan eerdere modellen. Bovendien kon de robot het juiste object betrouwbaar terugvinden op basis van de taalinstructie, wat bewees dat de interne kaart direct gekoppeld was aan de woorden die het hoorde. Dit suggereert dat de robot niet alleen patronen onthoudt, maar een flexibel begrip ontwikkelt van hoe taal zich verhoudt tot 3D-ruimte. Door de machine te leren haar geometrische aandacht te richten op het object dat ertoe doet, hebben de onderzoekers een stap gezet naar het maken van robots die de rommelige, chaotische en vaak verborgen realiteiten van menselijke omgevingen met meer vertrouwen en vaardigheid kunnen hanteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →