← Nieuwste papers
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL is een fysiek gegrond dexterous vision-language-action model dat een Mixture-of-Transformers-architectuur met adaptieve visuo-tactiele fusie en latente co-imaginatie benut om state-of-the-art prestaties te behalen in contactrijke manipulatietaken door tactiele waarneming en fysieke dynamica dynamisch te integreren.

Oorspronkelijke auteurs: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Gepubliceerd 2026-09-09
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters op de fabrieksvloer, waarbij ze zware objecten langs voorspelbare paden bewegen met rigide precisie. Toch, wanneer we hen vragen om onze huizen binnen te gaan en de delicate, rommelige taken van het dagelijks leven uit te voeren—een gloeilamp indraaien, een vaas afnemen, of een dop van een fles draaien—falen ze vaak. De wereld is geen schoon, statisch raster; het is een plek van constante, subtiele wrijving. Om te slagen, moet een machine meer doen dan alleen zien; ze moet voelen. Ze moet de onzichtbare fysica van contact begrijpen: het moment dat een vinger uitschiet, de druk die nodig is om aan een knop te draaien, of de manier waarop een zacht object vervormt onder aanraking. Decennialang hebben wetenschappers geprobeerd deze kloof te overbruggen door robots zowel ogen als huid te geven, maar het aanleren van een machine om deze zintuigen te combineren tot één enkele, vloeiende intuïtie is een van de meest hardnekkige uitdagingen in kunstmatige intelligentie gebleven.

Een team van onderzoekers heeft nu een belangrijke stap voorwaarts gezet met een nieuw systeem genaamd DeCAL. Dit is niet louter een robot die kan zien en voelen; het is een systeem dat ontworpen is om de toekomst van een fysieke interactie te verbeelden voordat deze plaatsvindt. Door een model te bouwen dat begrip, verbeelding en actie verenigt, creëerden de onderzoekers een robotbeleid dat de complexe, contactrijke wereld van menselijke manipulatie kan navigeren met een niveau van behendigheid dat voorheen ongezien was. Het systeem werd getest op zes verschillende taken, variërend van het afnemen van een vaas tot het assembleren van kleine onderdelen, en het presteerde consequent beter dan de meest geavanceerde bestaande methoden. In deze real-world proeven behaalde DeCAL een succespercentage van wel 100 procent op eenvoudigere taken en behield het een robuust gemiddeld succespercentage van 71 procent over alle zes de uitdagingen, zelfs wanneer de omgeving op onverwachte manieren veranderde.

Het kernprobleem dat de onderzoekers aanpakten, is dat visie alleen vaak blind is voor de meest kritieke momenten van manipulatie. Wanneer een robothand naar een object reikt, blokkeren de vingers vaak het zicht van de camera, wat een "blind spot" creëert precies op het moment dat de robot het meest moet weten. Bovendien kan visuele data een robot niet vertellen hoe hard hij drukt of of een object op het punt staat te glijden. Hoewel eerdere pogingen om tastsensoren aan robots toe te voegen vaak als eenvoudige toevoegingen werden behandeld, integreert DeCAL tactiele informatie als een fundamenteel onderdeel van het denkproces. Het systeem gebruikt hoogwaardige sensoren op elke vingertop die de vorm van het oppervlak van een object kunnen detecteren terwijl het vervormt onder druk, evenals de precieze krachten die worden uitgeoefend. Dit stelt de robot in staat om de wereld te "voelen" op een manier die even rijk en gedetailleerd is als wat hij ziet.

Wat DeCAL werkelijk uniek maakt, is hoe het deze informatie verwerkt. In plaats van simpelweg te reageren op wat het ziet of voelt op het huidige moment, is het systeem getraind om te verbeelden wat er hierna zal gebeuren. Het werkt met drie verschillende maar verbonden capaciteiten. Ten eerste begrijpt het de huidige situatie door naar de visuele scène te kijken, een taalinstructie te lezen en de contactpunten te voelen. Ten tweede gaat het een vorm van "co-verbeelding" aan, waarbij het voorspelt hoe de visuele scène en de tactiele sensaties zich in de volgende paar seconden zullen ontwikkelen. Het vraagt zichzelf in feite af: "Als ik de dop nu draai, hoe verandert de kracht dan, en hoe ziet het object er een moment later uit?" Ten slotte gebruikt het deze verbeelde toekomst om de precieze bewegingen te bepalen die nodig zijn om de taak te voltooien. Deze vooruitziende aanpak stelt de robot in staat om zijn acties te plannen op basis van de fysica van de interactie, in plaats van alleen te gokken op basis van patronen uit het verleden.

Om dit werkend te krijgen, ontwikkelden de onderzoekers een speciale methode om te beslissen wanneer men de zintuiglijke tast moet vertrouwen. Bij veel taken beweegt een robot zich wellicht door de lucht waar tast irrelevant is, en maakt dan plotseling contact met een object. Als de robot de hele tijd evenveel aandacht aan deelsignalen zou besteden, zou hij in de war raken door de ruis van de lucht of het gebrek aan contact. DeCAL gebruikt een slimme "gating"-mechanisme dat werkt als een volumeknop voor de tastzin. Wanneer de robot niets aanraakt, verlaagt het systeem het volume van de tactiele signalen en vertrouwt het voornamelijk op visie. Het moment dat contact wordt gemaakt, draait het systeem het volume onmiddellijk omhoog, waardoor de tactiele data de beweging met hoge precisie kan sturen. Deze dynamische aanpassing zorgt ervoor dat de robot de juiste zintuigen op het juiste moment gebruikt, waardoor voorkomt dat de zintuiglijke inputs met elkaar in conflict komen.

Het systeem werd getest in een reeks rigoureuze experimenten met een paar robotarmen uitgerust met handen van vierentwintig vingers. De onderzoekers gaven de robot zes verschillende activiteiten: het afnemen van een vaas, het uitwissen van een whiteboard, het assembleren van onderdelen, het draaien van een dop, het pipetteren van vloeistof en het indraaien van een gloeilamp. Deze taken werden gekozen omdat ze allemaal fijnmazige controle en constant fysiek contact vereisen. De robot werd vergeleken met verschillende andere state-of-the-art modellen, waaronder modellen die alleen op visie vertrouwden en andere die wel tast gebruikten maar niet het vermogen hadden om toekomstige toestanden te verbeelden. De resultaten waren duidelijk: DeCAL slaagde er veel vaker in om de taken te voltooien dan enig ander systeem. Zo slaagde DeCAL bij de taak van het indraaien van een gloeilamp, waarbij visie vaak wordt geblokkeerd door de hand en de taak precieze koppel vereist, 40 procent van de tijd, terwijl het op één na beste model slechts 35 procent slaagde. Bij de taak van het afnemen van een vaas behaalde DeCAL een perfect succespercentage van 100 procent, terwijl het beste concurrerende visie-gebaseerde model slechts 30 procent van de tijd slaagde.

Misschien nog wel indrukwekkender was het vermogen van het systeem om situaties aan te kunnen die het nog nooit eerder had gezien. De onderzoekers testten DeCAL in omgevingen met verschillende achtergronden, vol met willekeurige objecten, onder gedimd licht en met volledig nieuwe objecten met andere vormen en maten. In deze "out-of-distribution" scenario's, waar de robot niet kon vertrouwen op gememoriseerde patronen, bleef DeCAL sterk presteren. Wanneer gevraagd werd om een dop op een nieuwe, onbekende beker te draaien, slaagde het systeem 75 procent van de tijd, waarmee het zijn concurrenten aanzienlijk overtrof. Dit suggereert dat de robot niet alleen een specifieke set bewegingen memoriseert, maar daadwerkelijk de onderliggende fysieke principes leert van hoe objecten interageren, waardoor hij zich aan nieuwe uitdagingen kan aanpassen tijdens de uitvoering.

De onderzoekers keken ook nauwgezet naar hoe het systeem leerde de toekomst te voorspellen. Door de interne voorspellingen van de robot te analyseren, ontdekten zij dat het accuraat de krachten en vervormingen kon voorspellen die tijdens een interactie zouden optreden. Wanneer de robot voorspelde hoeveel kracht er nodig zou zijn om een dop te draaien of hoe een zacht oppervlak zou vervormen, kwamen deze voorspellingen nauw overeen met de werkelijke fysieke realiteit. Dit vermogen om de fysica van de wereld intern te simuleren, is wat de robot zijn "gezond verstand" geeft. Het stelt het systeem in staat om te begrijpen dat als het te hard duwt, het object kan glijden, of als het te langzaam draait, de taak te lang zal duren. Deze impliciete kennis van de fysica, afgeleid van de combinatie van zicht en tast, is wat de robot in staat stelt om met een dergelijke vloeiendheid en zelfvertrouwen te handelen.

Ondanks deze successen zijn de auteurs voorzichtig om de beperkingen van hun werk te benoemen. Het systeem leunt zwaar op de nauwkeurigheid van de tactiele sensoren, en als die sensoren ruisachtig of verkeerd gekalibreerd raken, kan de prestatie van de robot verslechteren. Daarnaast vereist de huidige opstelling een menselijke operator om de taken te demonstreren via een teleoperatiesysteem, wat de operator geen gevoel van tast geeft. Dit betekent dat de trainingsdata de subtiele aanpassingen die een mens zou maken als hij het object zelf kon voelen, mogelijk niet perfect vastlegt. De onderzoekers wijzen er ook op dat hun model nog niet is getraind op een massale schaal van diverse tactiele data, wat suggere-ert dat toekomstige verbeteringen voort kunnen komen uit het blootstellen van het systeem aan een nog veel grotere variëteit aan fysieke interacties.

Dit werk vertegenwoordigt een verschuiving in hoe we over robotintelligentie denken. In plaats van robots te bouwen die simpelweg sneller of sterker zijn, richt deze aanpak zich op het bouwen van machines die de fysieke wereld kunnen begrijpen als een dynamische, interactieve plek. Door de robot het vermogen te geven om de gevolgen van zijn acties te verbeelden en zijn zintuigen aan de situatie aan te passen, hebben de onderzoekers een systeem gecreëerd dat minder aanvoelt als een machine die een script volgt en meer als een agent die in staat is tot echte interactie. Naarmate de technologie rijpt, is de hoop dat deze systemen uiteindelijk de complexe, contactrijke taken kunnen uitvoeren die zo kenmerkend zijn voor het menselijk leven, van koken en schoonmaken tot de zorg voor ouderen, met een behendigheid die de onze evenaart. De weg vooruit houdt in: het verfijnen van deze sensoren, het uitbreiden van de trainingsdata en het blijven overbruggen van de kloof tussen zien, voelen en doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →