← Nieuwste papers
💻 computer science

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch is een vision-language-action model dat contactrijke dexterous manipulatie verbetert door een Tactile-Patch Encoder en een hoogfrequente actiemodule te gebruiken om tactiele toestanden en acties gezamenlijk te voorspellen en online te verfijnen, waarbij het significant hogere succespercentages behaalt dan baselines op de nieuw geïntroduceerde XHT-Dataset.

Oorspronkelijke auteurs: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

Gepubliceerd 2026-08-04
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots lijken op onhandige peuters die proberen een toren van Jenga-blokjes te bouwen. Ze hebben ogen (camera's) en een brein (kunstmatige intelligentie) dat instructies kan begrijpen zoals "pak het rode blokje op." Maar hier komt de adder onder het gras: ogen kunnen niet voelen. Als een blokje glad is, of als de grip van de robot te strak is en het blokje verplettert, of als het blokje begint te glijden, merkt het oog van de robot dit misschien pas als het te laat is. Dit is het grote probleem in "dexterous manipulation" (behendige manipulatie)—de chique term voor robots die hun handen gebruiken voor delicate, op tast zware taken. Wetenschappers proberen robots al een gevoel van tast te geven, maar dat is lastig. Alleen een "gevoelssensor" aan het brein van een robot toevoegen is vaak niet genoeg, omdat de robot moet voorspellen wat er hierna gaat gebeuren en zijn grip direct moet aanpassen, niet pas reageren nadat hij iets heeft laten vallen.

Dit is waar een nieuw idee genaamd ReTouch om de hoek komt kijken. Zie dit als het geven van niet alleen een tastzin aan een robot, maar een "zesde zintuig" dat de robot laat raden hoe zijn vingers over een fractie van een seconde zullen voelen, en dan onmiddellijk de gok corrigeert als de werkelijkheid niet overeenkomt met de voorspelling. De onderzoekers bouwden een systeem dat tast behandelt als een levend, ademend gesprek tussen de hand van de robot en zijn brein. In plaats van alleen naar een afbeelding van een hand die een object vasthoudt te kijken, breekt ReTouch het gevoel af in kleine, specifieke "patches" (vlakken) op elke vingertop, als een hoogresolutie kaart van druk. Vervolgens werkt het de kaart constant bij terwijl de robot beweegt, waarbij de voorspellingen in realtime worden gecorrigeerd als het object glijdt of verschuift. Het resultaat? Een robot die complexe, op tast zware taken kan uitvoeren—zoals op een knop van een pipet drukken of een whiteboard schoonvegen—veel beter dan voorheen, zelfs wanneer er dingen misgaan.

Het Probleem: Ogen Kunnen Niet Voelen, en Voorspellingen Worden Verouderd

Robots worden steeds beter in het opvolgen van instructies. Als je een robot vertelt om "de beker op te pakken," ziet de camera de beker en bedenkt het brein hoe de arm te bewegen. Maar zodra de vingers van de robot de beker daadwerkelijk aanraken, wordt het ingewikkeld. Is de beker glad? Glijdt hij weg? Knijpt de robot te hard? Een camera kan de onzichtbare krachten zien die op het contactpunt plaatsvinden niet zien.

Wetenschappers hebben geprobeerd dit op te lossen door robots "tactiele sensoren" (tastsensoren) op hun vingers te geven. Sommige robots kijken simpelweg naar de tastgegevens en reageren, zoals een reflex. Anderen proberen te voorspellen hoe de tast er in de toekomst uit zal zien. Maar er zit een fout in hoe de meeste van deze systemen werken. Stel je voor dat je een bal probeat te vangen. Je voorspelt waar de bal over één seconde zal zijn. Maar als de wind verandigt of de bal vreemd draait, wordt je voorspelling fout. Als je je voorspelling niet bijstelt terwijl je naar de bal reikt, grijp je er misschien naast.

Het artikel betoogt dat veel huidige robotsystemen deze fout maken. Ze doen een voorspelling over hoe hun vingers zullen voelen aan het begin van een beweging, en houden dan vast aan dat plan, zelfs als het object begint te glijden. Tegen de tijd dat de robot beseft dat het object beweegt, is het te laat om de grip aan te passen. De voorspelling is "verouderd" (stale) geworden.

De Oplossing: ReTouch en het "Patch"-Systeem

De onderzoekers introduceerden ReTouch, een nieuw systeem dat dit oplost door twee hoofdzaken te doen: de tastgegevens beter organiseren en de voorspellingen constant bijwerken.

1. De Tactile Patch Encoder: Een Vingerkaart
Ten eerste verandert ReTouch de manier waarop de robot zijn tastsensoren "leest". De meeste robots gooien alle tastgegevens gewoon op een grote, rommelige hoop. ReTouch behandelt elke vinger echter als een kleine kaart. Het verdeelt het oppervlak van elke vinger in vijf specifieelijke "patches" (zoals de punt, het midden, de basis, de linkerzijde en de rechterzijde).

Denk hierbij aan een weerkaart. In plaats van alleen te zeggen "het regent," vertelt een weerkaart je precies waar het regent en hoe hard. ReTouch doet dit voor tast. Het vertelt de robot: "De punt van je wijsvinger drukt hard, maar de zijkant van je middelvinger raakt nauwelijks aan." Dit helpt de robot om minuscule, precieze aanpassingen te maken, zoals een mens die zijn grip op een gladde druif aanpast zonder deze te verpletteren.

2. De "Foresight" en "Hindsight" Experts
Het tweede, en belangrijkste deel, is hoe ReTouch de toekomst voorspelt. Het systeem gebruikt twee "experts" (AI-modellen) om van tast te leren:

  • De Hindsight Expert: Dit is de leraar. Tijdens de training kijkt deze naar de werkelijke toekomstige tastgegevens (wat er echt gebeurde) om te leren wat de robot had moeten voorspellen.
  • De Foresight Expert: Dit is de leerling. Deze probeert de toekomstige tast te voorspellen op basis van wat hij nu ziet.

Hier zit de magische truc: De Foresight Expert maakt niet slechts één voorspelling en houdt zich daaraan. Hij werkt op een superhoge snelheid (36 keer per seconde). Elke keer dat hij nieuwe tastgegevens krijgt van de vingers van de robot, zegt hij: "Wacht, mijn voorspelling zat er net naast. Laat me dit bijwerken!" Vervolgens gebruikt hij deze verse, bijgewerkte voorspelling om de volgende beweging van de robot te corrigeren.

Dit is als het spelen van een videogame waarbij je kunt pauzeren, de nieuwe positie van de vijand kunt bekijken en onmiddellijk je strategie kunt veranderen. Als het object glijdt, wacht de robot niet op de volgende "beurt"; hij berekent de grip onmiddellijk opnieuw en redt het object.

Wat Ze Vonden: Robots Die Geen Dingen Laten Vallen

Om dit te testen, bouwden de onderzoekers een echte robothand (genaamd XHand) bevestigd aan een robotarm (UR7e) en creëerden ze een nieuwe dataset genaamd XHT-Dataset. Ze namen 900 echte demonstraties op van robots die zeven verschillende lastige taken uitvoerden, zoals:

  • Op een knop van een pipet drukken.
  • Waterflessen van verschillende gewichten vastpakken.
  • Een whiteboard schoonvegen met een spons.
  • Een kastlade openen om een beker te pakken.

Ze vergeleken ReTouch met andere slimme robotsystemen. De resultaten waren indrukwekkend. Onder normale omstandigheden slaagde ReTouch 18,4% vaker dan de op één na beste robot. Onder "uitdagende" omstandigheden (waarbij de robot te maken kreeg met gladde objecten, verschillende hoogtes of zelfs iemand die het object wegtrok), slaagde ReTouch 23,8% vaker.

Bijvoorbeeld, in de taak "Liquid Transfer" (water verplaatsen van de ene container naar de andere), was ReTouch 19% beter dan de beste concurrent. In "Sponge Wipe" was het 25% beter. Het artikel suggereert dat deze grote verbeteringen komen doordat ReTouch "contact-rijke" taken kan afhandelen—taken waarbij de robot constant aanraakt, schuurt en zich aanpast aan het object.

Waarom Het Ertoe Doet

Het artikel laat zien dat het geven van een tastzin aan een robot niet alleen gaat over het toevoegen van sensoren; het gaat erom hoe de robot die informatie gebruikt. Als de robot alleen op tast reageert, is hij te traag. Als de robot de toekomst voorspelt maar de voorspelling niet bijwerkt, raakt hij in de war. ReTouch bewijst dat de beste manier om delicate, op tast zware taken te beheersen, is door tegelijkertijd te blijven voorspellen en te blijven corrigeren.

De onderzoekers ontdekten dat deze "online verfijning" (het bijwerken van de voorspelling tijdens de beweging) de sleutel is. Wanneer ze een versie van de robot testten die een voorspelling maakte en deze niet bijwerkte, daalde het succespercentage aanzienlijk. Dit suggereert dat als robots werkelijk taken zoals chirurgie, koken of het assembleren van elektronica willen beheersen, ze in staat moeten zijn om de toekomst te "voelen" en onmiddellijk van gedachten te veranderen wanneer de werkelijkheid verandert. ReTouch is een grote stap richting het geven van dat soort behendigheid aan robots.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →