← Nieuwste papers
💻 computer science

ContactMimic: Humanoid Object Interaction via Contact Control

ContactMimic is een leerkader dat mensachtige objectinteractie verbetert door binaire contactcommando's expliciet bij te houden naast trajecten van sleutelpunten, wat precieze fysieke contact en contactcontrole op aanvraag mogelijk maakt over diverse manipulatietaken heen.

Oorspronkelijke auteurs: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Gepubliceerd 2026-07-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert dansen. Lange tijd was de beste manier om dit te doen een robot een video van een menselijke danser geven en zeggen: "Kopieer deze exacte lichaamshoudingen." De robot bewoog zijn gewrichten om de heupen, ellebogen en knieën van de mens perfect te evenaren.

Maar dit is het probleem: Alleen de vorm van de dans kopiëren is niet genoeg.

Als een menselijke danser met zijn hand nabij een whiteboard zwaait, is hij gewoon aan het zwaaien. Als hij zijn hand tegen het whiteboard drukt, is hij het aan het afnemen. Als een robot alleen naar de positie van de hand kijkt, kan hij vlak naast het bord zwaaien en denken dat hij het geweldig doet, terwijl hij eigenlijk niets heeft schoongemaakt. Het is alsof je een deur probeert te openen door er vlak naast te staan zonder ooit de klink aan te raken.

Dit is het grote idee achter een nieuw project genaamd CONTACTMIMIC. De onderzoekers ontdekten dat om een robot echt nuttig te maken voor taken zoals zitten, afnemen of meubels duwen, je hem niet alleen kunt vertellen waar hij moet zijn; je moet hem ook vertellen of hij dingen moet aanraken.

De "Magische Schakelaar" voor Aanraking

Het team bouwde een systeem waarbij ze de robot, in plaats van alleen een pad te geven dat hij moet volgen, een schakelaar geven. Deze schakelaar is een simpel "Ja/Nee"-label voor elk deel van het lichaam van de robot.

  • Schakelaar AAN (Contact ✔): "Oké robot, ik wil dat je je hand tegen dat whiteboard drukt."
  • Schakelaar UIT (Contact ✘): "Oké robot, beweeg je hand naar exact dezelfde plek, maar raak het bord niet aan. Zweef er alleen maar boven."

In hun tests lieten ze zien dat de robot met deze schakelaar exact dezelfde dansbewegingen kon uitvoeren, maar zijn gedrag volledig kon veranderen. Hij kon in een stoel zitten en achterover leunen, of in dezelfde stoel zitten en rechtop blijven zitten zonder de rugleuning aan te raken. Hij kon een doos oppakken, of gewoon zijn handen in de vorm van het vasthouden van een doos houden zonder deze daadwerkelijk op te tillen.

Waarom was dit zo moeilijk?

Je zou kunnen denken: "Waarom leren we de robot niet gewoon om dingen op natuurlijke wijze aan te raken?" De onderzoekers ontdekten een verraderlijke valstrik in de data.

Wanneer mensen met objecten interageren, zijn hun lichaamshoudingen en hun aanrakingen meestal aan elkaar gekoppeld. Als een mens in een stoel zit, raakt zijn achterwerk altijd de zitting aan. Als een mens een bord afneemt, raakt zijn hand altijd het oppervlak aan. Hierdoor leert een robot, als je hem duizenden video's van mensen die zitten laat zien: "Oh, als de heupen in deze positie zijn, dan moet de billen wel de stoel aanraken." De robot stopt dan met luisteren naar het "aanraak"-commando omdat hij denkt dat de positie het hele verhaal vertelt.

Om dit op te lossen, moest het team creatief worden. Ze namen hun trainingsdata en begonnen de regels te breken:

  1. Het "Spook"-object: Ze namen een video van iemand die een bord afneemt, maar ze zeiden tegen de robot: "Het bord is er niet." De robot moest leren om zijn hand naar de plek van het bord te bewegen zonder iets aan te raken.
  2. Het "Opgeblazen" object: Ze maakten de objecten in de simulatie groter (zoals het opblazen van een ballon), zodat de robot zijn hand om het object heen moest bewegen om het te vermijden, zelfs toen het "aanraak"-commando zei dat hij het moest aanraken.
  3. De "Nep" aanraking: Ze namen een video waarin de robot zou moeten aanraken, maar ze zeiden tegen hem: "Raak niet aan," en vice versa.

Door dit door elkaar te mengen, dwongen ze de robot om niet meer te gokken op basis van positie, maar om daadwerkelijk te luisteren naar de "aanraak"-schakelaar.

Werkte het?

Het team testte dit op een echte robot genaamd de Unitree G1 (een humanoïde met 29 gewrichten) en in een computersimulatie.

  • In de Simulatie: Ze voerden 10 verschillende taken uit, zoals een stoel schoppen, op een stoel stappen en een doos oppakken. Wanneer ze de schakelaar naar "Contact" zetten, maakte de robot contact. Wanneer ze de schakelaar naar "Geen Contact" zetten, raakte hij niets aan. De robot kon zelfs een doos optillen door simpelweg te worden verteld om de doos aan te raken, zonder dat er speciale "til de doos op"-instructies nodig waren.
  • In de Wereld: Ze testten vijf echte bewegingen, waaronder het afnemen van een whiteboard en het leunen tegen een stoelrug.
    • Wanneer de opdracht afnemen was, drukte de hand van de robot hard genoeg om een zichtbare afdruk op het bord achter te laten.
    • Wanneer de opdracht zweven was, bewoog de hand naar dezelfde plek maar liet geen spoor achter op het bord.
    • Wanneer de opdracht leunen was, rustte de robot zijn gewicht op de rugleuning van de stoel. Wanneer de opdracht niet leunen was, bleef de robot rechtop staan en hield hij zijn evenwicht zelfstandig.

De resultaten waren indrukwekkend. In de echte wereld slaagde de robot erin de contactopdracht ongeveer 90% tot 100% van de tijd te volgen voor de meeste taken (bijvoorbeeld 9 van de 10 keer voor leunen tegen een rugleuning, en 5 van de 5 keer voor het afnemen van het bord).

Wat het (nog) niet kan

Het artikel is zeer duidelijk over wat dit niet is.

  • Het is geen "universele" robot die elke taak met één brein kan uitvoeren. De onderzoekers trainden een apart "brein" (policy) voor elke specifieke beweging. Ze hebben nog niet ontdekt hoe ze één enkele robot kunnen maken die al deze dingen tegelijk kan doen.
  • Het is afhankelijk van hoogwaardige video's van mensen die met objecten interageren. Ze gebruikten geen willekeurige video's van het internet; ze gebruikten een specifieke dataset genaamd HUMOTO.
  • Ze gebruikten geen speciale aanraaksensoren op de huid van de robot. In plaats daarvan ontdekte de robot of hij iets aanraakte door simpelweg zijn eigen spieren en gewrichten te voelen (proprioceptie). Ze bewezen dat dit werkt door te laten zien dat als je een simpel computerprogramma zou vragen om te raden "Raakt de robot iets aan?" op basis van de interne gevoelens van de robot, het bijna altijd juist was (met F1-scores rond de 0,90 tot 0,99 voor de meeste taken).

De Kern van het Verhaal

Het artikel suggereert dat als je wilt dat een robot nuttige, fysieke taken uitvoert, je moet stoppen met alleen vertellen waar hij heen moet gaan. Je moet hem expliciet vertellen of hij moet aanraken. Door de link tussen "positie" en "aanraking" tijdens de training te verbreken, leerden ze de robot om te luisteren naar een simpele schakelaar. Het is een stap richting robots die niet alleen lijken alsof ze een taak uitvoeren, maar die de taak ook daadwerkelijk uitvoeren door het juiste fysieke contact te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →