← Nieuwste papers
💻 computer science

Optimization of sim-to-real transfer in the humanoid robot NICO

Dit artikel presenteert een nieuwe, goedkope sim-to-real graspingspipeline voor de humanoïde robot NICO die YOLO-gebaseerde detectie, stereovisie-lokalisatie en visuele feedback combineert om hoge succespercentages te bereiken bij het grijpen van objecten op tafel zonder afhankelijk te zijn van dure externe trackersystemen.

Oorspronkelijke auteurs: Juraj Gavura, Igor Farkaš

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Juraj Gavura, Igor Farkaš

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots lijken op enthousiaste studenten die proberen een nieuwe sport te leren. Ze zijn briljant in het oefenen in een videogame, waar de natuurkunde perfect is, de belichting ideaal en er nooit iets kapot gaat. Maar wanneer je diezelfde robot vraagt om uit het spel te stappen en de echte wereld in te gaan, wordt het een rommeltje. De echte wereld heeft wankele gewrichten, licht wazige camera's en zwaartekracht die zich niet altijd precies gedraagt zoals de wiskunde in de code. Deze kloof tussen de perfecte digitale oefening en het rommelige echte spel wordt de "sim-to-real" kloof genoemd. Het is de reden waarom een robot er in een simulatie misschien uitziet als een gracieuze danser, maar over zijn eigen voeten struikelt wanneer hij probeert een kopje koffie op te pakken. Wetenschappers zijn geobsedeerd door het dichten van deze kloof, want als robots niet betrouwbaar dingen kunnen oppakken in de echte wereld, kunnen ze ons niet helpen met huishoudelijke taken, het bouwen van dingen of het veilig omgaan met mensen. De grote vraag is: hoe leren we een robot om zijn ogen en zijn spieren te vertrouwen wanneer de wereld niet overeenkomt met zijn trainingshandleiding?

Dit artikel vertelt het verhaal van een humanoïde robot genaamd NICO (wat staat voor Neuro-Inspired COmpanion) en haar zoektocht naar het beheersen van de kunst van het oppakken van een pluchen tomaat van een tafel. De onderzoekers, Juraj Gavura en Igor Farkaš, stuitten op een lastig probleem: hoewel ze NICO al hadden geleerd om met hoge precisie specifieke punten op een scherm aan te raken, is het oppakken van een object veel moeilijker. Het vereist dat de robot het object ziet, precies uitzoekt waar het zich in de 3D-ruimte bevindt, en dan zijn hand beweegt om het te grijpen zonder het omver te stoten. Het team wilde zien of hun oude "touchscreen-trainingsmethode" NICO kon helpen om dingen te grijpen, of dat ze een nieuwe truc nodig hadden.

Ze probeerden twee hoofdstrategieën. De eerste was om gebruik te maken van het "spiergeheugen" van de robot uit de touchscreen-training. Ze gebruikten een computermodel om te voorspellen hoeveel ze de hand van de robot moesten bijsturen om de onhandigheid in de echte wereld te compenseren. Denk hierbij aan een coach die een speler vertelt: "Wanneer je op de linkerhoek mikt, mik dan eigenlijk twee inch naar rechts, omdat je arm die kant op trekt." Ze testten drie verschillende versies van deze coach, van een eenvoudige vuistregel tot een complex neuraal netwerk (een type AI-brein). De resultaten waren een verhaal van twee werelden: binnen het specifieke gebied waar de robot had geoefend, was de complexe AI-coach een superster en hielp hij NICO om de tomaat in 96,7% van de gevallen succesvol te grijpen. Echter, zodra de robot buiten die vertrouwde zone stapte, begon de AI-coach wild te gokken en daalde het succespercentage aanzienlijk. Het bleek dat het "spiergeheugen" van de robot niet goed generaliseerde naar nieuwe delen van de tafel.

De tweede strategie was meer als een spelletje "warm of koud" met de eigen ogen van de robot. In plaats van te vertrouwen op een vooraf berekende kaart, gaven ze NICO een visuele feedbackloop. De robot bewoog zijn hand in de buurt van de tomaat, keek naar waar zijn hand zich daadwerkelijk bevond, en maakte vervolgens kleine aanpassingen om hem perfect uit te lijnen voordat hij greep. Het is alsoos dat je een draad door een naald probeert te rijgen terwijl je in een spiegel kijkt; je blijft de draad bewegen totdat deze uitgelijnd is met het oog. Deze aanpak had geen vooraf getrainde kaart van de tafel nodig. Het werkte verrassend goed over de gehele werkruimte en behaalde een algeheel succespercentage van 72,7%. Sterker nog, wanneer de ogen van de robot perfect werkten en hij zijn hand duidelijk kon zien, bereikte deze methode een succespercentage van 94,1%.

Het artikel suggereert dat hoewel de "spiergeheugen"-kalibratie ongelooflijk precies is in het gebied waar het getraind is, de "visuele feedback"-methode robuuster en aanpasbaarder is voor de hele tafel. De onderzoekers ontdekten dat de belangrijkste factor die de visuele feedback tegenhield niet het brein van de robot was, maar zijn ogen: soms raakten de stereocamera's van de robot in de war door de achtergrond en konden ze niet precies bepalen waar de hand zich bevond. Maar wanneer de ogen werkten, kon de robot de tomaat bijna elke keer grijpen. Uiteindelijk laat de studie zien dat je geen dure, hoogtechnologische 3D-camera's of motion capture-pakken nodig hebt om een robot te leren hoe hij dingen moet oppakken; een slimme combinatie van goedkope camera's, een beetje kalibratie en een visuele feedbackloop kan de klus klaren. De auteurs concluderen dat hoewel de kalibratiemethode de kampioen is op zijn eigen terrein, de visuele feedback-aanpak de betere allrounder is voor de rommelige, onvoorspelbare echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →