← Nieuwste papers
💻 computer science

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

Dit artikel stelt een geïntegreerd reinforcement learning-framework voor dat een temporele diepte-encoder in een beleid inbedt om een humanoïde robot in staat te stellen robuust, visie-gebaseerd voetballen met de bal te leren tegen statische en dynamische tegenstanders direct vanuit onboard diepte-observaties, waarbij hoge succespercentages worden behaald zonder te vertrouwen op expliciete staatsschatting of geprivilegieerde informatie.

Oorspronkelijke auteurs: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

Gepubliceerd 2026-07-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robotvoetballer voor die probeert een bal naar beneden te dribbelen over een veld, terwijl hij een hoogtechnologische bril draagt. Stel je nu voor dat deze robot, in plaats van een supercomputer in zijn hoofd te hebben die de exacte snelheid en positie van de bal en zijn tegenstanders kent, alles moet uitzoeken door simpelweg te kijken naar een videofeed van zijn eigen ogen, terwijl hij ook nog eens probeert niet om te vallen. Dat is de wilde uitdaging waar dit artikel over gaat.

De onderzoekers bouwden een systeem waarbij een humanoïde robot leert om een voetbal te dribbelen door "zien" en "bewegen" samen te smelten tot één groot brein. Normaal gesproken zijn robots gebouwd als een estafette: één team detecteert de bal, geeft de informatie door aan een tweede team dat het pad plant, en een derde team beweegt de benen. Maar de auteurs stellen dat deze ouderwetse methode is als proberen een auto te besturen terwijl je alleen kijkt naar een kaart die door iemand anders is getekend; als de kaart een klein beetje fout is of als de bal een fractie van een seconde uit het zicht verdwijnt, rijdt de bestuurder tegen de vlakste bumper. In plaats daarvan leerden ze de robot om perceptie en controle samen te leren, zoals een mens die leert fietsen door het evenwicht te voelen in plaats van de fysica van elke wiebel te berekenen.

Om deze robot te leren, gebruikten ze een slim twee-stappen trainingskamp. Eerst lieten ze de robot oefenen in een videogame-simulatie waarin hij over "cheat codes" beschikte (genaamd geprivilegieerde informatie). Hij wist precies waar de bal en eventuele vijanden waren, zelfs als ze achter een muur stonden. De robot leerde perfect dribbelen in deze cheat-modus, waarbij hij meester werd in het dicht bij de bal houden en het ontwijken van obstakels. Vervolgens, in de tweede fase, namen ze de cheat codes af. Ze trainden een speciale "visie-encoder" — denk aan een student die als tutor optreedt — om naar dezelfde dieptecamera-video te kijken als die de robot in de echte wereld zou zien, en te raden wat de "cheat code" getallen zouden zijn geweest. Het brein van de robot gebruikte deze gissingen vervolgens om beslissingen te nemen, waardoor hij effectief leerde het spel te spelen met alleen zijn ogen.

De resultaten van deze training waren indrukwekkend, maar met enkele zeer specifieke beperkingen. Wanneer de robot op een leeg veld speelde zonder dat iemand de bal probeerde te stelen, was hij een perfecte ster en slaagde hij 100% van de tijd. Wanneer ze een enkel, stilstaand obstakel toevoegden (zoals een pion of een muur) in zijn pad, deed hij het nog steeds fantastisch, met een succespercentage van 96%, waarbij hij er slechts een klein beetje langer over deed om het doel te bereiken.

Echter, het verhaal verandigt wanneer de robot een bewegende tegenstander te vrezen krijgt. Wanneer een tweede robot werd geprogrammeerd om de bal te achtervolgen en te proberen de bal weg te slaan, daalde het succespercentage naar 46%. In deze simulaties viel de robot vaker om of verloor hij de bal, en hij botste 68% van de tijd tegen de tegenstander op. De auteurs suggereren dat hoewel de robot geweldig is in het zelfstandig zien en bewegen, de echte uitdaging ligt in het reageren op een levende, bewegende tegenstander die actief probeert te interfereren. De ogen van de robot werkten prima — hij kon de bal en de tegenstander nog steeds redelijk goed zien — maar het "brein" moest nog leren hoe het een bewegend doelwit kon ontwijken zonder om te vallen, wat nog een werk in uitvoering is.

Het is belangrijk om te onthouden dat dit alles plaatsvond binnen een computersimulatie met behulp van een specifiek robotmodel genaamd de Booster T1. De auteurs benadrukken dat dit een sterk fundament is voor de toekomst, maar ze hebben het nog niet getest op een echte robot op een echt veld. Ze stellen voor dat deze methode om robots te leren vanuit videofeeds terwijl ze hun evenwicht bewaren een veelbelovend pad vooruit is, maar voor nu is de robot nog steeds een zeer getalenteerde student in een virtuele klaslokaal, nog niet klaar voor het WK.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →