← Nieuwste papers
💻 computer science

CycleRL: Sim-to-Real Deep Reinforcement Learning for Robust Autonomous Bicycle Control

Dit artikel presenteert CycleRL, een sim-to-real deep reinforcement learning-framework dat Proximal Policy Optimization en domain randomization binnen NVIDIA Isaac Sim gebruikt om robuuste, hoogwaardige autonome fietsbesturing te bereiken die succesvol van simulatie naar fysieke hardware wordt overgedragen.

Oorspronkelijke auteurs: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een peuter probeert te leren fietsen. Als je de complexe natuurkunde van balans, wrijving en momentum probeert uit te leggen met behulp van een tekstboek, zal de peuter waarschijnlijk in de war raken en vallen. Dat is in essentie het probleem waar ingenieurs tegenaan lopen bij traditionele robotfietsen. Ze proberen een perfect "tekstboek" (model) te schrijven over hoe de fiets zich zou moeten gedragen, maar de echte wereld is chaotisch, en die tekstboeken falen vaak wanneer de wind waait of de weg hobbelig wordt.

Dit artikel introduceert CycleRL, een nieuwe manier om een robotfiets zichzelf te laten leren fietsen. In plaats van de fiets een tekstboek te geven, laten de onderzoekers het een door middel van vallen en opstaan leren, net als een menselijk kind, maar dan met bovennatuurlijke snelheid.

Zo hebben ze het gedaan, onderverdeeld in eenvoudige concepten:

1. De "Virtuele Speeltuin" (Simulatie)

Je kunt een robot niet leren fietsen door hem een miljoen keer een echte fiets te laten crashen; de fiets zou kapotgaan en de robot zou te langzaam leren.

  • De Analogie: Denk aan dit als een videogame. De onderzoekers bouwden een superrealistische virtuele wereld (met behulp van NVIDIA Isaac Sim) waarin ze een digitale tweeling van een fiets maakten.
  • Het Proces: In deze videogame probeert de AI-"peuter" om te fietsen. Elke keer dat het valt, krijgt het een "game over". Elke keer dat het rechtop blijft en een pad volgt, krijgt het punten.
  • Het Leren: De AI gebruikt een methode genaamd Deep Reinforcement Learning. Het is als een hond die trucjes leert: als het het juiste doet (in balans blijft), krijgt het een beloning (punten). Als het valt, krijgt het geen beloning. Na miljoenen pogingen in het spel ontdeft de AI precies hoe het het stuur moet draaien en het gewicht moet verplaatsen om rechtop te blijven.

2. Het "Trainingsregime" (Domain Randomization)

Een groot probleem met videogames is dat wat je in de game leert, niet altijd werkt in het echte leven. Misschien is het virtuele gras te glad, of de virtuele wind te sterk.

  • De Analogie: Stel je voor dat je een voetballer traint op een perfect vlak, droog veld. Wanneer hij een echte wedstrijd speelt op een regenachtig, modderig veld, kan hij uitglijden.
  • De Oplossing: Om dit op te lossen, gebruikten de onderzoekers een techniek genoemd Domain Randomization. Ze lieten de AI niet alleen oefenen op één perfect veld. Ze maakten de virtuele wereld chaotisch en onvoorspelbaar:
    • Soms was de fiets zwaar; soms was hij licht.
    • Soms waren de banden plakkerig; soms waren ze glad.
    • Soms waaide de wind hard; soms was de weg hobbelig.
    • Soms begon de fiets met een lichte wiebel.
  • Het Resultaat: Door de AI te dwingen om te leren fietsen in elke mogelijke vreemde scenario, werd de AI zo robuust dat het, toen hij eindelijk op een echte fiets stapte, niet meer uitmaakte wat de verschillen waren. Het had het in de simulatie al "allemaal gezien".

3. Het "Scorekaart" (Reward Function)

Hoe vertelden de onderzoekers de AI wat "goed" fietsen was? Ze creëerden een complexe scorekaart met vijf verschillende regels:

  1. Blijf in leven: Val niet om (Survival Reward).
  2. Ga snel: Match de snelheid die je is opgegeven (Velocity Reward).
  3. Ga rechtuit: Volg de richting die je is opgegeven (Heading Reward).
  4. Niet rukken: Beweeg het stuur vloeiend, niet wild (Action Penalty).
  5. Wees efficiënt: Gebruik niet te veel energie (Action Magnitude Penalty).

De AI moest al deze regels tegelijkertijd balanceren, waarbij het leerde dat omvallen het slechtste resultaat was, maar ook dat vloeiend rijden beter is dan onvoorspelbaar rijden.

4. De "Realiteitstest" (Sim-to-Real)

Nadat de AI de virtuele wereld onder de knie had gekregen, plaatsten ze hem op een echte, fysieke fiets gebouwd in hun laboratorium.

  • De Hardware: Ze bouwden een aangepaste fiets met een computerbrein (NVIDIA Jetson), sensoren om de balans te voelen (IMU) en motoren om te sturen en aan te drijven.
  • Het Resultaat: De AI, die nog nooit een echte fiets had aangeraakt, stapte op en begon te fietsen. Het slaagde erin om in evenwicht te blijven, paden te volgen en verschillende terreinen zoals grind en hellingen aan te kunnen.
  • De Statistieken: In de simulatie bleef het 99,9% van de tijd rechtop. Op de echte fiets bleef het 95% van de tijd rechtop. Het kon zelfs herstellen nadat het werd omgeduwd, net als een ervaren menselijke fietser.

Waarom dit ertoe doet

Traditionele methoden proberen het fiets-probleem op te lossen met rigide wiskundige formules. Als de wiskunde een klein beetje fout is, crasht de fiets.
CycleRL is anders. Het is also kind een fietser te leren door hem te laten oefenen in een chaotische, voortdurend veranderende hindernisbaan totdat hij een expert wordt. Omdat het leerde door ervaring in plaats van door rigide regels, is het veel beter in het omgaan met de onvoorspelbare aard van de echte wereld.

Kortom: De onderzoekers leerden een robot fietsen door hem miljoenen keren een chaotische videogame te laten spelen, waardoor hij zo sterk werd dat hij bij de eerste poging een echte fiets perfect kon berijden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →