← Nieuwste papers
💻 computer science

Sampling Strategies for Robust Universal Quadrupedal Locomotion Policies

Dit artikel onderzoekt en vergelijkt diverse strategieën voor het samengesteld samplen van gewrichtswinsten, inclusief prestatiegebaseerde filtering en uniforme randomisatie, om een enkele robuuste reinforcement learning-policy te trainen voor universele quadrupedeale locomotie die de sim-to-real kloof succesvol overbrugt door middel van zero-shot deployment op de ANYmal-robot.

Oorspronkelijke auteurs: David Rytz, Kim Tien Ly, Ioannis Havoutis

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: David Rytz, Kim Tien Ly, Ioannis Havoutis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een hond probeert te leren lopen. Als je alleen een piepkleine Chihuahua traint, zal hij niet weten hoe hij moet lopen als een Deense Dog. Als je alleen een Deense Dog traint, kan hij over zijn eigen poten struikelen als je hem plotseling zou verkleinen.

Dit artikel gaat over het aanleren van het lopen aan een computerbrein (een AI) voor viervoetige robots van allerlei verschillende vormen en maten, zonder dat je het computerbrein telkens opnieuw hoeft te trainen wanneer je van robot wisselt.

Hier is de uiteenzetting van hun ontdekking, gebruikmakend van eenvoudige analogieën:

Het Probleen: De "One-Size-Fits-None" Valstrik

De meeste robotcontrollers zijn als maatpakken. Als je een controller ontwerpt voor een specifieke robot (bijvoorbeeld een robot van 12 kg), werkt deze geweldig. Maar als je diezelfde "pak" probeert aan een zwaardere robot te geven (zoals een robot van 50 kg), valt het uit elkaar.

Om dit op te lossen, gebruiken wetenschappers meestal Reinforcement Learning (RL). Denk hierbij aan het trainen van een videogamepersonage door het duizenden keren te laten falen totdat het de juiste bewegingen leert. Het probleem is: als je het personage alleen traint op één specifief lichaamstype, raakt het in de war wanneer je het een nieuw lichaam geeft.

De Oplossing: De "Gymles" Strategie

De auteurs realiseerden zich dat om een robot te maken die op elk lichaam kan lopen, je hem moet trainen in een "gymles" waar de robots constant van gewicht, beenlengte en spierkracht veranderen.

Er was echter een addertje onder het gras: Hoe verander je deze instellingen?

Als je gewoon willekeurige instellingen kiest (zoals met dobbelstenen gooien), kun je per ongeluk een robot "super-spieren" geven die te sterk zijn voor zijn gewrichten, of "zwakke spieren" die hem niet kunnen voortbewegen. Dit is alsof je een student vertelt een marathon te rennen met schoenen die ofwel van lood zijn gemaakt, of van gelei. Dat zal niet werken.

De Drie Strategieën die ze Testten

Het team vergeleken drie manieren om de instellingen van de robot te "mixen" tijdens de training:

  1. De "Wiskundige Formule" Aanpak: Ze probeerden de juiste spierkracht te raden op basis van het gewicht van de robot met behulp van een eenvoudige wiskundige lijn (zoals "zwaardere robot = sterkere spieren").
    • Resultaat: Het werkte redelijk voor kleine robots, maar faalde jammerlijk voor grote robots. De wiskundige formule suggereerde spiersterktes die te agressief waren, waardoor de robot heftig begon te schudden of kapotging.
  2. De "Totaal Willekeurige" Aanpak: Ze kozen gewoon willekeurige getallen voor alles.
    • Resultaat: Dit was beter, maar soms kreeg de robot een "slechte worp" met de dobbelstenen waarbij de instellingen onmogelijk te leren waren.
  3. De "Slimme Coach" Aanpak (Hun Winnaar): Dit is hun nieuwe methode. Stel je een coach voor die de student observeert.
    • Als de student moeite heeft, zegt de coach: "Oké, laten we het gewicht iets lichter maken zodat je het gevoel krijgt."
    • Als de student het geweldig doet, zegt de coach: "Oké, laten we het een beetje moeilijker maken om te zien hoe ver je kunt gaan."
    • Ze gebruikten ook een techniek genaamd een Particle Filter. Denk hierbij aan het bijhouden van een lijst met de "beste oefensessies". Als een bepaalde combinatie van gewicht en spierkracht goed werkte, onthoudt de coach dit en probeert hij variaties van die specifieke opstelling, in plaats van telkens vanaf nul te beginnen.

De Grote Ontdekking: "Spier"-instellingen Doen Er Het Meest Toe

De meest verrassende bevinding ging over de PD Gains. In robottaal is dit in feite de "stijfheid" of de "reflex" van de gewrichten van de robot.

  • Oude methoden probeerden deze reflexen te berekenen op basis van het gewicht. Het paper vond dit gevaarlijk. Het gaf de robot vaak de instructie om zo "stijf" te zijn dat hij zijn gewrichten tegen de grond zou slaan, wat lawaai en potentiële schade veroorzaakte.
  • Hun methode besefte dat om een robot robuust (taai) te maken, je hem moet trainen met extreem verschillende reflex-instellingen. Je moet hem leren lopen met "gelei-benen" en "stalen benen", zodat hij er niet om geeft hoe zijn benen aanvoelen wanneer hij de echte wereld in gaat.

De Test in de Praktijk

Ze namen hun AI, die alleen simulaties (videogames) had gezien, en plaatsten deze op een echte robot genaamd ANYmal (die 50 kg weegt).

  • Het Resultaat: De robot liep perfect.
  • De "Zero-Shot" Magie: Ze hebben de robot niet verteld: "Hé, jij bent nu een 50 kg zware robot." De robot heeft tijdens de training nog nooit een 50 kg zware robot gezien. Hij wist simpelweg hoe hij moest lopen omdat hij getraind was op elke mogelijke variatie van een robot.
  • De Bonus: Ze zetten zelfs een rugzak van 13 kg op de robot (waardoor hij zwaarder werd dan de fabrieksopgave), en hij liep nog steeds zonder om te vallen.

Samenvatting

Het paper stelt dat om een universele robotloper te bouren, je niet simpelweg een wiskundige formule kunt gebruiken om de "spieren" van de robot aan te passen. In plaats daarvan heb je een slim, adaptief trainingssysteem nodig dat constant de moeilijkheidsgraad aanpast en onthoudt wat het beste werkte. Dit stelt één enkel AI-brein in staat om een kleine robot, een reusachtige robot of een robot die een zware last draagt aan te sturen, allemaal zonder dat er opnieuw getraind hoeft te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →