← Nieuwste papers
💻 computer science

Asymmetric physics enables efficient learning in quadrupedal robot swarms

Dit artikel toont aan dat het benutten van asymmetrische fysica—het combineren van een hoogwaardige niet-differentieerbare simulator voor realistische contactdynamiek met differentieerbare surrogaatmodellen voor gradiëntgebaseerd leren—efficiënte end-to-end training mogelijk maakt van visie-gebaseerde, gedecentraliseerde controlebeleid voor grote zwermen viervoetige robots, waarbij robuuste zero-shot transfer naar real-world omgevingen wordt bereikt zonder expliciete communicatie of globale kaarten.

Oorspronkelijke auteurs: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zwerm van 500 vogels probeert te leren om door een dicht bos te vliegen zonder tegen bomen of elkaar aan te botsen. Als je ze één voor één zou proberen te onderwijzen, of als je ze een kaart en een centrale commandant zou geven, zou het traag, onhandig zijn en zou het in de echte wereld niet goed werken.

Dit artikel beschrijft een doorbraak in het aanleren van precies dat aan robotische honden (quadrupeds): om samen als een zwerm door rommelige, drukke omgevingen te bewegen met alleen hun eigen ogen, zonder met elkaar te communiceren of een leider te volgen.

Hier is de eenvoudige uitleg van hoe ze het hebben gedaan:

Het Probleem: De "Black Box" van Robotzwermen

Normaal gesproken trainen wetenschappers robots met behulp van Kunstmatige Intelligentie (specifiek Reinforcement Learning) via een methode die "trial and error" (vallen en opstaan) wordt genoemd. De robot probeert iets, botst op, leert dat het slecht was, en probeert het opnieuw.

  • Het probleem: Wanneer je slechts één robot hebt, is dit prima. Maar wanneer je honderden robots tegelijkertijd laat bewegen, wordt "trial and error" een nachtmerrie. De computer raakt overweldigd door de poging te begrijpen wat welke robot deed, en het leerproces is extreem traag en inefficiënt. Het is alsof je probeert te leren jongleren met 500 ballen door ze één voor één te laten vallen.

De Oplossing: De "Twee-Hersenen-Truc"

De onderzoekers bedachten een slimme manier om dit te versnellen met wat zij "Asymmetrische Fysica" noemen. Denk hierbij aan het geven van twee verschillende "hersenen" aan de robot voor twee verschillende taken:

  1. De "Realistische" Hersenen (voor het handelen): Wanneer de robots daadwerkelijk bewegen en met de omgeving interageren, gebruiken ze een supergedetailleerde, hoogwaardige simulator. Deze hersenen zien de wereld precies zoals die is: hobbelige grond, gras, botsingen en de complexe fysica van een hondendrang die de aarde raakt. Het is realistisch, maar te ingewikkeld om wiskundig te gebruiken voor het leerproces.
  2. De "Vereenvoudigende" Hersenen (voor het leren): Wanneer de computer moet uitzoeken hoe hij kan verbeteren, schakelt hij over naar een vereenvoudigde, "cartoonachtige" versie van de fysica. In plaats van elke spier en elke steen te simuleren, behandelt het de robots als eenvoudige bewegende stippen (voor navigatie) of starre blokken (voor beweging). Deze vereenvoudigde versie is vloeiend en gemakkelijk voor de computer om gradiënten te berekenen (de wiskunde die de robot vertelt hoe hij beter wordt).

De Analogie: Stel je een piloot voor die leert vliegen.

  • De Realist is de echte vluchtsimulator met wind, turbulentie en motorlawaai.
  • De Vereenvoudiger is een basis tekening op een whiteboard die het pad van het vliegtuig laat zien.
  • De piloot oefent in de realistische simulator (om het gevoel te krijgen), maar de instructeur gebruikt het whiteboard om snel uit te leggen waarom de piloot een fout maakte en hoe hij dit kan herstellen. Dit proces doet het algoritme automatisch: de robots "handelen" in de realistische wereld, maar "leren" van de vereenvoudigde wiskunde.

Wat Ze Hebben Bereikt

Met deze methode heeft het team één AI-policy getraind die tot wel 512 robotische honden tegelijkertijd kan aansturen in een simulatie.

Toen ze dit in de echte wereld testten met zes Unitree Go2 robotische honden, waren de resultaten verrassend. De robots hadden geen centrale commandant, geen wifi om met elkaar te praten en geen kaart van het gebied. Ze hadden alleen een camera op hun neus. Toch gedroegen ze zich als een gecoördineerde kudde dieren:

  • Rechts afwijken: Wanneer twee groepen robots elkaar frontaal tegenkwamen, weken ze vanzelf naar rechts om elkaar te passeren, net zoals auto's of mensen dat doen.
  • Voorspellende vermijding: Ze vertraagden of wachtten even voordat ze een nauwe opening inreden als ze een andere robot zagen aankomen, om een verkeersopstopping te voorkomen.
  • Muur volgen: Als ze vast kwamen te zitten of de weg niet konden zien, volgden ze vanzelf een muur totdat ze een opening vonden.
  • Crowd Flow: Ze konden door dichte bossen, smalle bruggen en doolhoven bewegen zonder tegen elkaar te botsen, ook al leerden ze dit volledig op eigen kracht.

Waarom Dit Belangrijk Is

Het artikel beweert dat dit de eerste keer is dat visueel leren (vision-based learning) zo goed heeft gewerkt voor zwermen met poten in zulke complexe, fysieke omgevingen.

De belangrijkste les is dat door het "realistische handelen" te scheiden van het "vereenvoudigde leren", ze een enorme, trage taak (het onderwijzen van 500 robots) hebben omgezet in een efficiënte taak. Ze hebben de robots niet geprogrammeerd om "rechts uit te wijken" of "te wachten op anderen". In plaats daarvan creëerden ze een trainingsomgeving waarin deze gedragingen vanzelf ontstonden, omdat dit de meest efficiënte manier was voor de robots om hun doelen te bereiken.

Kortom: Ze hebben een zwerm robotische honden geleerd om door een bos te dansen zonder choreograaf, met behulp van een truc waarmee ze snel kunnen leren door simpel te denken terwijl ze realistisch handelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →