← Nieuwste papers
💻 computer science

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

Het artikel presenteert OMG, een schaalbaar, op diffusie gebaseerd framework voor generalistische humanoïde besturing dat een hiërarchische architectuur combineert met een zorgvuldig samengestelde dataset om state-of-the-art, omni-modale whole-body bewegingsgeneratie mogelijk te maken die geconditioneerd is op taal, audio en referentiebewegingen.

Oorspronkelijke auteurs: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Brein en een Cerebellum voor Robots

Stel je een humanoïde robot voor (zoals de Unitree G1 die in dit onderzoek wordt gebruikt) die probeert te leren dansen, lopen of zwaaien. Traditioneel moesten ingenieurs de robot één specifieke vaardigheid tegelijk aanleren, zoals het aanleren van een hond om te zitten of te blijven zitten. Als je wilde dat de robot iets nieuws deed, moest je vaak weer helemaal opnieuw beginnen of complexe regels schrijven.

De auteurs van dit artikel stellen een andere aanpak voor, geïnspireerd door hoe het menselijk lichaam werkt. Ze splitsen het controlesysteem van de robot op in twee delen:

  1. Het Brein (OMG-DiT): Dit is de "planner". Het neemt hoogwaardige ideeën aan (zoals "zwaai met je handen" of muziek die speelt) en bepaalt wat de robot nu moet doen.
  2. Het Cerebellum (Motion Tracker): Dit is het "spiergeheugen". Het neemt het plan van het Brein en zorgt ervoor dat de gewrichten van de robot daadwerkelijk soepel bewegen en dat de robot niet omvalt.

Het onderzoek richt zich op het bouwen van een veel slimmer "Brein" dat tegelijkertijd vele verschillende soorten instructies kan begrijpen.

Het Probleem: Te Veel Dialecten, Te Weinig Data

Vóór dit artikel was de bewegingsdata van robots als een bibliotheek met boeken geschreven in verschillende talen, waarvan sommige pagina's misten en andere gewoon krabbels waren.

  • Sommige data hadden tekstuele beschrijvingen.
  • Sommige hadden muziek.
  • Sommige hadden video van dansende mensen.
  • Geen van deze data stond in een format dat de robot daadwerkelijk kon gebruiken.

Om dit op te lossen, creëerde het team OMG-Data. Beschouw dit als een enorm vertaal- en redactieproject. Ze verzamelden meer dan 1.000 uur aan bewegingsdata uit diverse bronnen, ruimden het op en vertaalden alles naar de "taal" van hun specifieke robot (de Unitree G1). Ze gebruikten zelfs een fysica-simulator om elke beweging te controleren, zodat de robot niet zou struikelen of zijn eigen gewrichten zou breken tijdens het uitvoeren ervan.

De Oplossing: De "Omni-Modale" Generator

De kern van hun systeem wordt OMG-DiT genoemd. Je kunt dit zien als een universele vertaler en creatief directeur in één.

Hoe het werkt:
Stel je voor dat je op een feestje bent.

  • Tekst-input: Iemand roept: "Loop naar voren!" Het Brein begrijpt dit en plant een looproute.
  • Audio-input: Iemand speelt een hiphop-beat. Het Brein hoort het ritme en plant een dans die bij de beat past.
  • Visuele input: Iemand zwaait met de armen. Het Brein kijkt toe en plant het kopiëren van die zwaai.
  • Combinatie-input: Iemand zegt "Dans op dit ritme!" terwijl er muziek speelt. Het Brein combineert de betekenis van de woorden met het ritme van de muziek om een unieke dans te creëren.

De magie van OMG is dat het niet opnieuw getraind hoeft te worden voor elke nieuwe soort instructie. Het gebruikt een "shared backbone" (een centrale neurale netwerk) die de algemene regels van hoe een robot beweegt al heeft geleerd. Wanneer je het een nieuw type instructie geeft (zoals een nieuwe sensor of een nieuwe taal), voegt het gewoon een kleine, lichtgewicht "adapter" toe om die nieuwe input met het bestaande brein te verbinden.

Belangrijke Prestaties (Wat ze hebben bewezen)

  1. Het is een "Foundation Model": Net zoals grote taalmodellen (LLM's) essays, code en gedichten kunnen schrijven omdat ze hebben geleerd van enorme hoeveelheden tekst, heeft dit model geleerd van enorme hoeveelheden bewegingsdata. Hierdoor kan het nieuwe taken aan met zeer weinig extra training.

    • Analogie: Als je een mens leert fietsen, kan diegene veel sneller leren skateboarden dan iemand die nog nooit iets heeft gereden. Deze robot doet hetzelfde.
  2. Zero-Shot Composition: Het model kan instructies combineren die het nog nooit samen heeft gezien.

    • Voorbeeld: Als het getraind is om te lopen op tekstcommando's en te dansen op muziek afzonderlijk, kan het succesvol de opdracht volgen om "naar voren te lopen" terwijl het danst op een specif ofiek nummer, zelfs als het die exacte combinatie nooit tijdens de training heeft gezien.
  3. Uitvoering in de echte wereld: Ze hebben dit niet alleen gesimuleerd op een computer. Ze hebben het systeem op een echte Unitree G1 robot geplaatst. De robot kon naar audio luisteren, tekst lezen of een mens observeren, en direct in real-time beginnen te bewegen zonder om te vallen.

De Resultaten in Simpel Nederlands

  • Betere Kwaliteit: Wanneer gevraagd werd om te bewegen op basis van tekst of muziek, bewoog hun robot natuurlijker en nauwkeuriger dan eerdere methoden.
  • Snellere Adaptatie: Toen ze probeerden de robot een nieuwe vaardigheid aan te leren (zoals het volgen van een specifieke hand-tracking sensor genaamd "Pico"), leerde het vooraf getrainde model dit binnen minuten met zeer weinig data, terwijl een model dat vanaf nul getraind werd moeite had en veel meer data nodig had.
  • Schaalbaarheid: Ze ontdekten dat het groter maken van het "Brein" (het toevoegen van meer rekenkracht) de robot beter liet bewegen, wat suggereert dat deze aanpak steeds slimmer kan worden naarmate we meer data en kracht toevoegen.

Samenvatting

Het artikel presenteert OMG, een systeem dat humanoïde robots een "generalistisch brein" geeft. In plaats van elke beweging hard te coderen, leert de robot een universele taal van beweging van meer dan 1.000 uur aan data. Hierdoor kan de robot instructies aannemen via tekst, audio of menselijke beweging, deze combineren en direct veilige, fysieke bewegingen genereren die een echte robot kan uitvoeren. Het is een stap richting robots die de wereld net zo flexibel kunnen begrijpen en erop kunnen reageren als mensen dat doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →