← Nieuwste papers
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART is een zelfgesuperviseerd framework dat diffusie-gebaseerde trajectgeneratie combineert met reinforcement learning om humanoïde robots diverse loco-manipulatievaardigheden te laten leren uit schaarse demonstraties door automatisch de doelruimte te verkennen met minimale expert-supervisie.

Oorspronkelijke auteurs: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een humanoïde robot leert om complexe taken uit te voeren, zoals het oppakken van een doos en het verplaatsen naar een specifieke plek, of het trappen tegen een bal. Normaal gesproken moet je om een robot dit te leren honderden uren aan perfect uitgevoerde menselijke handelingen opnemen. Maar dat is duur, traag en moeilijk te doen voor elke mogelijke variatie (wat als de doos zwaarder is? Wat als het doel verder weg is?).

Het artikel introduceert Humanoid-DART, een slim systeem dat een robot leert deze taken onder de knie te krijgen met slechts een handvol voorbeelden (zo weinig als vier). Dit doet het door te fungeren als een creatieve coach die niet alleen herhaalt wat hij heeft gezien, maar ook nieuwe manieren bedenkt om dingen te doen en ze vervolgens oefent tot ze werken.

Hier is hoe het systeem werkt, onderverdeeld in eenvoudige delen:

1. De strategie met twee teams

In plaats van te proberen de robot alles in één groot brein te leren, splitst Humanoid-DART de taak op in twee gespecialiseerde teams die elkaar helpen:

  • De "Dromer" (het Diffusiemodel): Dit is de creatieve planner. Zijn taak is om een pad te bedenken dat de robot kan volgen. Hij kijkt naar de weinige voorbeelden die hij heeft en begint nieuwe, licht afwijkende paden te "dromen" om nieuwe doelen te bereiken. Denk aan een kunstenaar die nieuwe routes op een kaart schetst. In het begin zijn deze schetsen misschien fysiek onmogelijk (zoals door een muur lopen of over de vloer glijden), maar ze zijn erg goed in het verkennen van waar de robot naartoe zou kunnen gaan.
  • De "Atleet" (het Reinforcement Learning Policy): Dit is de fysieke uitvoerder. Zijn taak is om de schets van de "Dromer" te nemen en deze daadwerkelijk op de robot uit te proberen. Hij werkt als een strenge coach. Als de Dromer een pad schetst waarbij de voet van de robot glijdt of de robot omvalt, zegt de Atleet: "Nee, dat werkt niet," en corrigeert de beweging om deze fysiek mogelijk te maken.

2. De "Oefenlus" (Het Curriculum)

De magie gebeurt in de manier waarop deze twee teams in de loop van de tijd met elkaar communiceren. Het systeem draait in cycli, zoals een trainingskamp:

  1. Kies een doel: Het systeem kiest een doel (bijv. "Verplaats de doos naar deze nieuwe plek").
  2. Droom: De "Dromer" creëert een ruw plan om daar te komen.
  3. Test: De "Atleet" probeert het plan uit in een fysica-simulator.
  4. Filteren & Herlabelen:
    • Als de robot valt of faalt, wordt het plan weggegooid.
    • Het geheime ingrediënt: Als de robot het bijna haalt (een "near miss"), behandelt het systeem dit niet als een mislukking. In plaats daarvan zegt het: "Oké, je hebt de bedoelde plek niet bereikt, maar je hebt succesvol deze plek bereikt." Het herlabelt de poging als een succes voor de nieuwe plek die daadwerkelijk is bereikt.
  5. Leer: De "Dromer" leert van deze succesvolle (of bijna succesvolle) pogingen om beter te worden in het dromen van plannen voor die specifieke plekken. De "Atleet" wordt beter in het uitvoeren van die plannen.
  6. Herhaal: Het systeem kiest nieuwe, iets moeilijkere doelen op basis van wat het zojuist heeft geleerd, waardoor de vaardigheden zich uitbreiden als een sneeuwbal die een heuvel afrolt.

3. De "Dual-Brain" Architectuur

Om de "Dromer" echt goed te laten worden in zowel lopen als objecten vasthouden, geeft het artikel het een speciale tweeledige hersenstructuur:

  • De Navigator: Richt zich op het grote plaatje (waar de voeten van de robot naartoe gaan).
  • De Localizer: Richt zich op de details (hoe de handen en gewrichten bewegen ten opzichte van het object).
    Door deze te scheiden, leert de robot zijn hele lichaam te coördineren zonder in de war te raken, zodat hij, wanneer hij naar een doos loopt, zijn hand klaar heeft om deze te grijpen.

4. De Resultaten

De onderzoekers hebben dit getest op een echte robot (een Unitree G1) en in een simulatie. Ze begonnen met slechts vier basisvoorbeelden van een robot die duwt, trapt, overhandigt of een doos oppakt.

  • De uitkomst: Het systeem heeft deze taken niet alleen gekopieerd. Het leerde deze taken uit te voeren voor doelen die 4 tot 5 keer verder weg waren dan de oorspronkelijke voorbeelden.
  • Dekking: Voor de "pick-and-place" taak leerde de robot 96% van de mogelijke doelgebieden te bestrijken, terwijl andere methoden slechts een fractie daarvan bestreken.

Samenvatting

Humanoid-DART is als een student die begint met een paar tekstboekvoorbeelden, maar leert om duizenden nieuwe problemen op te lossen door:

  1. Nieuwe oplossingen te bedenken.
  2. Ze uit te proberen en te zien wat er daadwerkelijk werkt.
  3. "Bijna-missers" te vieren als nieuwe leermomenten.
  4. Langzaam een enorme bibliotheek aan vaardigheden op te bouwen zonder dat er een mens nodig is om elke enkele variatie op te nemen.

Het artikel concludeert dat deze aanpak robots in staat stelt om complexe, volledige lichaams-taken te leren van zeer beperkte data, waardoor het proces van het aanleren van robots veel sneller en efficiënter is dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →