← Neueste Arbeiten
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART ist ein selbstüberwachtes Framework, das diffusionsbasierte Trajektoriengenerierung mit Reinforcement Learning kombiniert, um humanoide Roboter dazu zu befähigen, vielfältige Loco-Manipulation-Fähigkeiten aus spärlichen Demonstration durch die automatische Exploration des Zielraums bei minimaler Expertenüberwachung zu erlernen.

Ursprüngliche Autoren: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Veröffentlicht 2026-06-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem humanoiden Roboter komplexe Aufgaben bei, wie zum Beispiel das Aufheben einer Kiste und das Bewegen sie an einen bestimmten Ort oder das Kicken eines Balls. Normalerweise muss man einem Roboter dies beibringen, indem man hunderte Stunden lang Menschen aufzeichnet, die diese Aufgaben perfekt ausführen. Das ist jedoch teuer, langsam und schwierig für jede mögliche Variation (was ist, wenn die Kiste schwerer ist? Was ist, wenn das Ziel weiter entfernt ist?).

Das Paper stellt Humanoid-DART vor, ein cleveres System, das einem Roboter hilft, diese Aufgaben zu meistern, indem es mit nur einer winzigen Handvoll Beispiele beginnt (so wenig wie vier). Es tut dies, indem es wie ein kreativer Coach agiert, der nicht nur das wiederholt, was er gesehen hat, sondern sich neue Wege vorstellt und dann übt, bis es funktioniert.

So funktioniert das System, unterteilt in einfache Teile:

1. Die Zwei-Team-Strategie

Anstatt zu versuchen, dem Roboter alles in einem einzigen riesigen Gehirn beizubringen, teilt Humanoid-DART die Aufgabe in zwei spezialisierte Teams auf, die sich gegenseitig helfen:

  • Der „Träumer“ (Das Diffusionsmodell): Dies ist der kreative Planer. Seine Aufgabe ist es, einen Pfad zu imaginieren, dem der Roboter folgen soll. Er betrachtet die wenigen vorhandenen Beispiele und beginnt, „neue, leicht unterschiedliche Pfade zu träumen“, um neue Ziele zu erreichen. Denken Sie an einen Künstler, der neue Routen auf einer Karte skizziert. Zuerst könnten diese Skizzen physikalisch unmöglich sein (wie durch eine Wand gehen oder über den Boden gleiten), aber sie sind großartig darin, zu erkunden, wohin der Roboter gehen könnte.
  • Der „Athlet“ (Die Reinforcement Learning Policy): Dies ist der physische Ausführer. Seine Aufgabe ist es, die Skizze des „Träumers“ zu nehmen und tatsächlich zu versuchen, sie auf dem Roboter auszuführen. Er agiert wie ein strenger Trainer. Wenn der Träumer einen Pfad skizziert, auf dem der Fuß des Roboters rutscht oder er umfällt, sagt der Athlet: „Nee, das wird nicht funktionieren“, und korrigiert die Bewegung, um sie physikalisch möglich zu machen.

2. Die „Übungsschleife“ (Das Curriculum)

Die Magie geschieht in der Art und Weise, wie diese beiden Teams über die Zeit miteinander kommunizieren. Das System läuft in Zyklen ab, wie ein Trainingslager:

  1. Ein Ziel auswählen: Das System wählt ein Ziel (z. B. „Bewege die Kiste an diesen neuen Ort“).
  2. Träumen: Der „Träumer“ erstellt einen groben Plan, um dorthin zu gelangen.
  3. Testen: Der „Athlet“ versucht, den Plan in einem Physik-Simulator auszuführen.
  4. Filtern & Relabeln:
    • Wenn der Roboter fällt oder scheitert, wird der Plan verworfen.
    • Die Geheimzutat: Wenn der Roboter es fast geschafft hätte (ein „Beinahe-Erfolg“), behandelt das System dies nicht als Fehlschlag. Stattdessen sagt es: „Okay, du hast den beabsichtigten Punkt nicht erreicht, aber du hast diesen anderen Punkt erfolgreich erreicht.“ Es relabelt den Versuch als Erfolg für den tatsächlich erreichten Ort.
  5. Lernen: Der „Träumer“ lernt aus diesen erfolgreichen (oder beinahe erfolgreichen) Versuchen, um besser darin zu werden, Pläne für genau diese Orte zu träumen. Der „Athlet“ wird besser darin, sie auszuführen.
  6. Wiederholen: Das System wählt neue, etwas schwierigere Ziele basierend auf dem, was es gerade gelernt hat, und erweitert so seine Fähigkeiten wie ein Schneeball, der einen Hang hinunterrollt.

3. Die „Dual-Brain“-Architektur

Um den „Träumer“ wirklich gut darin zu machen, sowohl das Gehen als auch das Halten von Objekten zu bewältigen, gibt das Paper ihm eine spezielle zweiteilige Gehirnstruktur:

  • Der Navigator: Konzentriert sich auf das große Ganze (wohin die Füße des Roboters gehen).
  • Der Lokalisierer: Konzentriert sich auf die Details (wie sich Hände und Gelenke relativ zum Objekt bewegen).
    Durch diese Trennung lernt der Roboter, seinen gesamten Körper zu koordinieren, ohne verwirrt zu werden, sodass sichergestellt ist, dass seine Hand bereit ist, zuzugreifen, während er auf eine Kiste zugeht.

4. Die Ergebnisse

Die Forscher haben dies an einem echten Roboter (einem Unitree G1) und in der Simulation getestet. Sie begannen mit nur vier Basiseksemplaren eines Roboters, der drückt, kickt, übergibt oder eine Kiste aufhebt.

  • Das Ergebnis: Das System hat diese vier Beispiele nicht nur kopiert. Es hat gelernt, diese Aufgaben für Ziele zu bewältigen, die 4- bis 5-mal weiter entfernt waren als die ursprünglichen Beispiele.
  • Abdeckung: Für die Aufgabe „Aufheben und Platzieren“ lernte der Roboter, 96 % der möglichen Zielbereiche abzudecken, während andere Methoden nur einen winzigen Bruchteil abdeckten.

Zusammenfassung

Humanoid-DART ist wie ein Schüler, der mit ein paar Lehrbuchbeispielen beginnt, aber lernt, Tausende neuer Probleme zu lösen, indem er:

  1. Neue Lösungen imaginiert.
  2. Sie ausprobiert und sieht, was tatsächlich funktioniert.
  3. „Beinahe-Erfolge“ als neue Lerngelegenheiten feiert.
  4. Langsam eine massive Bibliothek an Fähigkeiten aufbaut, ohne dass ein Mensch jede einzelne Variation aufzeichnen muss.

Das Paper kommt zu dem Schluss, dass dieser Ansatz es Robotern ermöglicht, komplexe Ganzkörperaufgaben aus sehr spärlichen Daten zu lernen, was den Prozess des Roboters-Lehrens viel schneller und effizienter macht als zuvor.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →