← Neueste Arbeiten
💻 computer science

Continual Domain Randomization

Dieser Artikel schlägt eine kontinuierliche Domänenrandomisierung (CDR) vor, einen neuartigen Ansatz, der Domänenrandomisierung mit kontinuierlichem Lernen kombiniert, um Reinforcement-Learning-Richtlinien sequenziell auf Teilmengen von Simulationsparametern zu trainieren, wodurch die Suboptimalität der simultanen Randomisierung überwunden und eine robuste Sim-zu-Real-Übertragung bei robotischen Aufgaben erreicht wird.

Ursprüngliche Autoren: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

Veröffentlicht 2026-04-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, eine Tasse aufzuheben. Der klügste Weg, dies zu tun, besteht normalerweise darin, den Roboter zunächst Millionen von Malen in einer Computersimulation üben zu lassen, damit er den echten Roboter nicht beschädigt oder jemanden verletzt. Doch hier liegt das Problem: Eine Computersimulation ist niemals perfekt wie die reale Welt. Der echte Roboter könnte etwas schwerer sein, die Motoren etwas langsamer oder die Sensoren ein wenig „verrauscht". Dieser Unterschied wird als „Realitätslücke" bezeichnet. Wenn Sie einen Roboter in einer perfekten Simulation trainieren, versagt er oft kläglich, sobald Sie ihn in die reale Welt bringen, weil er gelernt hat, sich auf die Perfektion der Simulation zu verlassen.

Um dies zu beheben, wenden Wissenschaftler einen Trick namens Domain Randomization (Domänenrandomisierung) an. Anstatt zu versuchen, die Simulation perfekt zu machen, vermasseln sie sie absichtlich. Sie machen den Roboter in einem Durchgang schwerer, im nächsten leichter, fügen künstliches Sensorrauschen hinzu oder verzögern die Steuerung. Die Idee ist, dass der Roboter, wenn er lernt, mit all diesen vermasselten Versionen umzugehen, robust genug sein wird, um die reale Welt zu bewältigen, die nur eine weitere Version von „vermasselt" ist.

Das Problem mit dem alten Weg
Die traditionelle Methode ist vergleichbar damit, zu versuchen, Schwimmen zu lernen, indem man am allerersten Tag direkt in einen stürmischen Ozean mit starken Strömungen, hohen Wellen und kaltem Wasser springt. Das ist zu schwierig! Der Roboter wird überwältigt, verwirrt und lernt eine schlechte Strategie (oder lernt überhaupt nichts), weil die Aufgabe zu schwierig ist.

Die neue Lösung: Continual Domain Randomization (CDR)
Die Autoren dieses Papiers schlagen einen klügeren Lernweg vor, den sie Continual Domain Randomization (CDR) nennen. Stellen Sie es sich wie das Erlernen des Autofahrens vor:

  1. Beginnen Sie einfach: Zuerst lernen Sie, in einem leeren, perfekten Parkplatz ohne Wind, ohne andere Autos und mit perfekten Reifen zu fahren. Sie beherrschen die Grundlagen.
  2. Fügen Sie eine Herausforderung nach der anderen hinzu: Sobald Sie darin gut sind, werfen Sie Sie nicht plötzlich in einen Hurrikan. Stattdessen fügen Sie nur eine neue Herausforderung hinzu. Vielleicht fahren Sie im Regen. Sobald Sie den Regen gemeistert haben, fügen Sie Wind hinzu. Sobald Sie den Wind gemeistert haben, fügen Sie starken Verkehr hinzu.
  3. Erinnern Sie sich an alles: Der knifflige Teil ist, dass Sie, wenn Sie lernen, im Regen zu fahren, nicht vergessen sollten, wie man auf trockenem Asphalt fährt. Hier kommt der Teil des „Continual Learning" (kontinuierlichen Lernens) ins Spiel. Der Roboter verwendet eine spezielle Gedächtnistechnik (genannt Elastic Weight Consolidation), die wie ein „Sicherheitsnetz" wirkt. Sie ermöglicht es dem Roboter, neue Fähigkeiten zu erlernen (wie das Bewältigen von Regen), ohne die alten Fähigkeiten (Fahren auf trockenem Asphalt) zu „vergessen".

Wie sie es getestet haben
Die Forscher testeten diese Idee an zwei Aufgaben:

  • Greifen: Ein Roboterarm, der versucht, einen bestimmten Punkt zu berühren.
  • Ergreifen: Eine komplexere Aufgabe, bei der ein Roboterarm eine Box finden, seinen Greifer perfekt ausrichten und sie aufnehmen muss.

Sie verglichen ihre „schrittweise" Methode (CDR) mit zwei anderen Ansätzen:

  • Der „perfekte" Simulator: Training nur in einer sauberen, perfekten Welt (was in der Realität versagt).
  • Der „Chaos"-Simulator: Alle Probleme (Regen, Wind, Verkehr) gleichzeitig auf den Roboter werfen.
  • Die „vergessliche" Methode: Probleme einzeln hinzufügen, aber ohne das Sicherheitsnetz des Gedächtnisses (so dass der Roboter die vorherigen Schritte vergisst).

Die Ergebnisse
Die Ergebnisse waren beeindruckend:

  • Der mit CDR trainierte Roboter lernte effektiv in der Simulation.
  • Als sie den Roboter in die reale Welt brachten, performte er besser oder genauso gut wie der Roboter, der im „Chaos"-Modus trainiert wurde.
  • Entscheidend war, dass CDR stabiler war. Es spielte keine Rolle, in welcher Reihenfolge sie die Herausforderungen hinzufügten (zuerst Regen oder zuerst Wind); der Roboter lernte dennoch gut. Die „vergessliche" Methode hingegen hatte Schwierigkeiten, wenn sich die Reihenfolge der Herausforderungen änderte.

Kurz gesagt
Dieses Papier zeigt, dass es besser ist, einen Roboter Schritt für Schritt zu unterrichten und dabei eine Schwierigkeit nach der anderen hinzuzufügen, während sichergestellt wird, dass er sich daran erinnert, wie man die vorherigen bewältigt, anstatt ihn in einem Meer zufälliger Variablen auf einmal zu ertränken. Dies schafft einen Roboter, der bereit für die unordentliche, unvorhersehbare reale Welt ist, ohne dass er während des Trainings in der realen Welt getestet werden muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →