← Neueste Arbeiten
💻 computer science

Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles

Die Autoren stellen einen neuartigen, visuell basierten Curriculum-Reinforcement-Learning-Ansatz vor, der durch mehrstufiges Curriculum-Learning, Domänenrandomisierung und eine Multi-Szenen-Aktualisierungsstrategie einen robusten End-to-End-Regler für den Hochgeschwindigkeitsflug von Quadrocoptern in Umgebungen mit zufälligen Hindernissen entwickelt, der in Experimenten schnellere Rundenzeiten und höhere Erfolgsquoten als bestehende Methoden erzielt.

Ursprüngliche Autoren: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

Veröffentlicht 2026-03-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einem kleinen, fliegenden Roboter (einer Drohne) beibringen, einen extremen Parcours zu fliegen. Aber es gibt ein Problem: Der Parcours ist nicht leer. Er ist voller zufällig platzierter Hindernisse – wie Stangen, Kisten oder Bäume – und die Drohne muss nicht nur diesen Hindernissen ausweichen, sondern auch noch durch die Tore fliegen, die selbst wie Hindernisse aussehen.

Das ist wie ein Formel-1-Rennen, bei dem die Fahrer gleichzeitig Slalom fahren müssen, während sich die Kurven und Hindernisse bei jedem Rennen neu anordnen.

Hier ist die einfache Erklärung der Forschung von Fangyu Sun und seinem Team, wie sie dieses Problem gelöst haben:

1. Das Problem: Der Konflikt zwischen „Schnell" und „Sicher"

Normalerweise ist es leicht, eine Drohne zu lehren, schnell durch leere Tore zu fliegen. Es ist auch leicht, ihr beizubringen, langsam vor einer Wand zu stoppen.
Aber beides gleichzeitig? Das ist ein Dilemma.

  • Um Hindernissen auszuweichen, muss die Drohne vorsichtig sein und vielleicht um eine Ecke fahren.
  • Um durch ein Tor zu kommen, muss sie direkt und schnell auf das Tor zusteuern.

Wenn man eine Drohne einfach nur mit „Strafen" für Kollisionen trainiert, wird sie ängstlich. Sie fliegt lieber weit an den Toren vorbei, anstatt hindurchzugehen, weil sie denkt: „Das Tor ist auch ein Hindernis!"

2. Die Lösung: Der „Lehrplan" (Curriculum Learning)

Statt die Drohne sofort in den chaotischen Parcours zu werfen, haben die Forscher eine Methode namens Curriculum Reinforcement Learning (Lehrplan-basiertes Lernen) entwickelt.

Stellen Sie sich das wie das Lernen eines Sportlers vor:

  • Level 1 (Die Grundschule): Die Drohne fliegt in einem leeren Raum. Sie lernt nur, wie man durch die Tore fliegt, ohne Hindernisse. Sie wird schnell und sicher.
  • Level 2 (Die Mittelschule): Jetzt kommen ein paar Hindernisse dazu, aber die Drohne fliegt noch langsam. Sie lernt, wie man ausweicht, ohne die Tore zu verpassen.
  • Level 3 (Die Universität): Jetzt wird es wild! Die Hindernisse sind zahlreich, zufällig verteilt und die Drohne muss mit voller Geschwindigkeit (bis zu 10 m/s!) fliegen.

Durch dieses schrittweise Vorgehen lernt die Drohne, dass Hindernisse nicht bedeuten, dass sie aufhören muss zu fliegen, sondern dass sie ihre Flugbahn anpassen muss.

3. Der Trick: Die „Belohnungs-Formel"

Ein weiterer wichtiger Teil ist die Belohnung, die die Drohne im Computer erhält.

  • Frühere Methoden sagten: „Wenn du einen Baum berührst, gibt es eine Strafe." Das führte dazu, dass die Drohne die Tore mied.
  • Diese Forscher haben eine ausgeglichene Belohnungsformel entwickelt. Sie sagen der Drohne: „Es ist toll, wenn du schnell bist, aber es ist noch toller, wenn du durch das Tor fliegst. Wenn du einem Hindernis ausweichst, bekommst du Punkte, aber wenn du das Tor verpasst, verlierst du mehr Punkte."

So lernt die Drohne, dass sie mutig sein muss, um durch das Tor zu kommen, aber klug genug, um nicht gegen die Wände zu fliegen.

4. Der „Multiszenen-Trainer"

Stellen Sie sich vor, Sie trainieren einen Fußballspieler. Wenn Sie ihn immer nur auf demselben Feld trainieren, lernt er nur dieses eine Feld.
Die Forscher haben eine Technik namens Multi-Scene Updating entwickelt. Ihre Drohne trainiert nicht nur auf einem Parcours, sondern gleichzeitig auf vielen verschiedenen, leicht veränderten Parcoursen.

  • Ein Parcours hat viele Hindernisse.
  • Ein anderer hat wenige.
  • Ein anderer hat die Tore an einer anderen Stelle.

Die Drohne lernt so, dass sie nicht auswendig lernt, wo die Hindernisse sind, sondern wie man mit Hindernissen umgeht. Das macht sie extrem robust.

5. Das Ergebnis: Vom Simulator in die echte Welt

Das Beste an dieser Forschung ist, dass die Drohne niemals einen echten Parcours gesehen hat, bevor sie geflogen ist.

  • Sie wurde komplett in einem Computersimulator trainiert (wie in einem Videospiel).
  • Dann wurde sie auf eine echte Drohne geladen, die eine Kamera und einen kleinen Computer (Raspberry Pi) an Bord hat.
  • Das Ergebnis: Die Drohne flog in der echten Welt durch zufällige Hindernisse, mit einer Geschwindigkeit von bis zu 8 Metern pro Sekunde, und schaffte es zu 100 %, alle Tore zu passieren, ohne zu crashen.

Zusammenfassung in einer Metapher

Stellen Sie sich vor, Sie wollen einem Schüler beibringen, Autofahren.

  • Der alte Weg: Sie setzen den Schüler in ein Auto und sagen: „Fahre schnell, aber weiche allen anderen Autos aus." Der Schüler panisch und fährt nicht schnell genug oder prallt gegen die Bordsteine.
  • Der neue Weg (diese Forschung):
    1. Erst übt der Schüler auf einer leeren Rennstrecke.
    2. Dann kommen ein paar statische Hütchen dazu.
    3. Dann werden die Hütchen bewegt und es wird schneller.
    4. Der Lehrer gibt klare Anweisungen: „Das Ziel ist das Tor, die Hütchen sind nur Störfaktoren."
    5. Der Schüler trainiert auf 100 verschiedenen Strecken gleichzeitig.

Am Ende steigt der Schüler in ein echtes Auto, fährt auf einer unbekannten Strecke mit zufälligen Hindernissen und gewinnt das Rennen, ohne vorher je dort gewesen zu sein.

Das ist genau das, was diese Drohne kann: Sie ist der ultimative Rennfahrer, der durch Übung und kluges Training gelernt hat, das Chaos zu meistern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →