← Nieuwste papers
💻 computer science

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR introduceert een schaalbaar closed-loop reinforcement learning-framework voor end-to-end autonoom rijden dat een residuele waypoint-policy traint bovenop vooraf getrainde Vision-Language-Action-modellen met behulp van een heterogene simulatiepipeline, waarmee een state-of-the-art prestatie wordt behaald op uitdagende benchmarks door de beperkingen van distributieverschuiving bij traditionele imitation learning te overwinnen.

Oorspronkelijke auteurs: Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zelfrijdende auto leert rijden. Lange tijd was de beste manier om dit te doen Imitation Learning (imitatie-leren). Denk hierbij aan een leerling-bestuurder die op de achterbank zit van een auto die wordt bestuurd door een perfecte expert. De leerling kopieert gewoon wat de expert doet. Als de expert naar links afslaat, slaat de leerling ook naar links af.

Het probleem? Dit werkt alleen bij een "open boek"-toets. Als de leerling een situatie ziet die de expert hem nooit heeft laten zien, of als de leerling een kleine fout maakt, raakt hij in de war. In de echte wereld (of een complexe simulatie) kan één kleine fout leiden tot een botsing, en de leerling weet niet hoe hij moet herstellen omdat hij alleen geleerd heeft om te kopiëren, en niet om te denken of zich aan te passen.

Onlangs begonnen onderzoekers Vision-Language-Action (VLA)-modellen te gebruiken. Dit zijn als superintelligente instructeurs die de weg kunnen "zien", verkeersborden kunnen "lezen" en alle drie de rijcommando's tegelijkertijd kunnen "spreken". Maar zelfs deze slimme instructeurs werden grotendeels getraind met de "kopieer de expert"-methode, waardoor ze kwetsbaar bleven wanneer er dingen misgingen.

Maak kennis met CLEAR.

Het Grote Idee: De "Residual" Coach

De auteurs van dit paper hebben een systeem genaamd CLEAR gebouwd om dit op te lossen. In plaats van alleen maar te kopiëren, hebben ze de AI geleerd om een coach te zijn die een trainee corrigeert.

  1. De Pre-trained "Trainee": Eerst nemen ze een zeer slim VLA-model (de trainee) en leren hen de basis met behulp van een enorme bibliotheek aan expert-rijdata. Deze trainee is goed in het voorspellen van een algemeen pad, zoals een GPS die zegt: "Over 500 voet linksaf slaan."
  2. De "Coach" (RL): Vervolgens introduceren ze Reinforcement Learning (RL). Stel je een coach voor die naast de trainee staat. De trainee maakt een voorspelling (het "basispad"), en de coach zegt: "Eigenlijk moet je een klein beetje meer naar links sturen om die kuil te vermijden."
    • De AI leert niet opnieuw hoe hij moet rijden vanaf nul (wat te veel rekenkracht zou kosten).
    • In plaats daarvan leert het een residual policy. Dit is als het leren van het verschil tussen een goed plan en een perfect plan. Het leert alleen de kleine "correcties" die nodig zijn om de fouten van de trainee te herstellen.

De "Heterogene Pipeline": Het Oplossen van de Files

Het trainen van deze AI-coaches is extreem data-hongerig. Je moet miljoenen rijsimulaties draaien om ze te leren.

Hier is de flessenhals:

  • De Simulator (De Weg): Het draaien van een realistische rijsimulator (zoals CARLA) is zwaar voor de computergraphics. Het is alsof je een high-end videogame speelt.
  • De Learner (De Hersenen): Het AI-model is ook enorm en heeft krachtige grafische kaarten (GPU's) nodig om na te denken.

Als je de simulator en de hersenen op dezelfde computer probeert te draaien, vechten ze om de grafische kaarten. Het is alsochten een marathon te lopen en tegelijkertijd een zware gewichtheftijdwedstrijd te houden in dezelfde kleine sportschool; alles vertraagt of crasht.

CLEAR's Oplossing: Ze hebben een heterogene pipeline gebouwd.

  • Ze plaatsten de Simulators (de wegen) op een andere set oudere, goedkopere computers.
  • Ze plaatsten de AI-Hersenen (de learner) op een aparte, superkrachtige cluster van computers.
  • Ze verbonden ze met een digitale tunnel (SSH).

Dit is als een vloot van afgelegen racebanen (de simulators) die data naar een centraal hoofdkwartier (de hersenen) sturen. De banen hoeven niet fancy te zijn; ze moeten alleen draaien. De hersenen krijgen alle data die ze nodig hebben zonder dat ze worden vertraagd door de graphics-rendering. Hierdoor konden ze 64 simulaties tegelijkertijd draaien en trainen op 100 miljoen samples.

De Resultaten: Van "Falen" naar "Winnen"

Het paper testte dit systeem op enkele zeer moeilijke rijuitdagingen (zoals de "longest6" en "Bench2Drive" benchmarks).

  • Vóór CLEAR: Eerdere methoden, zelfs de slimme, faalden bijna 100% van de tijd op deze moeilijke routes. Ze zouden crashen of vast komen te zitten omdat ze niet konden herstellen van kleine fouten.
  • Met CLEAR: Het systeem leerde om zijn eigen fouten te corrigeren. Het volgde niet alleen een script; het leerde om om obstakels heen te navigeren en complex verkeer te verwerken.
    • Op de ene benchmark steeg het succespercentage van 0% (totaal falen) naar 25%.
    • Op een andere benchmark behaalde het de hoogste scores ooit geregistreerd, waarbij het alle eerdere methoden versloeg op het gebied van rij-efficiëntie en veiligheid.

Samenvatting

Beschouw CLEAR als het nemen van een slimme maar rigide leerling-bestuurder, het geven van een superintelligente coach die hem een duwtje in de juiste richting geeft wanneer hij begint af te wijken, en het bouwen van een enorme, gedistribueerde trainingsfaciliteit zodat hij miljoenen kilometers kan oefenen zonder dat de computer crasht. Het resultaat is een zelfrijdend systeem dat aanzienlijk beter is in het omgaan met de rommelige, onvoorspelbare realiteit van de weg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →