← Nieuwste papers
🤖 AI

Imitation Learning for Autonomous Driving in CARLA

Dit artikel presenteert een compact multimodaal behavioral cloning-beleid, getraind op 236.882 vensters van expertdemonstraties in CARLA, dat succesvol urenlang autonoom rijdt zonder botsingen op zowel getrainde als onbekende routes, wat effectieve closed-loop prestaties en kwalitatieve transfer naar nieuwe omgevingen aantoont.

Oorspronkelijke auteurs: Jordy Kieto

Gepubliceerd 2026-09-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jordy Kieto

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De droom om een auto te leren zelf rijden heeft lang geleund op een eenvoudig, intuïtief idee: als een machine een deskundige bestuurder kan observeren en elke beweging van die persoon kan kopiëren, zou het uiteindelijk zelfstandig moeten leren rijden. Deze aanpak, bekend als imitatieleer (imitation learning), behandelt de complexe uitdaging van sturen, remmen en accelereren als een patroonherkenningsoefening. Een computer bekijkt uren aan videobeelden en sensordata van een mens of een perfect computerprogramma, waarbij het leert welke actie het als volgende moet ondernemen op basis van wat het ziet. De moeilijkheid ligt in de kloof tussen kijken en doen. Wanneer een mens leert rijden, oefent diegene in een lus; als een mens iets uit het midden raakt, corrigeert hij dit en leert hij van die correctie. Een machine die alleen getraind is op perfecte voorbeelden, heeft echter nooit gezien wat er gebeurt als het een fout maakt. Als het zelfs maar een klein beetje afwijkt, komt het in een situatie terecht die de expert nooit heeft gedemonstreerd, en zonder gids kan die kleine fout escaleren tot een botsing. De vraag waar onderzoekers voor staan, is of een systeem genoeg kan leren van een statische bibliotheek met perfecte ritten om de rommelige, onvoorspelbare realiteit van het alleen rijden aan te kunnen.

In een recente studie met behulp van een geavanceerde rijsimulator genaamd CARLA, onderzocht een onderzoeker genaamd Jordy Kieto precies deze vraag. Het doel was niet om een nieuw type computerbrein uit te vinden, maar om te zien hoeveel echte rijvaardigheid een relatief eenvoudig, compact systeem kon verwerven uit een zorgvuldig samengestelde bibliotheek van expertritten. De onderzoeker bouwde een beleid (policy)—een reeks instructies voor de auto—dat naar een stroom beelden van een camera kon kijken, een bovenaanzichtkaart gegenereerd door een laserscanner, en een lijst met aankomende rijrichtingen. Door dit systeem telkens vijf seconden aan geschiedenis te voeren, trainde het team het systeem om de gas-, rem- en stuurbewegingen van een deskundige bestuurder te voorspellen. De trainingsdata kwam uit een unieke bron: een systematisch proces dat duizenden korte rijfragmenten genereerde, waardoor de auto een gebalanceerde mix zag van rechte wegen, bochten naar links en bochten naar rechts, in plaats van alleen de gemakkelijke, rechte paden die vaak de overhand hebben bij rijlogs.

De resultaten van dit experiment waren verrassend robuust. Nadat het beleid was getraind op ongeveer drieënhalf uur van deze geverifieerde rijfragmenten, werd het beleid in de simulator geplaatst om zelfstandig te rijden, zonder menselijke tussenkomst en zonder veiligheidsnet. In deze closed-loop test, waarbij elke bocht die de auto maakte bepaalde wat het vervolgens zou zien, reed het systeem urenlang op precies dezelfde wegen waarop het was getraind, en ook op volledig andere wegen die het nog nooit had gezien. Het navigeerde door bochten, beheerde kruispunten en bleef binnen de rijstrook zonder een enkele botsing tijdens de runs van de auteur. Misschien nog wel het meest opmerkelijk is dat het systeem een vermogen toonde om grote fouten te herstellen. Wanneer de auto ver van de weg werd geplaatst of in de verkeerde richting wees—situaties waarin het nooit expliciet is geleerd hoe het moet corrigeren—slaagde het er vaak in om zichzelf terug naar het rijbare oppervlak te sturen en de reis te hervatten. Dit herstel gebeurde zonder dat het systeem ooit een "herstel"-demonstratie in zijn trainingsdata had gezien; het generaliseerde simpelweg vanuit de kleine correcties die het tijdens het trainingsproces had geleerd.

De studie is echter voorzichtig in het onderscheid tussen wat werd waargenomen en wat werd bewezen. De beschreven rijprestaties vonden volledig plaats binnen een computersimulatie, een gecontroleerde omgeving zonder voetgangers, verkeerslichten of onvoorspelbaar weer. Het succes van het systeem leunde zwaar op een "geprivilegieerde" stuk informatie: een nauwkeurig, vooraf berekend pad van rijstrookmarkeringen die door de interne kaart van de simulator werd geleverd, die de auto kon zien maar waar een echte bestuurder niet op dezelfde manier toegang toe zou hebben. De onderzoekers merkten expliciet op dat hoewel de auto goed presteerde, zij niet beweerden dat ze het probleem van het rijden in de echte wereld hadden opgelost. Ze wezen ook op het feit dat het vermogen van het systeem om bochten te maken nog steeds het meest uitdagende deel was, waarbij fouten bij het draaien frequenter voorkwamen dan fouten bij het rechtuit rijden. De studie dient als een krachtige demonstratie dat een eenvoudig systeem, gevoed met hoogwaardige, diverse data, in staat is om gedurende langere perioden autonoom te rijden in een simulatie, maar het houdt op met het verklaren van dit als een voltooid product voor de openbare weg.

De betekenis van dit werk ligt minder in de specifieke computerarchitectuur die werd gebruikt en meer in de methode van voorbereiding. De onderzoeker behandelde de data zelf als de primaire variabele, waarbij werd overgegaan van een kleine, rommelige set handmatige ritten naar een rigoureus, geautomatiseerd proces dat elk trainingsfragment genereerde en verifieerde. Door ervoor te zorgen dat de trainingsdata specifieke manoeuvres omvatte en lichte, gerandomiseerde variaties in startposities bevatte, leerde het systeem een breder scala aan situaties aan te kunnen dan het uit een standaard dataset zou hebben geleerd. De studie concludeert dat hoewel offline training—leren van een statische bibliotheek—een bestuurder kan voortbrengen die goed functioneert in een lus, de ware test van competentie blijft het vermogen om met het onverwachte om te gaan. De onderzoekers hebben al hun code, data en het getrainde model zelf vrijgegeven, in een uitnodiging aan anderen om deze bevindingen te testen, de herstelpercentages met grotere precisie te meten en te onderzoeken in hoeverre dit succes afhangt van de geprivilegieerde kaartinformatie versus het visuele begrip van de weg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →