← Nieuwste papers
💻 computer science

Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving

Het artikel stelt **StyleDrive** voor, een op een wereldmodel gebaseerd framework dat temporele inconsistentie, interactiemodellering en stijladaptiviteit in end-to-end rijden aanpakt door middel van temporele consistentie-regularisatie, expliciete staat-ontvlechting en Group Relative Policy Optimization, waarmee het de state-of-the-art prestaties bereikt op de Bench2Drive-benchmark en succesvolle sim-naar-real transfer demonstreert.

Oorspronkelijke auteurs: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

Gepubliceerd 2026-09-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Autonome voertuigen vertrouwen al lang op een modulaire aanpak van het rijden, waarbij de taak wordt opgedeeld in afzonderlijke stappen: eerst de weg zien, dan voorspellen waar andere auto's heen gaan, en tot slot beslissen hoe te sturen. Hoewel deze methode werkt, heeft het vaak moeite wanneer de weg een situatie presenteert die het nog nooit eerder heeft gezien. Een nieuwere benadering, bekend als end-to-end leren, probeert een voertuig te leren om wat de sensoren zien direct te vertalen naar het stuur en de pedalen, vergelijkbaar met hoe een menselijke bestuurder leert door ervaring. Om dit leerproces veiliger en efficiënter te maken, zijn onderzoekers begonnen met het gebruik van "wereldmodellen". Dit zijn interne simulaties waarin het voertuig toekomstige scenario's kan voorstellen en reacties kan oefenen zonder ooit de computer te verlaten. Dit stelt de AI in staat om gevaarlijke situaties, zoals een plotselinge botsing, te verkennen en te leren van de uitkomst zonder echt wereldrisico. Deze mentale simulaties lijden echter vaak aan een specifiek gebrek: naarmate het voertuig verder in de toekomst kijkt, wordt het beeld wazig en inconsistent, en het systeem faalt vaak in het onderscheiden van een nabijgelegen auto die ertoe doet en een verre auto die dat niet doet.

Een team van onderzoekers heeft een nieuw systeem ontwikkeld genaamd StyleDrive om deze problemen op te lossen. Hun werk, getest in een hoogwaardige rijsimulator en op een echt voertuig, introduceert een manier waarop de AI een helder en consistent beeld van de toekomst kan behouden terwijl het tegelijkertijd leert rijden in verschillende "persoonlijkheden". De kern van hun innovatie is een methode die de mentale tijdlijn van het voertuig stabiel houdt. In plaats van toe te staan dat fouten zich opstapelen terwijl het voertuig seconden in de toekomst voorstelt, controleert het systeem de huidige voorspelling voortdurend tegen een geschiedenis van eerdere toestanden. Dit werkt als een vaste hand, die ervoor zorgt dat de voorgestelde weg vooruit fysiek aannemelijk en coherent blijft, zelfs over langere perioden. Door dit te doen, kan het voertuig complexe manoeuvres plannen, zoals invoegen in snel bewegend verkeer, met een veel grotere mate van vertrouwen.

De onderzoekers hebben ook aangepakt hoe het voertuig aandacht schenkt aan zijn omgeving. In eerdere systemen behandelde de AI elke andere auto of voetganger vaak met hetzelfde niveau van belang, wat de focus verwaterde. Het nieuwe systeem scheidt de wereld expliciet in twee delen: de elementen die de veiligheid en beweging van het voertuig rechtstreeks beïnvloeden, en de achtergrondelementen die dat niet doen. Dit stelt het voertuig in staat om zijn besluitvormingskracht te concentreren op kritieke interacties, zoals een voetganger die van een stoeprand stapt of een auto die afsnijdt, terwijl irrelevante details worden genegeerd. Deze scheiding maakt de keuzes van het voertuig begrijpelijker en veiliger, omdat het duidelijk kan identificeren welke delen van de omgeving zijn acties aansturen.

Misschien wel het meest onderscheidende kenmerk van StyleDrive is het vermogen om zich aan te passen aan verschillende rijstijlen zonder dat het opnieuw getraind hoeft te worden. De meeste autonome systemen worden getraind om op één, vaste manier te rijden, waarbij ze vaak neigen naar extreme voorzichtigheid. StyleDrive kan echter leren om conservatief, gematigd of agressief te rijden binnen hetzelfde kader. De onderzoekers bereikten dit door het systeem gelijktijdig te trainen op een groep verschillende rijscenario's en de uitkomsten te vergelijken. In plaats van het voertuig te belonen voor elke kleine stap die het zet, evalueert het systeem volledige ritten en beloont het het algemene succes van een reis. Dit stelt het voertuig in staat om een spectrum aan gedragingen te leren, van een voorzichtige bestuurder die wacht op perfecte omstandigheden tot een assertieve bestuurder die berekende risico's neemt, terwijl de veiligheid behouden blijft.

De resultaten van deze aanpak waren significant. Wanneer getest op een standaard benchmark voor autonoom rijden, behaalde het systeem een rijscore van 88,44 en een succespercentage van 66,82 procent. Deze cijfers vertegenwoordigen een substantiële verbetering ten opzichte van de voorheen beste methoden die vergelijkbare wereldmodeltechnieken gebruikten, die aanzienlijk lager scoorden. Het systeem bleek bijzonder effectief in complexe scenario's, zoals het navigeren door kruispunten met tegenliggend verkeer of het reageren op plotselinge obstakels. In één test, terwijl andere systemen ofwel botsten met hulpvoertuigen of op de stoep reden, gaf StyleDrive correct voorrang en voegde veilig in. In een andere test passeerde het soepel stilstaand verkeer zonder de onveilige manoeuvres die bij concurrerende modellen te zien waren.

Om te bewijzen dat deze vaardigheden niet alleen het resultaat waren van de simulator, hebben de onderzoekers het systeem ingezet op een echt geautomatiseerd voertuig uitgerust met camera's en lasersensoren. In tests in de echte wereld handelde het voertuig succesvol in dynamische situaties, zoals het vermijden van tegenliggende obstakels en het stoppen voor voetgangers die onverwacht de weg overstaken. Het systeem bewees dat het de gedragingen die het in de virtuele wereld leerde, kon overbrengen naar de fysieke wereld, waarbij het in staat bleef om tussen verschillende rijstijlen te schakelen afhankelijk van de situatie. Deze succesvolle overgang van simulatie naar realiteit suggereert dat het interne model van het systeem voor de wereld robuust genoeg is om de onvoorspelbaarheid van het werkelijke verkeer aan te kunnen.

De studie benadrukt dat de toekomst van autonoom rijden mogelijk niet ligt in een enkele, rigide set regels, maar in flexibele systemen die de toekomst helder kunnen voorstellen en hun gedrag kunnen aanpassen aan de context. Door voorspellingen op lange termijn te stabiliseren en de aandacht te richten op wat er echt toe doet, biedt StyleDrive een pad naar voertuigen die niet alleen veiliger zijn, maar ook beter in staat zijn om de diverse en vaak chaotische realiteit van menselijke wegen te navigeren. Het werk van de onderzoekers suggereert dat machines, met het juiste interne model, kunnen leren rijden met een niveau van nuance en aanpassingsvermogen dat voorheen onbereikbaar was.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →