← Nieuwste papers
💻 computer science

Do Open-Loop Metrics Predict Closed-Loop Driving? A Cross-Benchmark Correlation Study of NAVSIM and Bench2Drive

Deze studie analyseert de correlatie tussen NAVSIM open-loop-metrics en Bench2Drive gesloten-lusprestaties over state-of-the-art-methoden, en onthult dat terwijl geaggregeerde NAVSIM-scores een sterke maar niet-monotoon correlatie vertonen met succes in het echt rijden, Ego Progress de meest voorspellende enkele metric is en een vereenvoudigde formule met drie metrics de volledige score met vijf metrics effectief kan vervangen voor rangschikkingsdoeleinden.

Oorspronkelijke auteurs: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Hai Yang, Yang Chen, Hao Sun

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Hai Yang, Yang Chen, Hao Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren autorijden. Om te zien of de robot goed is, heb je twee manieren om het te testen:

  1. De "Papertest" (Open-Loop): Je geeft de robot een kaart en een reeks instructies, en vraagt het om een lijn op een stuk papier te tekenen die aangeeft waar het zou rijden. Je vergelijkt die lijn vervolgens met het perfecte pad. Dit is snel, goedkoop en je kunt het duizend keer per seconde doen.
  2. De "Echte Rit" (Closed-Loop): Je zet de robot daadwerkelijk in een auto (of een superrealistische videospel) en laat het rijden. De auto reageert op verkeerslichten, andere auto's en voetgangers. Als de robot vastloopt of te langzaam rijdt, faalt het. Dit is de "gouden standaard", maar het kost uren, veel geld en is moeilijk exact op dezelfde manier te herhalen.

De Grote Vraag: Kan de "Papertest" betrouwbaar voorspellen hoe de robot zal presteren in de "Echte Rit"?

Lange tijd was het antwoord nee. Oude tests maten alleen hoe ver de tekening van de robot afweek van de perfecte lijn (zoals het meten van de afstand tussen twee punten). Het papier toont aan dat zelfs als een robot een bijna perfecte lijn tekent, het in het echt nog steeds kan crashen of vastlopen.

Wat dit artikel deed

De auteurs keken naar 8 verschillende toonaangevende robotbestuurders. Ze controleerden hoe deze robots presteerden op de "Papertest" (met behulp van een nieuwe, slimmere test genaamd NAVSIM) en vergeleken dit met hoe ze het daadwerkelijk deden in de "Echte Rit" (met behulp van een test genaamd Bench2Drive).

Hier is wat ze vonden, eenvoudig uitgelegd:

1. De "Veiligheid vs. Snelheid"-valkuil

De nieuwe "Papertest" (NAVSIM) is veel beter dan de oude. Het controleert op veiligheid (heb je iets geraakt?) en vooruitgang (ben je vooruitgegaan?).

  • Het Probleem: Sommige robots zijn te veilig. Ze rijden als een schildpad, stoppen bij elke kleine schaduw om zeker te zijn dat ze niets raken.
  • Het Resultaat: Op de "Papertest" krijgen deze schildpad-robots hoge scores omdat ze nooit iets raken. Maar in de "Echte Rit" worden ze bestraft omdat ze te langzaam rijden of vastlopen in het verkeer. Ze zakken voor de echte test omdat ze te voorzichtig zijn.
  • De Analogie: Stel je een student voor die op een toets elk antwoord geeft met "Ik weet het niet" om te voorkomen dat hij één punt verliest. Op een toets die alleen fouten meet, krijgt hij een A. Maar op een toets waarbij je het examen daadwerkelijk moet afmaken, krijgt hij een onvoldoende omdat hij het niet heeft afgerond.

2. Het Geheime Ingrediënt: "Eigen Vooruitgang"

De onderzoekers splitsten de "Papertest" op in onderdelen om te zien welke daarvan daadwerkelijk succes in de echte wereld voorspelde.

  • Ze ontdekten dat het belangrijkste getal niet "Ben je gecrasht?" was (Veiligheid). Het was "Ben je vooruitgegaan?" (Vooruitgang).
  • De Analogie: Denk aan een marathon. Als je perfect loopt zonder te struikelen (Veiligheid) maar elke 10 seconden stopt om je schoenveter te strikken, win je de race niet. De robot moet vooruit blijven gaan. De "Vooruitgangs"-score was de enige beste voorspeller of de robot de rit daadwerkelijk succesvol zou voltooien.

3. Het "Sneeuwbaleffect"

Waarom worden kleine fouten in de "Papertest" enorme mislukkingen in de "Echte Rit"?

  • De Analogie: Stel je voor dat je door een gang loopt. Als je één klein stapje naar links zet, maakt het niet uit. Maar als je 10 minuten lang kleine stapjes naar links blijft zetten, loop je uiteindelijk tegen een muur.
  • In de "Papertest" plant de robot slechts 4 seconden vooruit. Een klein aarzelen lijkt misschien een kleine fout. Maar in de "Echte Rit" zorgt die kleine aarzeling ervoor dat de robot een groen licht mist, wacht op een rood licht, achterloopt op schema en uiteindelijk wordt afgekeurd door tijdsoverschrijding. Kleine fouten "rollen op" tot een totale mislukking.

4. Een Simpler Formule

De "Papertest" gebruikt een complexe formule met 5 verschillende getallen om een eindcijfer te berekenen. De auteurs beseften dat twee van die getallen (hoe comfortabel de rit is en hoe dicht je bij een crash bent) voor alle toprobots nagenoeg hetzelfde waren; ze waren allemaal perfect op die punten.

  • De Ontdekking: Je kunt de complexe formule weggooien en gewoon 3 simpele getallen gebruiken: "Ben je gecrasht?", "Blijf je in je rijbaan?" en "Ben je vooruitgegaan?"
  • Het Resultaat: Deze super-simpele formule voorspelde de resultaten in de echte wereld net zo goed als de complexe. Het is alsof je beseft dat je geen 50 pagina's rapport nodig hebt om te weten of een auto goed is; je hoeft alleen maar te weten of hij beweegt en niet crasht.

De Conclusie

Het artikel concludeert dat we, hoewel we niet perfect kunnen voorspellen hoe het rijden in het echt verloopt door alleen naar een tekening te kijken, er veel dichter bij komen.

  • Kijk niet alleen naar veiligheid: Een robot die veilig is maar niet beweegt, is een slechte bestuurder.
  • Let op "Vooruitgang": Het vermogen om vooruit te blijven gaan is het beste teken van een goede bestuurder.
  • Vereenvoudig: We hebben geen overmatig complexe scoresystemen nodig om goede bestuurders van slechte te onderscheiden; een simpele focus op veiligheid en beweging werkt op dit moment het beste.

De auteurs waarschuwen dat naarmate robots beter worden, we deze regels misschien weer moeten aanpassen, maar voor nu is deze "Vooruitgangs"-metriek de sleutel om te weten wie het op de weg daadwerkelijk zal redden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →