← Nieuwste papers
🤖 machine learning

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

Dit artikel introduceert DriveJudge, een nieuwe evaluatieagent voor autonoom rijden die redeneren met Vision-Language Models integreert met fysiek gefundeerde regel-functies om superieure, interpreteerbare en contextbewuste prestaties op mensgerichte benchmark-taken te bereiken.

Oorspronkelijke auteurs: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

Gepubliceerd 2026-06-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een auto te besturen. Je hebt het de robot de verkeersregels geleerd: "Blijf in je rijstrook," "Rijd niet tegen mensen aan," en "Blijf vooruit rijden." Maar het echte leven is rommelig. Soms moet een robot even een rijstrook overschrijden of onverwacht vertragen om een kuil te vermijden of een stilstaande vrachtwagen te ontwijken.

Dit is waar de oude manier van het beoordelen van de robot faalt, en de nieuwe methode, DriveJudge, in beeld komt.

Het Probleem: Het "Rigide Regelboek" versus de "Verwarde Rechter"

Het artikel identificeert twee belangrijke manieren waarop mensen tot nu toe hebben geprobeerd zelfrijdende auto's te beoordelen, en beide hebben gebreken:

  1. Het Rigide Regelboek (De Ouderwetse Manier):
    Stel je een strenge docent voor die alleen een checklist heeft. Als de auto een witte lijn oversteekt, vinkt de docent het af als fout. Als de auto 3 seconden stilstaat, vinkt de docent het af als fout.

    • Het Gebrek: Deze docent begrijpt geen context. Als de auto de lijn oversteekt om een vallende tak te ontwijken, zegt het regelboek nog steeds: "Fout!" Het straft slimme, veilige beslissingen af omdat ze technisch gezien een regel overtreden.
  2. De Verwarde Rechter (Nieuwe AI):
    Onlangs zijn mensen fancy AI gaan gebruiken (genaamd Vision-Language Models of VLM's) om als rechters op te treden. Deze AI's kunnen de scène "zien" en begrijpen dat "Oh, de auto is de lijn overgestoken om een boom te ontwijken, dat is oké."

    • Het Gebrek: Deze AI's zijn geweldig in het begrijpen van het verhaal, maar ze zijn slecht in het nauwkeurig meten van afstanden. Ze kunnen zeggen: "De auto is veilig," terwijl de auto eigenlijk op het punt staat te crashen omdat ze de inches niet nauwkeurig kunnen tellen. Ze zijn ook een beetje vaag, waardoor het moeilijk is om te weten waarom ze een bepaalde score gaven.

De Oplossing: DriveJudge (De "Slimme Voorman")

De auteurs creëerden DriveJudge, die fungeert als een Slimme Voorman op een bouwplaats.

In plaats van alleen naar de auto te kijken en te gokken, of alleen een lijstje af te vinken, voert DriveJudge een tweetrapsdans uit:

  1. De "Kijken en Denken"-fase: De AI (de Voorman) kijkt naar de scène en vraagt zich af: "Wat is er hier eigenlijk aan de hand?" Het gebruikt zijn brein om de context te begrijpen. Is er een wegwerkzaamheid? Is er een stilstaande vrachtwagen?
  2. De "Gereedschapselectie"-fase: Op basis van wat het ziet, beslist het welke specifieke gereedschappen het gaat gebruiken.
    • Scenario A: De auto rijdt normaal op een snelweg. De Voorman pakt de "Rijstrookbehoud"-tool en de "Snelheid"-tool.
    • Scenario B: De auto slingert rond een barrière bij een wegwerkzaamheid. De Voorman denkt: "Ah, rijstrookbehoud doet er nu niet toe; de auto moet nu wel in de andere rijstrook zijn om veilig te zijn." Dus legt hij de "Rijstrookbehoud"-tool neer en pakt hij de "Botsingsvermijding"-tool erbij.

Door selectief regels aan of uit te zetten op basis van de situatie, krijgt DriveJudge het beste van beide werelden: de precisie van het rigide regelboek (omdat het echte wiskundige tools gebruikt) en het begrip van de slimme AI (omdat het weet wanneer het de regels moet negeren).

Hoe Ze Dit Testten

Om te bewijzen dat dit werkt, bouwde het team niet zomaar een gokje. Ze bouwden een enorme "Rijexamen"-dataset:

  • Ze verzamelden meer dan 33.000 lastige rijclips (de "long tail" van het rijden, waar vreemde dingen gebeuren).
  • Ze vroegen mensen om deze clips te labelen: "Was dit rijgedrag redelijk, zelfs als het een regel overtrad?"
  • Ze gebruikten deze data om DriveJudge te trainen om te handelen als een menselijke expert.

De Resultaten

Toen ze DriveJudge aan de test onderwierpen tegenover de oude methoden:

  • Het verslaan van het Regelboek: DriveJudge was veel beter in het herkennen van "redelijk" rijgedrag dat het oude regelboek onterecht zou hebben gestraft.
  • Het verslaan van de Verwarde AI: DriveJudge was beter in het kiezen van het veiligste pad dan de AI die alleen op basis van "gevoel" gokte.
  • De Score: In simpele termen behaalde DriveJudge een veel hogere score (21 punten beter op één test, 6,5% beter op een andere) dan de vorige beste methoden.

De Kernboodschap

Het artikel betoogt dat om zelfrijdende auto's echt veilig en slim te maken, we niet alleen kunnen vertrouwen op een lijst met regels of alleen op de mening van een chatbot. We hebben een systeem nodig dat het verhaal van de weg begrijpt en vervolgens de juiste wiskunde toepast om het te beoordelen. DriveJudge is dat systeem: een rechter die weet wanneer hij streng moet zijn en wanneer hij flexibel moet zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →