← Nieuwste papers
💬 NLP

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

Dit artikel introduceert een nieuwe benchmark voor autonoom rijden die multi-view multimodale grote taalmodellen evalueert op hun vermogen om correct de specifieke camerabeelden te identificeren die een antwoord ondersteunen, waardoor grondingsfouten worden blootgelegd die traditionele evaluaties die alleen op antwoorden gericht zijn, missen.

Oorspronkelijke auteurs: Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: "Heb je op de juiste plek gekeken?"

Stel je voor dat je een zeer moeilijke toets maakt met een team van zes vrienden om je heen. Elke vriend houdt een camera vast en ze filmen allemaal precies dezelfde straatscène vanuit verschillende hoeken: één aan de voorkant, één aan de achterkant en vier aan de zijkanten.

De leraar stelt een lastige vraag over de scène, zoals: "Wat is de voetganger bij het gebouw waarschijnlijk aan het doen?"

In het verleden gaven onderzoekers alleen om het juiste antwoord. Als je zei: "Ze wachten om over te steken," en dat was waar, dan kreeg je een gouden ster.

Dit paper betoogt dat dat niet genoeg is.

De auteurs zeggen: Wat als je het juiste antwoord gaf, maar je eigenlijk naar de camera van de verkeerde vriend keek? Misschien was de voetganger duidelijk zichtbaar in de "Links Achter"-camera, maar raadde jouw team het antwoord op basis van de "Voor"-camera (misschien omdat ze het antwoord gokten op basis van algemene kennis in plaats van naar het bewijs te kijken).

Het paper introduceert een nieuwe test om te zien of AI-modellen niet alleen de vraag kunnen beantwoorden, maar ook naar de specifieke camerabeelden kunnen wijzen die het bewijs bevatten.

De Nieuwe Test: De "Zes-Camera" Uitdaging

De onderzoekers hebben een benchmark (een gestandaardiseerde test) gebouwd met behulp van gegevens uit NuScenes, een populaire dataset van autonome rijscènes.

  • De Opstelling: De AI krijgt zes gesynchroniseerde videoframes te zien van de surround-view camera's van een auto.
  • De Taak: De AI moet twee dingen doen:
    1. Identificeren welke specifieke camera (bijv. "Links Voor") het visuele bewijs bevat dat nodig is om de vraag te beantwoorden.
    2. De vraag zelf beantwoorden.
  • De "Gouden" Waarheid: De onderzoekers hebben elke vraag handmatig gecontroleerd en precies bepaald welke camera gebruikt had moeten worden. Dit wordt de "Golden View" genoemd.

De Drie Manieren waarop ze de AI Testten

Om te begrijnder waar de AI faalt, hebben ze drie verschillende soorten tests uitgevoerd:

  1. De "Vind het Bewijs" Test (View Selection):
    De AI ziet alle zes de camera's en moet simpelweg naar de camera met het antwoord wijzen. De AI hoeft de vraag nog niet te beantwoorden; hij hoeft alleen de juiste bron te vinden.

    • Analogie: De leraar vraagt: "Welke vriend heeft de foto van de kat?" De student hoeft alleen maar naar de juiste vriend te wijzen.
  2. De "Oracle" Test (Perfecte Omstandigheden):
    De onderzoekers geven de AI alleen het juiste camerabeeld (de Golden View) en stellen de vraag.

    • Analogie: De leraar geeft de student de exacte foto van de kat en vraagt: "Wat is de kat aan het doen?" Dit test of de student correct kan redeneren wanneer het bewijs op een zilveren dienblad aan hem wordt gepresenteerd.
  3. De "Full Loop" Test (De Werkelijkheid):
    De AI ziet alle zes de camera's en moet zowel de juiste camera kiezen als de vraag beantwoorden in één keer.

    • Analogie: De student kijkt naar alle zes de vrienden, kiest de juiste vriend uit, en beantwoordt dan de vraag. Dit is de moeilijkste test, want als ze de verkeerde vriend kiezen, falen ze, zelfs als hun antwoord toevallig goed is.

Wat ze Vonden: Het "Hallucinatie" Probleem

De resultaten waren verrassend en onthulden een verborgen gebrek in veel geavanceerde AI-modellen:

  • De "Gelukkige Gok" Valstrik: Veel modellen kregen het juiste antwoord, maar wezen naar de verkeerde camera.

    • Voorbeeld: Een model kan zeggen: "De voetganger wacht om over te steken" (Correct Antwoord), maar beweren dat ze het zagen in de "Voor"-camera (Verkeerd Bewijs), terwijl de voetganger eigenlijk alleen zichtbaar was in de "Links Achter"-camera.
    • Dit suggereert dat de AI aan het gokken is of "taalkundige afkortingen" gebruikt (weten dat voetgangers meestal wachten) in plaats van daadwerkelijk het bewijs te zien.
  • De "Front-Camera Bias": Zelfs wanneer het bewijs duidelijk in de zij- of achtercamera's zat, hielden veel modellen koppig vol dat het antwoord in de "Voor"-camera zat. Het is als een detective die weigert ergens anders dan bij de voordeur te kijken, zelfs als de aanwijzingen duidelijk in de achtertuin liggen.

  • Het Gat tussen Proprietary en Open Modellen:

    • De grote, dure "proprietary" modellen (zoals Claude en GPT) waren veel beter in het vinden van de juiste camerabeelden (rond de 75–80% nauwkeurigheid).
    • De open-source modellen hadden veel meer moeite; sommige waren in minder dan 13% van de gevallen correct.

Waarom dit Belangrijk is voor Zelfrijdende Auto's

Het paper benadrukt dat in zelfrijdende auto's betrouwbare redenering net zo belangrijk is als een correcte beslissing.

Als een zelfrijdende auto besluit te remmen omdat hij een kind ziet, maar hij "denkt" dat hij het kind in de voorste camera zag terwijl het kind eigenlijk links achter de auto stond, dan is de interne logica van de auto kapot. Als het systeem het fout heeft over waar het het gevaar heeft gezien, zal het in een iets andere situatie falen.

De Kern van het Verhaal

Dit paper beweert niet dat het de AI heeft opgelost. In plaats daarvan heeft het een diagnostisch hulpmiddel gebouwd.

Denk aan een arts die een patiënt een nieuwe soort röntgenfoto geeft. Voorheen controleerde de arts alleen of de patiënt kon lopen (het uiteindelijke antwoord). Nu controleren ze of de patiënt zijn benen wel echt goed gebruikt of dat hij ze gewoon voortsleept en op het beste reageert.

Het paper concludeert dat door de stap van "het vinden van het bewijs" te scheiden van de stap van "het beantwoorden", we eindelijk kunnen zien welke AI-modellen de wereld echt "zien" en welke modellen gewoon aan het gokken zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →