← Nieuwste papers
💻 computer science

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

DO-Bench is een nieuwe diagnostische benchmark die objecthallucinaties in vision-language modellen analyseert door fouten systematisch te herleiden naar ofwel de invloed van tekstuele voorkennis (priors) ofwel tekortkomingen in de visuele waarneming.

Oorspronkelijke auteurs: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

Gepubliceerd 2026-04-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een vriend hebt die een heel goede fotograaf is, maar soms een beetje een "bevestigingsdrang" heeft. Als je hem een foto laat zien van een kamer, zegt hij meteen: "Oh, wat een mooie bank!" – zelfs als er helemaal geen bank in de kamer staat. Of nog erger: hij ziet een stoel, maar zegt: "Ik zie hier geen stoel."

Dat is precies wat er misgaat bij moderne AI-modellen (Vision-Language Models). Ze "hallucineren": ze zien dingen die er niet zijn, of ze negeren dingen die er wél zijn.

De onderzoekers van dit paper hebben DO-Bench gemaakt: een soort "psychologische test" voor AI, om erachter te komen waarom die fouten worden gemaakt.

De twee boosdoeners: De "Luie Blik" en de "Suggereerbare Geest"

De onderzoekers ontdekten dat AI-fouten meestal uit twee verschillende bronnen komen. Om dit uit te leggen, gebruiken we een metafoor:

1. De Luie Blik (Perceptie-probleem)

Stel je voor dat je in een rommelige kamer staat en ik vraag: "Is er een klein muntje op de grond?" Je kijkt even snel naar de hele kamer, ziet de chaos en zegt: "Nee." Je hebt het niet gezien, niet omdat je liegt, maar omdat je blik niet scherp genoeg was of je te weinig details zag.

  • In de AI-wereld: De AI ziet het object wel, maar de afbeelding is te druk of het object is te klein. De AI "ziet" het simpelweg niet goed genoeg.

2. De Suggereerbare Geest (Prior-probleem)

Stel je nu voor dat ik je een foto laat zien van een keuken, en ik zeg met een heel overtuigende stem: "Kijk eens naar die prachtige koelkast!" Zelfs als er in die keuken helemaal geen koelkast staat, ben je geneigd om te knikken en te zeggen: "Ja, die koelkast is mooi." Je brein vult het gat in omdat je verwacht dat er een koelkast hoort te staan.

  • In de AI-wereld: De tekst die de AI krijgt (de "prompt"), stuurt de AI de verkeerde kant op. De AI vertrouwt meer op wat de tekst zegt dan op wat de foto laat zien.

Hoe werkt de DO-Bench test?

In plaats van de AI gewoon één foto te laten zien en te vragen "Wat zie je?", spelen de onderzoekers een spelletje met de AI om de grenzen op te zoeken:

  • De Zoom-test (Tegen de Luie Blik): Ze laten de AI eerst de hele foto zien. Als de AI een object mist, geven ze de AI een "vergrootglas" (een ingezoomde foto van alleen het object). Als de AI het object dan wél ziet, weten we: "Ah, de AI was niet dom, hij had alleen een scherper oog nodig."
  • De Fluister-test (Tegen de Suggereerbare Geest): Ze laten de AI dezelfde foto zien, maar ze veranderen de tekst steeds meer. Ze beginnen met: "Is er een hond?" en eindigen met: "Ik weet zeker dat er een hond is, is er een hond?" Als de AI bij de laatste vraag ineens "Ja" zegt (terwijl er geen hond is), weten we: "De AI is te makkelijk beïnvloedbaar door tekst."

Waarom is dit belangrijk?

Tot nu toe werden AI-modellen beoordeeld op een soort "algemeen cijfer" (zoals een 7 voor een examen). Maar een 7 kan betekenen dat je heel goed bent in rekenen maar slecht in taal, óf andersom.

DO-Bench geeft een gedetailleerd rapportcijfer:

  • "Deze AI heeft een geweldig oog (hoge PerceptionAbility), maar hij is een enorme meeloper en gelooft alles wat je zegt (lage PriorRobust)."

Door dit onderscheid te maken, kunnen wetenschappers gericht werken aan de zwakke plekken. Ze kunnen de "ogen" van de AI verbeteren, of de "wilskracht" van de AI versterken, zodat hij niet meer zomaar alles gelooft wat de tekst hem vertelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →