← Nieuwste papers
💻 computer science

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

Dit artikel introduceert VLM-UQBench, een nieuwe benchmark die de onzekerheid in vision-language modellen analyseert door te bepalen of fouten voortkomen uit de afbeelding, de tekst of de interactie tussen beide, waarbij de auteurs aantonen dat huidige methoden tekortschieten in het detecteren van subtiele, modaliteit-specifieke onzekerheden en hallucinaties.

Oorspronkelijke auteurs: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

Gepubliceerd 2026-02-11
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robotassistent hebt die je helpt in de keuken of in het ziekenhuis. Je vraagt: "Is dit een giftige paddenstoel?" of "Hoeveel pillen liggen er op de tafel?"

Een goede assistent moet niet alleen antwoorden, maar ook kunnen zeggen: "Ik weet het niet zeker, de foto is te wazig" of "Je vraag is onduidelijk." Dit noemen we Uncertainty Quantification (UQ): het vermogen van een computer om te weten hoe onzeker hij is.

Dit wetenschappelijke artikel, VLM-UQBench, onderzoekt hoe goed moderne "Vision-Language Models" (modellen die zowel kunnen kijken als praten) dit kunnen.

Hier is de uitleg in begrijpelijke taal:

1. Het probleem: De "Zelfverzekerde Leugenaar"

De huidige AI-modellen lijden vaak aan een soort digitale hoogmoed. Als je ze een wazige foto laat zien of een verwarrende vraag stelt, geven ze vaak een antwoord met een enorme stelligheid, terwijl ze er eigenlijk totaal naast zitten. Dit noemen we hallucinaties.

Het probleem is dat we niet weten waarom de AI twijfelt. Komt het door:

  • De ogen (Beeld): Is de foto te donker of wazig?
  • De oren (Tekst): Is de vraag grammaticaal onzin of te vaag?
  • De samenwerking (Cross-modaal): Past de vraag wel bij wat er op de foto staat?

2. De oplossing: De "Stress-test" (VLM-UQBench)

De onderzoekers hebben een soort "examen" gebouwd voor deze AI-modellen, genaamd VLM-UQBench. Je kunt dit vergelijken met een crash-test voor auto's, maar dan voor het brein van een computer.

In plaats van alleen te kijken of de AI het juiste antwoord geeft, doen ze het volgende:

  • De Sabotage-methode: Ze nemen een perfecte foto en een duidelijke vraag, en gaan die vervolgens expres "slopen". Ze maken de foto wazig, voegen ruis toe, maken de tekst vol spelfouten, of veranderen de vraag zo dat hij niet meer bij de foto past.
  • De Diagnose: Ze kijken of de AI "zweet". Als de foto waziger wordt, gaat de onzekerheidsscore van de AI dan ook omhoog? Of blijft de AI onverstoorbaar en zelfverzekerd doorgaan met het verzinnen van onzin?

3. Wat hebben ze ontdekt? (De harde realiteit)

De resultaten zijn een beetje teleurstellend voor de AI-ontwikkelaars. De onderzoekers vonden drie belangrijke dingen:

  1. Iedere AI is anders: De ene AI is heel goed in het herkennen van een slechte tekst, maar merkt totaal niet dat een foto wazig is. Het is alsof je een expert hebt die fantastisch kan horen, maar blind is.
  2. De "Blind Spot" voor beelden: De meeste huidige methoden zijn heel slecht in het detecteren van onzekerheid die uit het beeld komt. De AI blijft vaak maar wat roepen, zelfs als hij eigenlijk niets ziet.
  3. De link met leugens is zwak: Het belangrijkste: de huidige manieren om onzekerheid te meten, voorspellen niet goed wanneer de AI gaat hallucineren (liegen). De AI kan een heel hoog "zelfvertrouwen" scoren, terwijl hij ondertussen een compleet verzonnen verhaal vertelt.

Samenvatting in een metafoor

Stel je de AI voor als een student die een examen maakt. De onderzoekers hebben niet alleen gekeken naar de cijfers op het examen, maar ze hebben ook de bril van de student beslagen, de vragen in een vreemd handschrift geschreven en de tekst van de vragen veranderd.

Ze ontdekten dat de student (de AI) vaak nog steeds met een strak gezicht en een luidruchtige stem antwoorden geeft, zelfs als hij de vraag niet kan lezen of de afbeelding niet kan zien. VLM-UQBench is de spiegel die de AI laat zien: "Je weet het eigenlijk niet, stop met gokken!"

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →