← Nieuwste papers
💬 NLP

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

Dit artikel toont aan dat het verschaffen van contexten met reële afbeeldingen aan vision-language modellen hun prestaties bij lexicale beoordelingen van concretie en beeldend vermogen vaak verslechtert door gevoeligheid voor toevallige visuele aanwijzingen in te brengen, wat wijst op de noodzaak van een betere kalibratie van wanneer visuele input dergelijke taken moet informeren.

Oorspronkelijke auteurs: Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een toets maakt waarbij je moet raden hoe "tastbaar" of "voorstelbaar" een specifiek woord is. Bijvoorbeeld: is het woord "appel" makkelijk voor te stellen? Ja. Is het woord "vrijheid" makkelijk voor te stellen? Niet echt.

Nu, stel je voor dat je deze toets maakt terwijl iemand je naast het woord een willekeurige afbeelding laat zien.

Dit artikel onderzoekt wat er gebeurt wanneer moderne AI-modellen (zogenaamde Vision-Language Models) deze toets maken. De onderzoekers wilden zien of het tonen van een afbeelding aan de AI helpt om het woord beter te begrijpen, of dat de afbeelding de AI eigenlijk afleidt en ertoe leidt dat het een slechter antwoord geeft.

Hier is de uiteenzetting van hun bevindingen met behulp van eenvoudige analogieën:

1. De Opzet: De "Aflerende Klas"

De onderzoekers gaven de AI een lijst met woorden en vroegen het om deze te beoordelen op een schaal van "hoe concreet" (echt/aanraakbaar) of "hoe makkelijk voor te stellen" ze zijn.

  • De controlegroep: De AI zag alleen het woord (of een leeg wit vierkant).
  • De testgroep: De AI zag het woord plus een echte foto die van internet was opgehaald.

De grote verrassing:
Je zou denken: "Als ik een AI een afbeelding van een 'hond' laat zien, zou het dan beter moeten zijn om te weten dat 'hond' een concreet woord is." En voor simpele, concrete woorden deed de AI het prima.

Echter, voor abstracte woorden (zoals "gerechtigheid", "vrijheid" of "natuur") maakten de afbeeldingen de AI slechter.

  • De analogie: Stel je een student voor die een wiskundetoets maakt. Als je hen een afbeelding van een rekenmachine naast de vraag "Wat is 2+2?" geeft, krijgen ze het misschien goed. Maar als je hen vraagt: "Is het concept van 'eerlijkheid' moeilijk of makkelijk voor te stellen?" en je geeft hen een afbeelding van een zonsondergang, raakt de student in de war. Ze kijken naar de prachtige zonsondergang en zeggen: "Oh, dat is heel tastbaar en echt!" en geven het woord "eerlijkheid" een hoge score voor "echt", zelfs al is het woord zelf dat niet. De afbeelding fungeerde als een luidruchtige, afleidende buur die het verkeerde antwoord schreeuwt.

2. De "Mens versus Robot" Vergelijking

Om zeker te weten dat dit niet gewoon een vreemd AI-probleem was, vroegen de onderzoekers echte mensen om dezelfde toets te maken.

  • Het resultaat: Mensen werden ook lichtelijk afgeleid door de afbeeldingen, maar ze stortten niet in. Ze wisten dat de afbeelding slechts een decoratie was.
  • Het AI-probleem: De AI behandelde de afbeelding echter als hard bewijs. Het kon geen onderscheid maken tussen "een afbeelding van een hond" (wat bewijst dat het woord 'hond' echt is) en "een afbeelding van een zonsondergang" (wat niets te maken heeft met het woord 'vrijheid'). De AI begon te gokken op basis van de inhoud van de afbeelding in plaats van de betekenis van het woord.

3. Waarom gebeurde dit? (De "Interne Glitch")

De onderzoekers keken in het "brein" van de AI (zijn interne datalagen) om te zien wat er misging.

  • De verschuiving: Toen de AI een echte afbeelding zag, verschoven zijn interne begrip van het woord daadwerkelijk. Het was alsof het brein van de AI plotseling besliste: "Oh, ik kijk nu naar een afbeelding, dus ik moet antwoorden op basis van wat ik zie, niet wat ik lees."
  • De gevoeligheid: De AI werd buitensporig gevoelig voor "spurious cues" (schijnbare aanwijzingen). Dit is een chique manier van zeggen dat het vasthield aan willekeurige details in de foto die niets met het woord te maken hadden. Voor abstracte woorden veroorzaakte dit dat de AI overschatte hoe "echt" het woord was.

4. De Oplossing: De "Opmerking van de Leraar"

Omdat de AI werd afgeleid, probeerden de onderzoekers een eenvoudige truc. Ze voegden een kleine instructie toe aan de prompt, zoals een notitie van een leraar:

"Hé, deze afbeelding heeft misschien niets te maken met het woord. Negeer de afbeelding en beoordeel gewoon het woord zelf."

Het resultaat:

  • Deze simpele notie fungeerde als een mentaal filter. Het vertelde de AI om te stoppen met kijken naar de afleidende buur en zich te concentreren op de toetsvraag.
  • De prestaties van de AI verbeterden aanzienlijk, vooral voor die lastige abstracte woorden. Het loste niet alles perfect op, maar het voorkwam dat de AI de grootste fouten maakte.

Samenvatting

Het artikel concludeert dat we vaak aannemen dat het geven van afbeeldingen aan AI het slimmer maakt, maar soms zijn de afbeeldingen eigenlijk een valstrik.

  • Voor concrete dingen (zoals een afbeelding van een kat die je helpt het woord "kat" te identificeren), helpen afbeeldingen.
  • Voor abstracte dingen (zoals een afbeelding van een storm die je helpt het woord "vrede" te identificeren), verwarren afbeeldingen de AI, waardoor het zich richt op de verkeerde aanwijzingen.

De oplossing is niet om afbeeldingen te stoppen met gebruiken, maar om de AI te leren wanneer ze ze moet negeren. Net zoals een goede student weet wanneer hij naar een diagram moet kijken en wanneer hij zijn ogen moet sluiten en na moet denken over het concept, moeten deze AI-modellen leren wanneer de visuele context een nuttige hint is en wanneer het gewoon ruis is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →