← Nieuwste papers
💬 NLP

Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors

Dit artikel diagnosticeert de beperkingen van Vision-Language Models bij het beoordelen van visuele overtuigingskracht, waarbij het hun neiging tot het overvoorspellen van overtuigingskracht onthult als gevolg van een op recall gerichte bias en een onvermogen om objectidentificatie correct af te stemmen op de semantische context, terwijl het aantoont dat prestaties kunnen worden verbeteren door gerichte interventies met betrekking tot Visuele Overtuigingsfactoren (VPF's).

Oorspronkelijke auteurs: Gyuwon Park, Hyounghun Kim

Gepubliceerd 2026-09-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gyuwon Park, Hyounghun Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne wereld zijn afbeeldingen zelden slechts decoraties. Van waarschuwingen voor de volksgezondheid op sigarettensuppakken tot politieke campagneposters: visuele elementen zijn ontworpen om te vormen hoe we denken, voelen en handelen. Dit proces, bekend als visuele overtuigingskracht, rust op een complex samenspel tussen wat we zien en de boodschap die we lezen. Een heldere, vrolijke foto kan een veiligheidstip aanmoedigend laten aanvoelen, terwijl een donkere, rommelige foto diezelfde tip juist bedreigend kan maken. Decennialang hebben psychologen bestudeerd hoe mensen deze signalen verwerken, in het besef dat onze hersenen kleuren, de plaatsing van objecten en de aanwezigheid van mensen meewegen om te bepalen of een boodschap overtuigend is. Nu kunstmatige intelligentie-systemen in staat zijn om afbeeldingen en tekst simultaan te zien en te lezen, is er een cruciale vraag ontstaan: begrijpen deze machines overtuigingskracht op dezelfde manier als mensen, of gokken ze simpelweg op basis van oppervlakkige patronen?

Een team onderzoekers aan de POSTECH in Zuid-Korea zette zich in om dit te beantwoorden door moderne vision-language modellen een rigoureuze test te onderwerpen. Dit zijn geavanceerde computersystemen die een afbeelding kunnen bekijken en een tekstbericht kunnen lezen, om vervolgens te proberen te begrijpen hoe goed de afbeelding de tekst ondersteunt. De onderzoekers begonnen met een zorgvuldig samengestelde collectie van 562 beeld-en-boodschap paren. Dit waren geen willekeurige vondsten van het internet; ze waren geselecteerd omdat menselijke beoordelaars ze al hadden bekeken en het er bijna perfect over eens waren of elk paar zeer overtuigend of niet overtuigend was. Dit creëerde een duidelijke "ground truth" waartegen de computermodellen konden worden afgemeten. Het doel was om te zien of de machines het menselijk oordeel konden evenaren of dat ze iets fundamenteels misten over hoe visuele overtuigingskracht werkt.

De resultaten onthulden een opvallende en consistente fout in de manier waarop deze kunstmatige intelligentiesystemen opereren. Wanneer gevraagd werd om de overtuigingskracht te beoordelen, vertoonden de modellen een sterke bias naar het zeggen van "ja". Ze waren ongelooflijk goed in het oppikken van de afbeeldingen die mensen overtuigend vonden, maar ze waren ook veel te enthousiast in het labelen van niet-overtuigende afbeeldingen als overtuigend. In technische termen behaalden ze een hoge "recall", maar leden ze onder een vloedgolf aan fout-positieven. In essentie over-voorspelden de machines overtuigingskracht; ze beschouwden bijna elke afbeelding die een plausibel visueel element bevatte als een succesvol argument. Ze leken de menselijke capaciteit te missen om te onderscheiden wanneer een visuele aanwijzing slechts aanwezig was versus wanneer deze daadwerkelijk het werk van overtuiging verrichtte.

Om te begrijpen waarom dit gebeurde, braken de onderzoekers de visuele wereld af in specifieke, meetbare componenten die zij Visuele Overtuigingsfactoren noemden. Deze factoren varieerden van de directe sensorische impact van een afbeelding, zoals de kleurrijkheid en helderheid, tot de compositie, zoals of het hoofdonderwerp in het midden staat of op het snijpunt van denkbeeldige rasterlijnen. Ze keken ook naar semantische elementen, zoals of een cruciaal object, een menselijk figuur of een stuk tekst zichtbaar was. Toen de onderzoekers vergeleken hoe mensen en machines deze factoren weging, verscheen er een duidelijke divergentie. Mensen gebruikten deze aanwijzingen met nuance, in het begrip dat een heldere afbeelding overtuigend kan zijn voor een positieve boodschap, maar niet voor een negatieve. De machines behandelden echter de loutere aanwezigheid van een aanwijzing vaak als een garantie voor succes. Als een afbeelding bijvoorbeeld een menselijk gezicht of een specifiek object bevatte dat in de tekst werd genoemd, waren de modellen waarschijnlijk geneigd te verklaren dat het overtuigend was, zelfs als de algehele context anders suggereerde. Ze vergistten de ingrediënten van een recept voor het voltooide gerecht.

De studie onderzocht vervolgens of het geven van explicietere instructies aan de machines dit probleem kon oplossen. De onderzoekers probeerden twee hoofdbenaderingen. Eerst voedden ze de modellen met gedetailleerde kennis over de visuele factoren, waarbij ze hen bijvoorbeeld vertelden dat de aanwezigheid van een persoon behandeld moest worden als een ondersteunende aanwijzing in plaats van een beslissende factor. Ten tweede vroegen ze de modellen om stap voor stap na te denken, waarbij ze hun redenering uiteenzetten voordat ze een definitief oordeel vellen. De bevindingen waren genuanceerd. Het bieden van de juiste context aan de modellen – specifiek door deze visuele aanwijzingen te kaderen als iets dat geïnterpreteerd moet worden in plaats van een vaste regel – hielp inderdaad het aantal fouten te verminderen. Echter, het simpelweg vragen aan de modellen om over het probleem te redeneren of het aanwijzen van de aanwezigheid van een object was niet voldoende. In sommige gevallen maakte het dwingen van de modellen om met expliciete aanwijzingen te redeneren de bias zelfs erger, waardoor ze harder in hun onjuiste oordelen gingen staan.

De kern van het probleem, ontdekten de onderzoekers, lag in een specifieke bottleneck in het redeneerproces van de machine. Wanneer het team de stapsgewijze verklaringen analyseerde die de modellen genereerden, stelden zij vast dat de machines over het algemeen goed waren in het identificeren van objecten en het beschrijven van de tekst. Ze konden ook uitleggen hoe een object zich tot een boodschap zou kunnen verhouden. De fout trad op in de laatste stap: het verbinden van dat bewijs aan het uiteindelijke doel van de communicatie. De modellen worstelden met de beslissing of het gevonden visuele bewijs daadwerkelijk de beoogde boodschap ondersteunde of dat het slechts een toevalstreffer was. Ze konden de onderdelen zien, maar konden ze niet betrouwbaar synthetiseren tot een samenhangend oordeel over de intentie.

Dit onderzoek suggereert dat hoewel kunstmatige intelligentie enorme vooruitgang heeft geboekt in het herkennen van wat er in een afbeelding zit, het nog steeds een diep, contextueel begrip mist van waarom die afbeelding ertoe doet. De machines zijn momenteel uitstekend in het opsporen van de ingrediënten van overtuigingskracht, maar slecht in het proeven van het eindproduct. Ze gaan er vaak van uit dat als de juiste visuele elementen aanwezig zijn, de boodschap wel overtuigend moet zijn, waarbij ze de subtiele menselijke capaciteit om context, toon en intentie te wegen negeren. De studie concludeert dat voor deze systemen om werkelijk visuele overtuigingskracht te begrijpen, ze verder moeten gaan dan enkel het identificeren van objecten en moeten leren die observaties te verbinden aan het communicatieve doel dat erachter schuilgaat. Totdat ze die sprong kunnen maken, zullen ze vatbaar blijven voor het zien van overtuigingskracht waar die niet is, waarbij ze de aanwezigheid van een aanwijzing verwarren met de kracht van een boodschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →