← Nieuwste papers
💬 NLP

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

Dit artikel introduceert SIGNPOST-Bench, een gecontroleerde contrafactische benchmark bestaande uit 25.555 beeldvarianten om te evalueren hoe multimodale grote taalmodellen conflicten tussen visuele en tekstuele aanwijzingen oplossen, wat onthult dat adversariële tekstinterventies de geolocatie-nauwkeurigheid aanzienlijk verslechteren en onderscheidende arbitragegedragingen blootleggen over 20 geëvalueerde modellen.

Oorspronkelijke auteurs: Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

Gepubliceerd 2026-08-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen: "Waar is deze foto genomen?" Je hebt twee aanwijzingen om je te helpen. De eerste is de visuele scène: de architectuur, de bomen, de auto's en de manier waarop het licht op de gebouwen valt. De tweede is de tekst op borden, etalages of billboards in de foto. Meestal komen deze aanwijzingen overeen. Een bord met "Parijs" staat op een gebouw dat er ook echt uitziet als een gebouw in Parijs. Maar wat gebeurt er als ze niet overeenstemmen? Wat als de foto een besneeuwde, houten hut in de bergen laat zien, maar een fel neonbord in het raam schreeuwt "Welkom in de Sahara-woestijn"?

Dit is de wereld van Multimodale Large Language Models (MLLM's). Dit zijn superintelligente AI-computers die tegelijkertijd afbeeldingen kunnen "zien" en tekst kunnen "lezen". Wetenschappers hebben hen geleerd om deze aanwijzingen te combineren om voorspellingen te doen over de wereld. Maar er is een grote vraag: wanneer de visuele aanwijzingen en de tekstuele aanwijzingen met elkaar in strijd zijn, welke vertrouwt de AI dan? Negeert de AI het verwarrende bord en kijkt hij naar de sneeuw? Of gelooft de AI blindelings het bord en vergeet hij de sneeuw? Tot nu toe hadden we geen goede manier om dit specifieke soort verwarring te testen.

Maak kennis met SIGNPOST-Bench, een nieuw experiment ontworpen door onderzoekers om een spelletje te spelen om de AI te "bedriegen". Ze namen duizenden echte foto's en maakten voor elke foto een speciale set "contrafactische" versies. Denk aan een fotobewerkingsworkshop waarbij ze één originele foto nemen en daar vier nieuwe kopieën van maken:

  1. De Blanke: Ze hebben de tekst volledig weggehaald.
  2. De Gelijke: Ze hebben het bord vervangen door een ander bord dat nog steeds logisch is voor de locatie (bijv. "Welkom in Michigan" veranderen in "Welkom in Detroit").
  3. De Willekeurige: Ze hebben een bord opgehangen dat niets met de plek te maken heeft (bijv. "Welkom op de Maan").
  4. De Adversariële: Dit is de lastige. Ze hebben het bord vervangen door een leugen die naar een specifieke, andere locatie wijst (bijv. "Welkom in Michigan" veranderen in "Welkom in New York").

De onderzoekers vroegen vervolgens aan 20 verschillende AI-modellen van zeven grote technologiebedrijven om de locatie te raden voor alle vijf de versies van elke foto. Ze wilden zien of de AI de leugen zou opmerken of dat de AI door het nieuwe bord zou worden misleid.

De resultaten waren zeer onthullend. Wanneer de AI naar de originele foto's keek, was hij behoorlijk goed in het raden van de locatie. Maar wanneer ze de Adversariële leugens introduceerden, raakten de modellen in de war. Gemiddeld genomen werd de gok van de AI 4,8 keer minder nauwkeurig. In plaats van ongeveer 282 kilometer te ver naast de plank te zitten, zat de AI nu 1.347 kilometer verwijderd van de juiste plek.

Nog interessanter was dat de AI niet alleen slechter werd; de AI werd misleid. Wanneer het bord "New York" zei, gokte de AI niet zomaar wat; de AI bewoog de gok daadwerkelijk dichter naar New York toe. Sterker nog, voor elk getest model zorgde de aanwezigheid van de conflicterende tekst ervoor dat het antwoord richting de leugen bewoog. Ongeveer 6,5% tot 20,1% van de tijd lag de gok van de AI minder dan 50 kilometer van de neplocatie waar het bord naar wees.

De studie toonde ook aan dat het "slim" zijn in het lezen van borden of het zien van plaatjes niet garandeerde dat men goed was in het herkennen van een conflict. Sommige modellen die uitstekend waren in het raden van locaties met schone, eerlijke foto's, waren in werkelijkheid slechter in het negeren van de leugens dan sommige kleinere modellen. Het blijkt dat het vermogen om een bord te lezen niet betekent dat je weet wanneer je het moet negeren als het in tegenspraak is met de rest van de foto.

Ten slotte probeerden de onderzoekers de AI te "coachen" door de AI specifiek te vragen om op conflicten te letten. Hoewel dit de AI hielp om in 49% van de gevallen te beseffen dat er iets mis was, hielp het de AI niet echt om de juiste locatie beter te raden. De AI wist dat hij in de war was, maar hij kon het puzzelstukje nog steeds niet oplossen.

Kortom, dit artikel laat zien dat huidige AI-modellen nog steeds heel gemakkelijk te bedriegen zijn wanneer tekst en afbeeldingen niet overeenstemmen. Ze hebben de neiging om de tekst te veel te vertrouwen, zelfs wanneer het een evidente leugen is. De onderzoekers bouwden deze nieuwe "SIGNPOST-Bench" test om toekomstige AI-ontwikkelaars te helpen precies begrijpen waar hun modellen falen, zodat ze de AI kunnen leren betere detectives te worden die weten wanneer ze hun ogen moeten vertrouwen en wanneer ze de borden in twijfel moeten trekken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →