← Nieuwste papers
💬 NLP

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

Dit artikel introduceert SpurLens, een geautomatiseerde pijplijn die onthult dat Multimodale Grote Taalmodellen (MLLM's) lijden aan significante schijnbiases die leiden tot fouten in objectherkenning en versterkte hallucinaties, terwijl het ook mitigatiestrategieën verkent om hun betrouwbaarheid te verbeteren.

Oorspronkelijke auteurs: Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

Gepubliceerd 2026-07-14
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: SpurLens: Automatische Detectie van Spuriaal Cues in Multimodale LLM's

Probleemstelling

Hoewel unimodale visuele modellen goed gedocumenteerd zijn wat betreft het vertrouwen op spuriale correlaties (niet-essentiële inputkenmerken), blijft de mate waarin Multimodale Large Language Models (MLLM's) vergelijkbare biases vertonen onduidelijk, ondanks hun talige supervisie. De auteurs hypothetiseren dat veel kritieke fouten in MLLM's, specifiek objecthallucinatie (het genereren van feitelijk onjuiste inhoud) en fouten in objectherkenning, voortkomen uit een afhankelijkheid van spuriale cues in plaats van ware objectherkenning.

Bestaande methoden voor het detecteren van deze biases vereisen vaak menselijke supervisie, zijn beperkt tot vooraf gedefinieerde kenmerken, of vertrouwen op computationeel dure analyse van co-occurrence in captions. Bovendien is het onduidelijk of deze biases fundamenteel zijn aan de visuele encoder, het taalmodel, of de fusie, en of eenvoudige prompting-strategieën deze kunnen mitigeren.

Methodologie: SpurLens Pipeline

Het artikel introduceert SpurLens, een geautomatiseerde, ongesuperviseerde pipeline ontworpen om spuriale visuele cues te identificeren en hun impact op de prestaties van MLLM's te kwantificeren. De pipeline werkt in drie hoofdfasen:

  1. Voorstellen van Spuriale Kenmerken:

    • Voor een gegeven doelobject tt maakt het systeem gebruik van GPT-4 om een lijst te genereren van potentiële spuriale cues (objecten of achtergrondelementen) die veel voorkomen met tt.
    • De gegenereerde lijst ondergaat een strikte filtering via GPT-4 om te garanderen dat de kenmerken:
      • Fysiek en visueel waarneembaar zijn.
      • Geen deel uitmaken van het doelobject zelf (bijv. "scherm" is geen cue voor "laptop").
      • Niet onscheidbaar zijn van het doelobject.
      • Detecteerbaar zijn door open-set objectdetectoren.
  2. Identificeren en Ranken van Afbeeldingen:

    • Een open-set objectdetector (OWLv2) wordt gebruikt om een grote beeldendataset te scannen op de aanwezigheid van de voorgestelde spuriale kenmerken.
    • Afbeeldingen worden gerankt op basis van de confidence scores van de gedetecteerde spuriale cues. Dit creëert een "spuriaaliteitsranking" voor elk kenmerk, waardoor het systeem afbeeldingen kan selecteren met de hoogste aanwezigheid van een cue (Top-K) en de laagste aanwezigheid (Bottom-K).
  3. Berekenen van Spuriale Gaten (Spurious Gaps):

    • De gerankte afbeeldingen worden ingevoerd in de doel-MLLM met binaire prompts (bijv. "Is er een [doelobject] in de afbeelding?").
    • Twee kernmetrieken worden berekend:
      • Perceptie-nauwkeurigheid (PA) Gat: Het verschil in herkenningsnauwkeurigheid tussen afbeeldingen die de spuriale cue bevatten en afbeeldingen die dat niet doen. Een groot positief gat duidt op een overmatige afhankelijkheid van de cue voor herkenning.
      • Hallucinatie-ratio (HR) Gat: Het verschil in hallucinatie-ratio's (false positives) tussen afbeeldingen die de cue bevatten en baseline-afbeeldingen. Een groot positief gat geeft aan dat de cue hallucinaties triggert.
    • Het kenmerk dat het grootste gat oplevert, wordt geïdentificeerd als de meest invloedrijke spuriale cue voor die klasse.

Belangrijkste Bijdragen

  • Geautomatiseerde Ontdekking: In tegenstelling tot eerder werk dat menselijke annotatie of vaste feature-sets vereist, ontdekt SpurLens automatisch interpreteerbare spuriale cues over een breed scala aan objecten en datasets zonder menselijke supervisie.
  • Dual Failure Mode Analyse: De studie kwantificeert systematisch twee verschillende faalmodi veroorzaakt door spuriaal bias:
    1. Over-reliance (Overmatige afhankelijkheid): Prestaties dalen significant wanneer spuriale cues worden verwijderd.
    2. Hallucinatie-amplificatie: Spuriale cues triggeren objecthallucinaties met aanzienlijk hogere ratio's dan de baseline.
  • Diagnostische Diepgang: Het framework isoleert de bron van de bias via ablatie-studies, waarbij wordt onderzocht of de bias voortkomt uit de visuele encoder, het taalmodel of het fusieproces, en test de effectiviteit van diverse mitigatiestrategieën.

Experimentele Resultaten

De auteurs evalueerden vijf MLLM's (Qwen2-VL, Qwen-3.5, Llama-3.2, LLaVA-v1.6 en GPT-4o-mini) over drie datasets (HardImageNet, ImageNet Subset en COCO).

1. Fouten in Objectherkenning

  • Het verwijderen van spuriale cues leidt tot significante dalingen in nauwkeurigheid bij alle modellen.
  • Voorbeeld: De nauwkeurigheid van GPT-4o-mini op COCO daalde van 88,0% (met cues) naar 67,6% (zonder cues), een afname van 20,4%.
  • De omvang van de daling varieert per model en dataset, waarbij LLaVA-v1.6 een gat van 16,0% laat zien op COCO.

2. Objecthallucinatie

  • Spuriale cues versterken de hallucinatie-ratio's drastisch.
  • Voorbeeld: In COCO steeg de hallucinatie-ratio voor GPT-4o-mini van 1,4% (geen cues) naar 11,2% (met cues), een 9,8x toename.
  • In de ImageNet-subset was de toename nog prominenter, waarbij sommige modellen tot wel een 18-voudige toename in hallucinatie-ratio's lieten zien wanneer spuriale cues aanwezig waren.

3. Ablatie-studies & Mitigatie

  • Token Dropping: Zelfs wanneer de visuele tokens die overeenkomen met het doelobject kunstmatig werden verwijderd, bleven modellen het doelobject met hoge ratio's blijven hallucineren (bijv. HR > 30% voor sommige modellen), wat suggereert dat de bias niet uitsluitend afhankelijk is van visueel bewijs.
  • Isolatie van de Visuele Encoder: Het trainen van binaire classificators op enkel de embeddings van de visuele encoder onthulde significante spuriale gaten, wat aangeeft dat de bias aanwezig is binnen de visuele representatie zelf, onafhankelijk van het taalmodel.
  • Prompting-strategieën: De auteurs testten verschillende mitigatietechnieken, waaronder prompt ensembling, Chain-of-Thought (CoT) redeneren en het expliciet informeren van het model over potentiële spuriale cues.
    • Resultaat: Hoewel sommige strategieën kleine situationele verbeteringen boden, verlaagde geen enkele de Spuriale Gap significant. Zelfs "valsspelen" door het model de exacte sterkste spuriale cue te geven die door SpurLens is geïdentificeerd, slaagde er niet in om de bias te elimineren.

Betekenis en Claims

Het artikel claimt dat spuriaal bias een diep geworteld, fundamenteel probleem is in huidige MLLM's dat persisteert over verschillende architecturen en datasets. De auteurs stellen dat:

  1. Huidige MLLM's zeer vatbaar zijn voor spuriale correlaties, wat leidt tot systematische fouten in zowel herkenning als generatie.
  2. Eenvoudige mitigatiestrategieën onvoldoende zijn. Talige interventies (prompting) kunnen de onderliggende afhankelijkheid van spuriale cues niet volledig oplossen, aangezien de bias schijnbaar ingebed is in de feature space van de visuele encoder.
  3. Grondige evaluatie nodig is. Het voortbestaan van deze biases vraat om robuustere evaluatiemethoden en mitigatiestrategieën die verder gaan dan de huidige prompting-technieken om de betrouwbaarheid van MLLM's in real-world toepassingen te waarborgen.

De studie concludeert dat SpurLens een schaalbaar, interpreteerbaar instrument biedt voor het diagnosticeren van deze fouten, maar dat de onderliggende oorzaken meer vereisen dan alleen oppervlakkige aanpassingen aan de prompting van het model.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →