← Nieuwste papers
💬 NLP

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

Dit artikel stelt In-Context Visual Contrastive Optimization (IC-VCO) voor, een wiskundig rigoureus kader dat wordt versterkt door Visual Contrast Distillation en precieze hard negative generatie, om multimodale hallucinaties in Vision-Language Modellen effectief te mitigeren door de beperkingen van bestaande visuele preferentiemethoden aan te pakken.

Oorspronkelijke auteurs: Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

Gepubliceerd 2026-06-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Dromende" AI

Stel je een zeer slimme student (de AI) voor die een toets maakt over een foto. De student is erg goed in lezen en praten, maar soms, wanneer hij naar een foto kijkt, raakt hij afgeleid en begint hij te "dag te dromen". Hij kan dingen beschrijven die er niet zijn of de dingen die daadwerkelijk in de foto staan negeren, omdat hij vertrouwt op wat hij denkt dat er normaal gesproken gebeurt in die situatie. Dit wordt multimodale hallucinatie genoemd.

Lama tijd probeerden leraren (onderzoekers) dit op te lossen door simpelweg de woorden van de student te corrigeren. Ze zeiden: "Je zei dat er een kat was, maar de foto laat een hond zien. Probeer het opnieuw." Maar het paper betoogt dat dit niet genoeg is, omdat de leraar de student niet dwong om echt goed naar de foto te kijken; ze corrigeerden alleen de tekst.

De Oude Manier: De "Vervang en Vergeet"-methode

Eerdere pogingen om dit op te lossen involveerden een methode van "visuele voorkeur". Stel je voor dat je de student twee verschillende foto's laat zien:

  1. Foto A: Een echte foto van een hond.
  2. Foto B: Een totaal andere foto van een kat.

De leraar vraagt: "Welke foto past bij de zin 'Er is een hond'?"

  • De Fout 1 (Het Wiskundige Probleem): De oude methode probeerde het antwoord van de student voor Foto A te vergelijken met Foto B. Echter, omdat de foto's zo verschillend waren, werd de wiskunde achter de training "rommelig". Het was alsof je probeerde de prijs van een appel te vergelijken met de prijs van een auto om te bepalen welke een betere vrucht is. De vergelijking was niet eerlijk of wiskundig onderbouwd.
  • De Fout 2 (De Cheatcode): De "slechte" foto (Foto B) was vaak zo overduidelijk anders (misschien een andere stijl, belichting of achtergrond) dat de student kon valsspelen. In plaats van te leren hoe hij een hond moet herkennen, leerde de student simpelweg: "Oh, als de foto er vreemd uitziet of een andere achtergrond heeft, dan is dat het foute antwoord." Ze namen een afkorting in plaats van te leren kijken naar de fijne details.

De Nieuwe Oplossing: IC-VCO

De auteurs stellen een nieuw framework voor genaamd IC-VCO (In-Context Visual Contrastive Optimization). Zie dit als een slimmere, meer rigoureuze trainingskamp.

1. De "Naast Elkaar"-vergelijking (In-Context Visual Contrast)

In plaats van de student twee verschillende toetsen op verschillende dagen te laten maken, legt IC-VCO beide foto's tegelijkertijd op hetzelfde bureau.

  • De Opstelling: De student ziet Foto A (de hond) en Foto B (de kat) naast elkaar.
  • De Instructie: De leraar wijst en zegt: "Kijk voor deze specifieke vraag alleen naar de eerste foto." Dan, voor de volgende vraag, zegt hij: "Kijk nu alleen naar de tweede foto."
  • Waarom het werkt: Omdat beide foto's in dezelfde "context" (op hetzelfde bureau) staan, werkt de wiskunde perfect. De student kan niet valsspelen door naar de achtergrondstijl te kijken, omdat de achtergronden identiek zijn; hij moet zich concentreren op het specifieke object waar de leraar naar wijst. Dit lost het probleem van de "rommelige wiskunde" op.

2. De "Chirurgische Bewerking" (Contrastive Sample Editing)

Om te voorkomen dat de student afkortingen neemt, hebben de auteurs een nieuwe manier bedacht om de "foute" foto's te maken.

  • Oude Manier: Ze zouden een compleet nieuwe afbeelding vanaf nul genereren. Het was alsofd je de hele klaslokaal verving door een ander lokaal. De student kon dan gemakkelijk zeggen: "Dit is niet de juiste kamer."
  • Nieuwe Manier (Chirurgische Bewerking): Ze nemen de originele foto en maken een kleine, precieze verandering.
    • Voorbeeld: Als de foto een rode appel heeft, veranderen ze deze chirurgisch in een groene appel, maar houden ze de tafel, de belichting en de achtergrond exact hetzelfde.
    • Het Resultaat: De student kan niet valsspelen door naar de achtergrond te kijken. Hij moet goed kijken om te zien dat de appel groen is en niet rood. Dit dwingt de AI om fijnmazige details te leren in plaats van te gokken op basis van de algemene sfeer.

3. De "Brug" (Visual Contrast Distillation)

Er is één addertje onder het gras: de training vindt plaats met twee foto's op het bureau, maar in de echte wereld ziet de AI meestal maar één foto tegelijk.

  • Het Probleem: Als je de student alleen traint op "naast elkaar"-vergelijkingen, kan hij in de war raken wanneer hij alleen is in een kamer met slechts één foto.
  • De Oplossing (Distillatie): De auteurs hebben een "brug"-stap toegevoegd. Ze gebruiken de prestaties van de student op de "naast elkaar"-test als een gids om hen te helpen hun prestaties op de "enkele foto"-test te verbeteren. Het is alsof een coach de student ziet oefenen met een partner en hem vervolgens tips geeft over hoe hij die vaardigheden kan toepassen wanneer hij alleen oefent.

De Resultaten

Het paper heeft deze nieuwe methode getest op vijf verschillende "examens" (benchmarks) die ontworpen zijn om AI-hallucinaties te vangen.

  • De Uitkomst: De IC-VCO-methode presteerde beter dan alle voorgaande methoden.
  • Het Geheime Ingrediënt: De "Chirurgische Bewerking" (het maken van kleine, precieze veranderingen in de foto's) was de sleutel. Het bewees dat wanneer je de AI "moeilijke" voorbeelden geeft die bijna identiek zijn maar één klein verschil hebben, de AI veel beter leert om op de details te letten.

Samenvatting

Kortom, het paper zegt: om te voorkomen dat AI dingen verzint over plaatjes, moet je het niet alleen verschillende plaatjes laten zien. Laat het twee plaatjes naast elkaar zien en dwing het om ze te vergelijken. Bovendien moet je de "foute" plaatje maken door een klein detail aan te passen in de originele plaatje, in plaats van het hele plaatje te vervangen. Dit dwingt de AI om te stoppen met gokken en echt te gaan kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →