← Nieuwste papers
💻 computer science

VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs

Dit paper introduceert VGS-Decoding, een trainingsvrije methode die hallucinaties in medische Vision-Language Models vermindert door tijdens de inferentie token-kansen dynamisch aan te passen op basis van hun visuele afhankelijkheid, wat leidt tot significante prestatieverbeteringen zonder extra training.

Oorspronkelijke auteurs: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

Gepubliceerd 2026-03-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat dromerige arts-assistent hebt. Deze assistent is getraind op miljoenen medische boeken en foto's. Hij kan vragen beantwoorden over röntgenfoto's, maar hij heeft een groot nadeel: hij fantaseert soms.

Als hij een foto ziet, kijkt hij niet alleen naar de foto zelf, maar luistert hij ook naar wat hij in zijn boeken heeft gelezen. Soms is hij zo overtuigd van wat in de boeken staat, dat hij iets zegt dat logisch klinkt, maar dat niet op de foto staat. In de medische wereld is dit gevaarlijk: als hij denkt dat er een breuk is waar er geen is, kan dat leiden tot verkeerde behandelingen.

De onderzoekers van dit paper hebben een slimme oplossing bedacht om deze "dromerige" assistent te corrigeren, zonder dat ze hem opnieuw hoeven te trainen. Ze noemen hun methode VGS-Decoding.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het probleem: De "Dromer" vs. De "Waarnemer"

Stel je voor dat je de assistent een foto van een hart toont en vraagt: "Is het hart links of rechts?"

  • De hallucinatie: De assistent denkt: "In 90% van de boeken staat het hart links, dus ik zeg 'links'." Hij kijkt niet eens goed naar de foto.
  • De realiteit: Op deze specifieke foto is het hart verschoven naar rechts.

2. De oplossing: De "Vervormde Spiegel"

De onderzoekers hebben een truc bedacht. Ze nemen de originele foto en maken er een vervormde kopie van. Ze voegen er ruis aan toe, alsof de foto door een vieze, beslagen ruit wordt bekeken of alsof er een beetje statische ruis op zit.

Vervolgens laten ze de assistent naar beide foto's kijken (de schone en de vervormde) en vragen ze hem om zijn antwoord te geven.

Hier gebeurt het magische:

  • De echte waarnemer (Visueel verankerd woord): Als de assistent echt naar de foto kijkt, ziet hij op de vervormde foto minder details. Zijn vertrouwen in het juiste antwoord (bijv. "rechts") daalt omdat de bevestiging op de foto minder duidelijk is.
  • De dromer (Hallucinerend woord): Als de assistent gewoon uit zijn hoofd roept wat hij denkt dat waar is (bijv. "links", omdat dat in de boeken staat), maakt de vervormde foto hem niet uit. Zijn vertrouwen blijft hoog of gaat zelfs omhoog, omdat hij niet naar de foto kijkt, maar naar zijn eigen gedachten.

3. De "Vertrouwensscore" (VGS)

De computer berekent nu voor elk woord dat de assistent wil zeggen een Vertrouwensscore (Visual Grounding Score):

  • Hoge score: Het woord is afhankelijk van de foto. (Goed! Dit is een echte observatie).
  • Lage of negatieve score: Het woord blijft hetzelfde of wordt sterker, zelfs als de foto slecht is. (Slecht! Dit is waarschijnlijk een fantasie).

4. De "Rem en Gaspedaal"

Tijdens het schrijven van het antwoord gebruikt de computer deze score als een rem en gaspedaal:

  • Woorden met een hoge score (echte observaties) krijgen een gaspedaal: ze worden sterker en krijgen meer kans om gekozen te worden.
  • Woorden met een lage score (fantasieën) krijgen een rem: hun kans wordt verkleind, zodat ze niet gekozen worden.

Waarom is dit zo speciaal?

Vroeger probeerden andere methoden om hallucinaties te stoppen door zware straffen uit te delen of door te vergelijken met andere lagen in het brein van de AI. Dit werkte vaak niet goed voor medische foto's, omdat medische antwoorden vaak kort en specifiek zijn. Het was alsof je probeerde een chirurg te corrigeren door hem te dwingen te praten als een dichter.

Deze nieuwe methode (VGS-Decoding) is:

  1. Snel: Het kost maar twee keer zo lang om een antwoord te genereren (eenmalig extra check), wat prima is voor ziekenhuizen.
  2. Slim: Het past zich aan elk woord aan. Het straft alleen de fantasieën, niet de echte medische termen.
  3. Effectief: In tests met verschillende medische AI's (zoals LLaVA-Med en CheXagent) verbeterde het de resultaten met wel 9%, terwijl andere methoden de resultaten soms zelfs verslechterden.

Kortom:
Stel je voor dat je een assistent hebt die soms droomt. In plaats van hem te verbieden om te dromen, geef je hem een vervormde bril op. Als hij door die bril kijkt en zijn antwoord verandert, weet je dat hij echt naar de foto keek. Als zijn antwoord hetzelfde blijft, weet je dat hij droomde. VGS-Decoding is die bril die zorgt dat de assistent eindelijk echt naar de patiënt kijkt, in plaats van naar zijn eigen gedachten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →