← Nieuwste papers
💬 NLP

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

Het artikel introduceert ReVisiT, een trainingsvrije decoderingsmethode die hallucinaties in Large Vision Language Models beperkt door dynamisch relevante visuele semantics van visietokens in het tekstgeneratieproces te projecteren, waarbij superieure prestaties worden bereikt met verminderde rekenkosten.

Oorspronkelijke auteurs: Beomsik Cho, Jaehyung Kim

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Beomsik Cho, Jaehyung Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Dromende" Kunstenaar

Stel je voor dat je een briljante kunstenaar (een Large Vision-Language Model, of LVLM) huurt om een foto te beschrijven die je hen laat zien. Je toont hen een foto van een rode appel op een tafel.

Idealerweise kijkt de kunstenaar naar de foto en zegt: "Dat is een rode appel."
Maar soms raakt de kunstenaar afgeleid door hun eigen interne gedachten. Ze zouden kunnen zeggen: "Dat is een rode appel... en ook een banaan en een pizza," zelfs al staan die dingen niet op de foto. Dit noemen we hallucinatie.

Het artikel vraagt zich af: Waarom gebeurt dit?
De onderzoekers ontdekten dat de kunstenaar de appel eigenlijk wél correct ziet in hun 'geestesoog' (de visuele data), maar dat ze in de war raken door het lawaai van hun eigen vocabulaire wanneer ze gaan spreken. Ze weten de waarheid, maar vergeten deze te zeggen omdat ze te gefocust zijn op welke woorden normaal gesproken bij elkaar horen (zoals "appel" en "taart"), in plaats van wat er daadwerkelijk op de foto staat.

De Ontdekking: De "Verborgen Notities"

Het team keek nauwkeurig naar hoe deze AI-modellen werken. Ze ontdekten dat het model de afbeelding opdeelt in kleine stukjes die vision tokens worden genoemd. Denk aan deze tokens als kleine post-it's die aan verschillende delen van de afbeelding zijn geplakt.

  1. De Post-it's zijn Slim: Zelfs wanneer de AI een fout maakt (een banaan hallucineert), bevatten de post-it's op de afbeelding nog steeds de juiste informatie over de appel. De visuele waarheid is er, alleen begraven.
  2. Het Vertaalprobleem: Wanneer de AI probeert deze post-it's om te zetten in woorden, wordt het rommelig. Als je de AI vraagt: "Welk woord vertegenwoordigt deze post-it?" zonder enige regels, zou ze kunnen raden "lucht", "blauw" of "textuur". Het is te vaag.
  3. De Magische Filter: De onderzoekers ontdekten dat als je een filter op de vraag legt – de AI dwingend om alleen te kiezen uit een specifieke lijst met relevante woorden (zoals "appel", "fruit", "rood") – de post-it's plotseling heel helder worden. De AI kan dan eindelijk zeggen: "Ah! Deze notitie betekent zeker 'appel'!"

De Oplossing: ReVisiT (Referencing Vision Tokens)

Op basis hiervan creëerden de auteurs een nieuwe methode genaamd ReVisiT. Het is alsof je de kunstenaar een "spiekbriefje" geeft terwijl ze spreken, maar dan zonder dat je de kunstenaar opnieuw hoeft te trainen of een nieuwe hoeft aan te nemen.

Zo werkt ReVisiT, stap voor stap:

  1. De Contextcheck: Terwijl de AI begint met het schrijven van een zin, kijkt ReVisiT naar waar de AI momenteel over nadenkt.
  2. De Filter: Het maakt een kleine, relevante lijst met woorden op basis van die context (bijvoorbeeld: als de zin over een keuken gaat, bevat de lijst "kop", "lepel", "appel", maar niet "vliegtuig").
  3. De Match: ReVisiT kijkt naar alle "post-it's" (vision tokens) van de afbeelding en vraagt: "Welke van deze notities past het beste bij onze huidige lijst met woorden?" Het kiest de ene beste match.
  4. De Duw: Het neemt die winnende post-it en duwt de volgende woordkeuze van de AI zachtjes in die richting. Het is alsof je fluistert: "Hé, herinner je die notitie? Die zegt 'appel', niet 'banaan'."

Waarom Het Cool Is

  • Geen Training Vereist: Je hoeft de AI niets nieuws te leren. Je verandert alleen hoe het spreekt terwijl het spreekt.
  • Supersnel: Omdat het slechts een snelle wiskundige check en een "duw" is, vertraagt het de AI niet. Sterker nog, het is bijna net zo snel als de standaard manier van spreken.
  • Werkt Overal: Ze testten het op veel verschillende AI-modellen (van klein tot zeer groot) en op veel verschillende taken (afbeeldingen beschrijven, vragen beantwoorden, objecten opsporen). Het verminderde consistent het "dagdromen" (hallucinaties) en maakte de beschrijvingen nauwkeuriger.

De Analogie: De Bibliothecaris en het Boek

Stel je voor dat de AI een student is die een toets maakt.

  • De Vision Tokens zijn de schoolboeken die de student open op zijn bureau heeft liggen. De student heeft de juiste antwoorden in de boeken.
  • De Hallucinatie ontstaat omdat de student probeert het antwoord uit het hoofd te raden terwijl hij de boeken negeert, of omdat de boeken op de verkeerde pagina openstaan.
  • ReVisiT is een bibliothecaris die naar voren loopt, naar de vraag kijkt, naar de exacte pagina in het schoolboek wijst waar het antwoord staat en zegt: "Lees dit deel." De student leest dan het juiste antwoord uit het boek in plaats van te raden.

Samenvatting

Het artikel bewijst dat AI-modellen de waarheid al "zien" binnen hun visuele data, maar dat ze deze vaak niet kunnen uitspreken omdat ze verdwalen in hun eigen woordassociaties. ReVisiT is een eenvoudige, gratis tool die fungeert als een brug, het model dwingend om naar zijn eigen visuele notities te kijken en deze te gebruiken om zijn spraak te corrigeren, wat resulteert in minder leugens en nauwkeurigere beschrijvingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →