← Nieuwste papers
💻 computer science

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

YARD is een trainingsvrij framework dat hallucinaties in Large Vision-Language Models vermindert door een Y-architectuur te hanteren om oppervlakkige berekeningen te delen en te vertakken bij middelste lagen, waar het fijnmazige visuele tokens vervangt door register tokens om een effectief contrastief signaal te genereren zonder de latentie van een tweede forward pass.

Oorspronkelijke auteurs: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Vision-Language Model (LVLM) voor als een zeer getalenteerde maar licht overmoedige verhalenverteller. Je laat het een foto van een strand zien, en het begint de scène te beschrijven. Soms krijgt het de dingen goed ("Er zijn parasols en mensen"), maar soms verzint het vol vertrouwen details die er niet zijn ("En kijk, daar ligt een surfboard en een hond!"). Dit wordt hallucinatie genoemd.

Het paper introduceert een nieuwe methode genaamd YARD (Y-Architecture Register Decoding) om deze verhalenverteller te stoppen met dingen verzinnen, zonder het model opnieuw te hoeven trainen of te vertragen.

Hier is hoe YARD werkt, uitgelegd aan de hand van eenvoudige concepten:

1. Het probleem met oude methoden

Voordat YARD bestond, probeerden onderzoekers hallucinaties op te lossen met een techniek genaamd "Contrastive Decoding". Denk hierbij aan het vragen aan de verhalenverteller om het verhaal twee keer te vertellen:

  • Versie A (Schoon): "Kijk naar de echte foto en vertel me wat je ziet."
  • Versie B (Gedegradeerd): "Vertel me wat je ziet, maar doe alsof de foto wazig is of stukjes mist."

De computer vergelijkt vervolgens de twee verhalen. Als Versie B een surfboard verzint maar Versie A dat niet doet, weet de computer dat hij het idee van de "surfboard" moet onderdrukken in het uiteindelijke antwoord.

Echter, eerdere methoden hadden twee grote gebreken:

  • De "Blinddoek"-aanpak: Sommige methoden verwijderden de visuele input volledig voor Versie B. Dit was te extreem. De computer zou dan simpelweg raden op basis van algemene kennis (bijv. "Stranden hebben meestal surfboards"), wat niet hielp om specifieke leugens over dit specifieke strand te ontdekken.
  • De "Dubbel Werk"-aanpak: Andere methoden corrumpeerden de beeldpixels (door ruis toe te voegen). Dit vereiste dat de computer de afbeelding twee keer vanaf nul moest verwerken, wat erg traag en duur was.

2. De YARD-oplossing: De "Y"-vorm

YARD verandert het spel door een Y-vormig pad in de hersenen van het model te bouwen.

  • De Stam (Gedeeld Pad): Zowel het "Schone" als het "Gedegradeerde" verhaal beginnen samen. Ze delen de eerste paar lagen van de verwerking. Dit is alsof je samen de eerste paragraaf van een boek leest. Dit bespaart tijd omdat het model niet twee keer al het werk opnieuw hoeft te doen.
  • De Splitsing (De Middelste Laag): Op een specifiek punt in het denkproces van het model splitst het pad zich.
    • De Linker Tak (Schoon): Gaat normaal verder en kijkt naar elk klein detail (patches) van de afbeelding.
    • De Rechter Tak (Gedegradeerd): Hier gebeurt de magie. In plaats van naar elk klein detail te kijken, wordt deze tak gedwongen om naar de afbeelding te kijken via een "Register".

3. De "Register"-metafoor

Stel je voor dat de afbeelding een kaart met een hoge resolutie is.

  • De Schone Tak kijkt naar de kaart en ziet elke straat, boom en huis.
  • De Gedegradeerde Tak (met gebruik van YARD) krijgt een "Register". Een Register is als een samenvattende notitie die zegt: "Dit is een strandscène met water en zand," maar die specifieke details verbergt. Het weet dat er mensen zijn, maar kan niet zien waar ze staan of wat ze vasthouden.

Waarom is dit slim?
Als het model probeert te zeggen: "Er is een surfboard," controleert de Schone Tak (die de details ziet) de kaart en zegt: "Nee, ik zie geen surfboard." De Gedegradeerde Tak (die alleen de algemene strandvibe ziet) kan dan zeggen: "Nou, stranden hebben vaak surfboards, dus misschien wel?"

Wanneer de computer deze twee vergelijkt, realiseert het zich: "De Schone Tak zegt 'Nee', maar de Gedegradeerde Tak raadt 'Ja' op basis van algemene vibes." YARD onderdrukt vervolgens de "surfboard"-gok. Het houdt het verhaal geworteld in de realiteit omdat de "Schone" tak het bewijs heeft, en de "Gedegradeerde" tak fungeert als een detector voor zaken die het model gewoon aan het raden is.

4. Waarom de "Midden" belangrijk is

Het paper ontdekte dat de hersenen van het model in stadia werken.

  • Vroege lagen: Alleen de afbeelding klaarmaken.
  • Middelste lagen: Dit is het "sweet spot" waar het model begint de tekst te koppelen aan de specifieke visuele details.
  • Late lagen: Het model heeft al besloten wat het gaat zeggen.

YARD splitst het pad precies in het midden. Als je te vroeg splitst, heeft het model nog niet genoeg van de foto gezien. Als je te laat splitst, heeft het model de details al "onthouden" en zal het niet gefopt worden door de gedegradeerde versie. Het midden is het perfecte moment om het "Register" te introduceren om te testen of het model echt naar de foto kijkt of gewoon aan het raden is.

5. Het Resultaat

Door dit Y-vormige pad en de "Register"-truc te gebruiken:

  • Het is Sneller: Omdat de twee paden het begin delen, hoeft het model de afbeelding niet twee keer vanaf nul te verwerken.
  • Het is Slimer: Het vangt hallucinaties beter dan eerdere methoden omdat het een "eerlijk gevecht" creëert tussen een gedetailleerd beeld en een algemeen beeld, in plaats van een gedetailleerd beeld versus een blinde gok.
  • Het Werkt Overal: Het paper heeft dit op veel verschillende AI-modellen getest, en het werkte consistent goed zonder dat ze opnieuw getraind hoefden te worden.

Kortom, YARD is als een factchecker die in de hersenen van de AI zit en vraagt: "Weet je dat zeker, of ben je gewoon aan het raden op basis van wat er meestal gebeurt?" Het doet dit efficiënt, zonder het gesprek te vertragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →