← Nieuwste papers
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

Het artikel stelt HEAL voor, een nieuw framework dat hallucinaties in Multimodale Grote Taalmodellen identificeert en mitigeert door de distributie-drifts van informatie in synergy heads te analyseren en dynamische kalibratie toe te passen om outputs naar feitelijk bewijs te sturen.

Oorspronkelijke auteurs: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Gepubliceerd 2026-09-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Multimodale grote taalmodellen zijn een krachtige nieuwe klasse van kunstmatige intelligentie die ontworpen is om tegelijkertijd te kunnen zien en spreken. In tegenstelling tot traditionele systemen die tekst of afbeeldingen geïsoleerd verwerken, kunnen deze modellen naar een foto kijken en deze beschrijven, vragen erover beantwoorden of een verhaal vertellen op basis van wat ze zien. Ze werken door twee verschillende stromen informatie samen te weven: de visuele gegevens van de afbeelding en de taalkundige patronen die zijn geleerd uit enorme hoeveelheden tekst. Om deze systemen echt nuttig te maken in kritieke vakgebieden zoals medische beeldvorming of autonoom rijden, moeten ze betrouwbaar zijn. Echter, ze lijden vaak aan een probleem dat bekend staat als hallucinatie. Dit gebeurt wanneer het model een reactie genereert die zelfverzekerd en aannemelijk klinkt, maar feitelijk onjuist is over de visuele wereld, zoals beweren dat een foto van een kat een hond bevat, of details verzinnen die simpelweg niet in de afbeelding aanwezig zijn.

Lange tijd geloofden onderzoekers dat deze fouten ontstonden omdat het model te veel aandacht besteedde aan zijn interne kennis van taal en te weinig aan de werkelijke afbeelding. Het heersende idee was dat het model, terwijl het zijn antwoord schreef, weg zou drijven van de afbeelding en te zwaar zou vertrouwen op wat het verwachtte te zien op basis van woorden alleen. Om dit op te lossen, richtten eerdere pogingen zich op het dwingen van het model om harder naar de afbeelding te kijken of op het volledig opnieuw trainen van het systeem. Deze methoden behandelden het model vaak als een 'black box', waarbij het gedrag van buitenaf werd aangepast zonder de interne mechanica te begrijpen waar de fout in eerste instantie vandaan kwam.

Een team van onderzoekers aan de Shenzhen University of Advanced Technology heeft nu in de motor van deze modellen gekeken om een andere verklaring te vinden. Zij stellen dat hallucinaties niet worden veroorzaakt door een simpel gebrek aan aandacht voor de afbeelding, noch door het model de afbeelding volledig te laten negeren. In plaats daarvan ontdekten zij dat de fout ontstaat wanneer de interne balans tussen visuele en taalkundige informatie instabiel wordt binnen specifieke delen van het verwerkingsnetwerk van het model. De onderzoekers ontwikkelden een methode genaamd HEAL, wat staat voor Head-lEvel information disentAnglement and caLibration (op hoofd niveau informatie ontwarren en kalibreren), om deze disbalans in realtime te identificeren en te corrigeren.

De kern van hun ontdekking ligt in de manier waarop het model informatie verwerkt. Binnen deze grote modellen zijn er veel kleine verwerkingseenheden die 'attention heads' (aandachtskoppen) worden genoemd. Denk aan deze koppen als een team van specialisten die samenwerken om een zin te begrijpen. Sommige specialisten richten zich puur op de woorden, anderen puits op de afbeelding, en een derde groep werkt de twee samen. De onderzoekers ontdekten dat de groep die verantwoordelijk is voor het samenvoegen van de twee stromen — wat zij 'synergy heads' (synergiekoppen) noemen — de plek is waar de problemen beginnen. Wanneer het model correct werkt, behouden deze synergiekoppen een gezonde balans, waarbij ze visuele en taalkundige informatie in een stabiel evenwicht houden. Echter, wanneer het model begint te hallucineren, verschuift deze balans. De informatieverdeling binnen deze samenvoegingskoppen drijft weg van dat gezonde evenwicht, waardoor het model zijn verankering in het visuele bewijs verliest.

Cruciaal is dat de onderzoekers de gedachte hebben uitgesloten dat hallucinaties optreden omdat er simpelweg te weinig specialisten zijn die naar de afbeelding kijken of omdat de beeldspecialisten te zwak zijn. Hun analyse toonde aan dat het aantal visueel gerichte koppen constant blijft, of het model nu de waarheid spreekt of liegt. Het probleem is niet een tekort aan visuele aandacht, maar een drift in hoe de samenvoegingsspecialisten de mix van informatie afhandelen. Wanneer het model een correcte beschrijving genereert, houden de synergiekoppen de visuele en taalkundige inputs in een stabiele ratio. Wanneer het hallucineert, raakt die ratio scheef, waarbij het vaak te zwaar leunt op taalkundige patronen terwijl de visuele verbinding verzwakt, ook al is de afbeelding nog steeds aanwezig.

Om dit op te lossen, creëerde het team een dynamische kalibratiestrategie die fungeert als een regulator in realtime. In plaats van het model opnieuw te trainen of de architectuur te veranderen, grijpt HEAL in tijdens het generatieproces. Het monitort de informatie die door de synergiekoppen stroomt en detecteert wanneer de balans begint te driften. Wanneer een drift wordt gedetecteerd, injecteert het systeem een kalibratiefactor die de visuele en taalkundige informatie voorzichtig terugstuurt naar het juiste evenwicht. Dit proces is continu en adaptief; het dwingt het model niet om de taal te negeren of overmatig op de afbeelding te focussen, maar stuurt de interne representatie terug naar een staat waarin het visuele bewijs juist gewogen wordt tegen de taalkundige context.

De onderzoekers testten deze aanpak op verschillende state-of-the-art modellen, waaronder versies van LLaVA en Qwen. De resultaten waren consistent over verschillende systemen en taken heen. Door deze dynamische kalibratie toe te passen, produceerden de modellen aanzienlijk minder hallucinaties, terwijl ze hun vermogen om vloeiend en creatief te spreken behielden. In tests die bedoeld waren om te meten hoe vaak modellen objecten verzinnen die niet in de afbeelding aanwezig zijn, verminderde deze nieuwe methode fouten effectiever dan eerdere technieken die probeerden simpelweg de visuele aandacht te vergroten. De studie suggereert dat de sleutel tot betrouwbaarheid in deze systemen niet alleen is om ze harder naar de afbeelding te laten kijken, maar om ervoor te zorgen dat de interne versmelting van zien en spreken stabiel blijft.

Dit werk biedt een nieuw perspectief op hoe kunstmatige intelligentie de wereld begrijpt. Het laat zien dat betrouwbaarheid niet alleen gaat over het hebben van genoeg data of krachtige hardware, maar over het handhaven van een delicate interne balans tussen verschillende soorten informatie. Door te identificeren waar dit evenwicht precies breekt en een eenvoudige manier te bieden om het te herstellen, hebben de onderzoekers een pad geopend naar meer betrouwbare multimodale systemen. De methode is lichtgewicht en vereist niet de enorme computationele middelen die nodig zijn voor hertraining, wat het een praktisch hulpmiddel maakt voor het verbeteren van de nauwkeurigheid van AI die ziet en spreekt. De bevindingen suggereren dat toekomstige verbeteringen in de betrouwbaarheid van AI voort kunnen komen uit het verfijnen van deze interne relaties, in plaats van het bouwen van grotere, complexere modellen vanaf de grond af aan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →