GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
Het artikel introduceert GHOST, een automatische methode die natuurlijk ogende, objectvrije afbeeldingen genereert door beeldembeddings te optimaliseren om hallucinatiekwetsbaarheden in Multimodale Grote Taalmodellen actief op te wekken en bloot te leggen, waarbij het aanzienlijk hogere succespercentages bereikt dan eerdere benaderingen en tevens dient als een hulpmiddel voor het verbeteren van de robuustheid van modellen door middel van fine-tuning.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: De "Overactieve Verbeeldingskracht" van de AI
Stel je voor dat je een zeer slimme robotassistent hebt die foto's kan bekijken en beschrijven wat hij ziet. Hij is erg goed in de meeste dingen, maar hij heeft een vreemde fout: soms ziet hij dingen die er niet zijn.
Als je hem een foto laat zien van een banaan op een bord, kan hij vol vertrouwen zeggen: "Ja, ik zie een mes naast de banaan liggen," ook al is er geen mes. In de wereld van AI wordt dit een hallucinatie genoemd. Het is als een persoon die zo graag wil pleasen of zo gewend is aan bepaalde patronen, dat hij details verzint om de gaten in te vullen.
De Oude Manier: Een Statische Lijst Controleren
Voorheen probeerden onderzoekers deze fouten te vinden door de AI een vaste lijst met foto's te laten zien (zoals een meerkeuzetoets). Ze vroegen: "Zie je een mes?" en keken of de AI het fout had.
- Het Gebrek: Dit is als het testen van een bestuurder in slechts één specifieke, lege parkeerplaats. Je mist misschien het feit dat de bestuurder in paniek raakt wanneer er een rode bal de straat op rolt. De oude tests waren te rigide en konden geen nieuwe of vreemde manieren vinden waarop de AI zou kunnen falen.
De Nieuwe Oplossing: GHOST (De "Toverkunstenaar")
De auteurs introduceren GHOST (Generating Hallucinations via Optimizing Stealth Tokens). Denk aan GHOST als een goochelaar die de AI niet alleen een foto laat zien, maar een nieuw beeld schildert dat specifiek is ontworpen om de AI te laten geloven dat er een spook aanwezig is.
Zo werkt GHOST, stap voor stap:
1. De "Onzichtbare Inkt" Optimalisatie
GHOST begint met een normale foto (zoals de banaan op het bord). Het wil de AI laten denken dat er een mes is.
- In plaats van een mes te tekenen (wat voor een mens overduidelijk zou zijn), werkt GHOST in een "geheime taal" genaamd embeddings. Stel je dit voor als de interne droomtoestand van de AI.
- GHOST past deze droomtoestand een heel klein beetje aan. Het voegt aanwijzingen toe met "onzichtbare inkt". Misschien verandert het de kromming van de bananenschil zodat het voor de AI iets lijkt op een messteel, terwijl het voor een mens nog steeds precies een banaan lijkt.
2. De "Vertaler" (De Mapper)
Er is een probleem: de AI die naar de foto kijkt (de MLLM) spreekt een andere taal dan de AI die de foto schildert (het Diffusion Model).
- GHOST bouwt een vertaler (een mapper). Deze vertaler neemt de "geheime droomaanpassingen" van de schilder en vertaalt deze naar instructies die de schilder kan begrijpen, zonder dat de vertaler elke seconde hulp nodig heeft van de kijker (de MLLM). Dit maakt het proces super snel.
3. De "Droomschilder" (Diffusion)
Zodra de geheime instructies klaar zijn, gebruikt GHOST een Diffusion Model (een type AI dat afbeeldingen creëert vanuit ruis) om de uiteindelijke foto te schilderen.
- Het begint met de originele banaan-foto en "ontruist" deze voorzichtig op basis van de geheime instructies.
- Het Resultaat: De uiteindelijke afbeelding ziet er voor een mens 100% natuurlijk uit. Het is nog steeds een banaan op een bord. Maar voor de AI zijn de subtiele veranderingen in lichtinval of vorm genoeg om te roepen: "IK ZIE EEN MES!"
Waarom dit een Groot Ding is
Het paper claimt drie grote overwinningen met GHOST:
Het is een Meesterdetective:
- Oude methoden vonden ongeveer 1% van de gevallen van hallucinaties.
- GHOST vond meer dan 28% van de gevallen. Het is alsof je upgradet van een metaaldetector die 99% van de munten mist naar een detector die bijna alle munten vindt.
Het is een Universele Val (Transferability):
- GHOST kan één AI (zoals Qwen) foppen en vervolgens diezelfde "gefopte" afbeelding aan een totaal andere AI laten zien (zoals GPT-4o).
- Het Resultaat: De tweede AI hallucineert ook! Dit bewijst dat verschillende AI's dezelfde blinde vlekken delen. Het is als het vinden van een specifiek type optische illusie die zowel jouw ogen als de ogen van je vriend fopt, ook al hebben jullie een andere visie.
Het is een Medicijn, Niet Alleen een Test:
- De auteurs gebruikten GHOST niet alleen om dingen kapot te maken; ze gebruikten het om ze te repareren.
- Ze namen de "gefopte" afbeeldingen die GHOST creëerde en lieten deze aan de AI zien met het juiste antwoord ("Nee, er is geen mes").
- Het Resultaat: De AI werd beter in het niet meer hallucineren in de toekomst. Het is als het laten zien van de exacte strikvragen die een student fout had, zodat hij het juiste antwoord kan leren.
De Kernboodschap
GHOST is een hulpmiddel dat automatisch "truc-foto's" maakt om de visuele systemen van AI onder druk te testen. Het bewijst dat huidige AI-modellen fragiel zijn en gemakkelijk kunnen worden misleid door subtiele, natuurlijk ogende veranderingen. Maar nog belangrijker: het biedt een manier om deze zwakheden te vinden en de AI te trainen, zodat deze betrouwbaarder wordt en ervoor zorgt dat wanneer de AI zegt dat hij een mes ziet, hij ook echt een mes ziet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.