← Nieuwste papers
💻 computer science

Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP

Dit artikel stelt MAGA voor, een nieuw multi-level aanvalskader dat de kwetsbaarheden in cross-modale aandacht van BLIP-modellen exploiteert door cross-modale aanvalsgrafieken te construeren en te verstoren, wat resulteert in significante prestatiedegradatie en taalkundig plausibele maar visueel inconsistente adversariële bijschriften.

Oorspronkelijke auteurs: yingying hu, minghao mo, peng zhang

Gepubliceerd 2026-09-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: yingying hu, minghao mo, peng zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een nieuwe generatie computersystemen opgekomen die tegelijkertijd kunnen zien en lezen. Deze systemen, bekend als vision-language modellen, zijn getraind op miljoenen paren van afbeeldingen en tekst, waarbij ze leren begrijpen hoe een foto van een hond relateert aan het woord "hond". Ze zijn het fundament geworden voor hulpmiddelen die foto's beschrijven, vragen over scènes beantwoorden en zoeken naar afbeeldingen met behulp van natuurlijke taal. Om deze machines goed te laten werken, moeten ze constant specifieke woorden koppelen aan specifieke delen van een afbeelding, waarbij ze beslissen welke pixels behoren tot het concept "paard" en welke tot "gras". Dit proces steunt op een complex intern mechanisme dat fungeert als een dynamische kaart, die elk woord in een zin verbindt met de relevante visuele details in een foto. Als deze verbinding verbreekt, verliest de machine het vermogen om te begrijpen waar hij naar kijkt, wat kan leiden tot verwarring of onjuiste beschrijvingen.

Onderzoekers aan de Guangzhou University hebben een subtiele zwakte ontdekt in de manier waarop deze systemen die verbindingen in stand houden. Ze ontdekten dat door een klein, zorgvuldig ontworpen patroon op een afbeelding te plaatsen, zij het model konden misleiden om zijn interne kaart van woord-naar-beeld-koppelingen te herorganiseren. Dit patroon, dat eruitziet als een eenvoudige vlek van kleur of textuur, hoeft geen complex vermomming te zijn. In plaats daarvan fungeert het als een stil signaal dat de machine ertoe aanzet de belangrijkste delen van een afbeelding te negeren en zich te concentreren op irrelevante achtergrondgebieden. Wanneer dit gebeurt, kan de machine nog steeds vloeiend en grammaticaal correct spreken, maar komt wat hij zegt niet meer overeen met de afbeelding. Het kan een veld met bloemen beschrijven terwijl de afbeelding duidelijk een paard laat zien, of beweren dat een persoon een kom ramen vasthoudt terwijl de foto alleen een woonkamer bevat. De onderzoekers noemen dit fenomeen "natural but wrong" (natuurlijk maar fout), wat wijst op een kwetsbaarheid waarbij het zelfvertrouwen van de machine hoog blijft, zelfs terwijl het begrip instort.

Het team ontwikkelde een methode om deze misleidende patronen te creëren, die zij een multi-level aanval noemden. In tegen tegenstelling tot eerdere pogingen die probeerden een afbeelding simpelweg te vervagen of de kleuren te verstoren, richt deze aanpak zich specifiek op de manier waarop het model tekst met visie verbindt. De onderzoekers bouwden een systeem dat de sterkte van de koppelingen tussen woorden en beelddelen in kaart brengt, wat in essentie een graaf is die laat zien welke woorden aandacht besteden aan welke pixels. Vervolgens trainden zij hun aanval om het verschil te maximaliseren tussen de graaf van een schone afbeelding en de graaf van dezelfde afbeelding met de toegevoegde vlek. Door dit te doen, dwongen ze het model om de sterke verbindingen tussen kernwoorden en hun visuele bewijs te verbreken, terwijl er tegelijkertijd nieuwe, valse verbindingen met willekeurige achtergrondgebieden werden gecreëerd. Dit proces werd gecombineerd met andere doelen om ervoor te zorgen dat de aanval verborgen bleef en de resulterende tekst natuurlijk klonk, ook al was deze feitelijk onjuist.

De resultaten van hun experimenten waren opmerkelijk. Toen zij de gegenereerde vlek op afbeeldingen uit een standaard dataset toepasten, daalde het vermogen van het model om de juiste afbeelding bij een bepaalde tekst te vinden dritiesch. In tests waarbij het systeem werd gevraagd een zin te koppelen aan de juiste foto, daalde het succespercentage van ruim zeventig procent naar slechts negen procent. De aanval was zo effectief dat deze zelfs werkte op afbeeldingen die het systeem nog nooit eerder had gezien, wat suggereert dat de fout fundamenteel is aan hoe het model informatie verwerkt, in plaats van een simpele fout met specifieke plaatjes. In taken waarbij het model een afbeelding moest beschrijven, stortte de kwaliteit van de beschrijving in. De scores van het systeem voor nauwkeurigheid daalden aanzienlijk, terwijl de zinnen die het produceerde grammaticaal correct en divers bleven, waardoor de repetitieve onzin die vaak een defect systeem signaleert, werd vermeden. Dit bevestigde dat het model niet alleen faalde in het spreken, maar ook vol vertrouwen een realiteit beschreef die niet bestond.

De onderzoekers testten het systeem ook op visuele vragen, zoals het tellen van objecten of het identificeren van ruimtelijke relaties. De aanval zorgde ervoor dat het model ook bij deze logische taken faalde, waarbij de succespercentages daalden van bijna tachtig procent naar slechts twaalf procent. In veel gevallen zou het model een vraag over een hond beantwoorden met een beschrijving van een kat, of beweren dat er drie dieren waren terwijl er slechts één was. Wat deze fouten bijzonder opvallend maakte, was dat de interne aandachtskaart van het model volledig was herbedraad. Visualisaties toonden aan dat het model, dat normaal gesproken zijn aandacht op het hoofdonderwerp van de foto richt, begon het onderwerp volledig te negeren en in plaats daarvan focuste op de lege lucht of het gras. De vlek verborg het object niet; het zorgde er simpelweg voor dat het model de andere kant op keek.

Dit werk suggereert dat de huidige generatie van deze krachtige AI-systemen kwetsbaarder is dan voorheen gedacht. Terwijl eerdere beveiligingstests zich richtten op de vraag of een afbeelding er voor het menselijk oog anders uit kon worden gemaakt, laat dit onderzoek zien dat het gevaar ligt in de manier waarop de machine zijn eigen begrip organiseert. De aanval vereist niet dat de machine wordt misleid om iets anders te zien; het hoeft de machine alleen maar ervan te overtuigen dat het object dat het ziet irrelevant is. Door de interne graaf die woorden met pixels verbindt te verstoren, bewezen de onderzoekers dat een kleine, statische vorm een cascade aan fouten kan veroorzaken in verschillende taken, van het zoeken naar afbeeldingen tot het beantwoorden van complexe vragen. De studie concludeert dat naarmate deze modellen meer geïntegreerd raken in het dagelijks leven, het begrijpen en beschermen van deze interne verbindingskaarten even belangrijk zal zijn als het beschermen van de afbeeldingen zelf. De bevindingen dienen als een herinnering dat zelfs de meest geavanceerde systemen op het verkeerde been kunnen worden gezet, niet door te veranderen wat ze zien, maar door te veranderen hoe ze denken over wat ze zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →