Backdoor Learning in Language Models and Vision-Language Models
Deze thesis onderzoekt beveiligingskwetsbaarheden en efficiëntieverbeteringen in Natural Language Processing en Vision-Language Models door het analyseren van backdoor-aanvallen en het ontwikkelen van geavanceerde multimodale representatiemethoden voor klinische en medische beeldvormingstoepassingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het moderne digitale landschap is kunstmatige intelligentie geëvolueerd van eenvoudige patroonherkenning naar systemen die in staat zijn complexe afbeeldingen te begrijpen en mensachtige tekst te genereren. Deze systemen, bekend als taalmodellen en visie-taalmodellen, voeden alles van medische diagnostiek tot geautomatiseerde klantenservice. Ze functioneren door te leren van enorme hoeveelheden data, waarbij ze subtiele verbindingen tussen woorden, concepten en visuele details identificeren. Deze immense capaciteit brengt echter een verborgen kwetsbaarheid met zich mee. Net zoals een fysiek slot kan worden gekraakt met een specifieke, verborgen sleutel, kunnen deze intelligente systemen tijdens hun training geheim worden gemanipuleerd. Deze manipulatie, bekend als een backdoor-aanval (achterdeur-aanval), stelt een aanvaller in staat om een verborgen trigger in te bedden. Wanneer het systeem deze trigger in de toekomst tegenkomt, negeert het zijn normale training en voert het een specifieke, vooraf bepaalde actie uit, terwijl het zich bij afwezigheid van de trigger volkomen normaal gedraagt. De belangen zijn bijzonder hoog in velden zoals de gezondheidszorg, waar een gecompromitteerd systeem kan leiden tot gevaarlijke misdiagnoses, of in de publieke infrastructuur, waar een subtiele fout voor grootschalige ontregeling kan zorgen.
Een recente doctorale dissertatie door Weimin Lyu aan de Stony Brook University duikt diep in deze kwetsbaarheden en onderzoekt hoe deze aanvallen werken in tekstgebaseerde systemen en de nieuwere, complexere visie-taalmodellen. Het onderzoek identificeert niet alleen dat deze aanvallen mogelijk zijn; het ontleedt de interne mechanica van hoe ze slagen en stelt nieuwe manieren voor om zowel dergelijke aanvallen uit te voeren als te detecteren. De studie onthult dat wanneer een taalmodel wordt gecompromitteerd, zijn interne "aandacht"-mechanisme (attention mechanism) — een proces waarmee het model beslist welke woorden in een zin het belangrijkst zijn voor het begrijpen van de betekenis — wordt gekaapt. In plaats van zich te concentreren op de context van een zin, fixeert het gecompromitteerde model zich op de verborgen trigger, waardoor het effectief de rest van de input negeert. Deze ontdekking leidde tot de ontwikkeling van een nieuwe detectiemethode genaamd AttenTD, die scant op deze abnormale verschuivingen in focus. Het onderzoek toonde aan dat deze methode aanzienlijk effectiever is in het opsporen van gecompromitteerde modellen dan eerdere technieken, waarbij het backdoors in diverse datasets met hoge nauwkeurigheid succesvol identificeert.
De dissertatie introduceerde ook een krachtigere manier om deze aanvallen te creëren, getiteld de Trojan Attention Loss. Door de aandacht van het model tijdens de training direct te manipuleren om het te dwingen zich op de trigger te concentreren, lieten de onderzoekers zien dat zij backdoors konden creëren met veel minder vergiftigde voorbeelden dan voorheen nodig werd geacht. Dit bleek effectief te zijn, zelfs in "clean-label" scenario's, waarbij de aanvaller de juiste antwoorden in de trainingsdata niet hoeft te veranderen, wat de aanval veel moeilijker detecteerbaar maakt. De studie breidde deze bevindingen verder uit naar klinische taalmodellen die worden gebruikt voor elektronische patiëntendossiers. Door vergelijkbare technieken toe te passen, lieten de onderzoekers zien dat een model dat getraind is om patiëntuitkomsten te voorspellen, subtiel kan worden aangepast om onjuiste voorspellingen te geven als er een specifieke, verborgen frase in de aantekeningen van een patiënt verschijnt, wat een kritiek beveiligingsrisico in systemen voor medische besluitvorming onderstreept.
Voorbij de tekst pakte het onderzoek het opkomende veld van visie-taalmodellen aan, die afbeeldingen kunnen beschrijven of vragen over die afbeeldingen kunnen beantwoorden. Deze modellen zijn bijzonder uitdagend om aan te vallen omdat ze een coherente verstandhouding moeten behouden tussen zowel visuele als tekstuele informatie. De studie introduceerde TrojVLM, een methode die er succesvol in slaagt een verborgen trigger in de afbeelding zelf te injecteren. Wanneer een vergiftigde afbeelding met deze trigger aan het model wordt getoond, genereert het een reactie die een specifieke, vooraf bepaalde zin bevat, zoals een website-URL of een willekeurige frase, terwijl de rest van de afbeelding nog steeds accuraat wordt beschreven. Dit werd bereikt door het model te trainen om de semantische betekenis van de afbeelding te behouden en tegelijkertijd te leren de verborgen tekst te produceren. Het onderzoek toonde aan dat deze aanval werkt over verschillende soorten afbeeldingen en vragen heen, waarbij de kwaliteit van de gegenereerde tekst hoog blijft, zelfs wanneer de trigger aanwezig is.
Misschien wel de meest verontrustende bevinding was de ontwikkeling van een aanval die geen toegang vereist tot de oorspronkelijke trainingsdata. In een scenario genaamd VLOOD toonden de onderzoekers aan dat zij een visie-taalmodel konden compromitteren met enkel data die het model nog nooit eerder had gezien. Door nieuwe data zorgvuldig te balanceren met technieken om de bestaande kennis van het model te behouden, waren zij in staat een backdoor in te bedden zonder ooit de oorspronkelijke trainingsset van het model aan te raken. Dit suggereert dat zelfs modellen die in de echte wereld zijn ingezet, die vaak als veilig worden beschouwd omdat hun trainingsdata privé is, kwetsbaar kunnen zijn voor manipulatie door buitenstaanders. De studie bevestigde dat deze aanvallen een hoge slaagkans kunnen bereiken terwijl de normale gedrag van het model intact blijft, wat ze extreem moeilijk te ontdekken maakt.
Om deze dreigingen het hoofd te bieden, onderzocht de dissertatie ook manieren om deze krachtige systemen efficiënter en interpreteerbaarder te maken, met name voor medische toepassingen. De onderzoekers ontwikkelden een nieuw model voor het analyseren van pathologie-afbeeldingen van hele coupes (whole-slide pathology images), die digitale scans van weefselmonsters zijn op gigapixel-schaal. Deze afbeeldingen zijn zo groot dat standaardmodellen moeite hebben met het verwerken ervan. De nieuwe aanpak comprimeert de visuele informatie naar een kleinere, beheersbare set tokens, waardoor het systeem complexe vragen over het weefsel kan beantwoorden zonder de computationele middelen te overbelasten. Dit werk toonde aan dat het mogelijk is om een hoge nauwkeurigheid in medische diagnostiek te behouden terwijl de computationele kosten aanzienlijk worden verminderd, een cruciale stap om geavanceerde AI-tools praktisch bruikbaar te maken in ziekenhuizen.
De overkoepelende conclusie van dit onderzoek is dat de beveiliging van kunstmatige intelligentie even cruciaal is als de prestaties ervan. De studie biedt een uitgebreide kaart van hoe backdoor-aanvallen zowel tekst- als visie-taalsystemen kunnen infiltreren, waarbij wordt onthuld dat de interne mechanismen van deze modellen kwetsbaarder zijn dan voorheen werd aangenomen. Door de specifieke manieren bloot te leggen waarop aandacht kan worden gekaapt en aan te tonen hoe aanvallen kunnen worden uitgevoerd met minimale data, benadrukt het werk de dringende noodzaak voor robuuste detectiemethoden en veilige trainingspraktijken. De bevindingen dienen als een waarschuwing voor de ontwikkeling van betrouwbare AI, waarbij wordt benadrukt dat zonder deze waarborgen de systemen die bedoeld zijn om ons te helpen, door subtiele, onzichtbare manipulaties tegen ons gekeerd kunnen worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.