GeoDetect: Geometric Adversarial Detection for VLPs
Dit artikel introduceert GeoDetect, een geometrische detectiemethode voor adversariële aanvallen voor Vision-Language Pre-trained modellen (VLPs), die gebruikmaakt van de verhoogde off-manifold afstand van adversariële voorbeelden in anisotrope embedding-ruimtes om aanvallen betrouwbaar te identificeren over diverse architecturen en dreigingsscenario's heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers niet alleen plaatjes zien of woorden lezen, maar begrijpen hoe ze samen dansen. Dit is het domein van Vision-Language Pre-trained Models (VLPs). Denk aan hen als superintelligente bibliothecarissen die elk boek hebben gelezen en elk schilderij hebben gezien in het universum, en hebben geleerd om een beschrijving van een zonsondergang perfect te matchen met een foto ervan. Zij zijn de motoren achter coole technologie zoals het vinden van afbeeldingen met tekst, vragen beantwoorden over foto's, of zelfs een scène beschrijven zonder dat er verteld wordt waar de computer naar moet zoeken. Maar, net als elke krachtige tool, hebben ze een zwak punt: adversarial attacks. Dit zijn als kleine, bijna onzichtbare "glitches" of "trucjes" die aan een afbeelding of een zin worden toegevoegd om de computer te verwarren, waardoor hij een panda ziet als een gibbon of een stopbord als een snelheidsbord. Hoewel we weten hoe we deze trucjes kunnen herkennen in systemen met één modus (zoals alleen naar foto's kijken), hebben we nog niet echt uitgevogeld hoe we ze kunnen vangen wanneer de computer zowel plaatjes als woorden tegelijkertijd jongleert. Dit is een groot probleem, want als deze modellen worden gebruikt in veiligheidskritische banen, moeten we weten wanneer ze worden bedrogen voordat ze een gevaarlijke fout maken.
Maak kennis met GeoDetect, een nieuwe methode voorgesteld door onderzoekers Afsaneh Hasanebrahimi en haar team aan de Universiteit van Melbourne en Monash University. Zij besloten de "vorm" van de hersenen van de computer te onderzoeken om te zien of ze de trucjes konden ontdekken. Ze ontdekten dat de manier waarop deze modellen informatie opslaan een beetje lijkt op een drukke kamer waar iedereen in een zeer specifieke, smalle gang staat in plaats van zich gelijkmatig verspreid over een groot open veld. Ze noemen dit anisotropie—een chic woord dat betekent dat de data in bepaalde richtingen is uitgerekt en in andere is samengedrukt.
Het grote idee van het team is dat wanneer iemand probeert het model te bedriegen met een adversarial attack, de interne "kaart" van het model uit die drukke gang wordt geduwd en in de lege, vreemde ruimtes terechtkomt waar geen normale data leeft. Het is alsof iedereen in een dansclub een specifieke routine uitvoert in het midden van de vloer, en een grapjas probeert binnen te glippen om een vreemde, schokkerige beweging te maken; ze eindigen dan in de lege ruimte bij de muren, ver weg van de groep. GeoDetect werkt als een uitsmijter die de afstand meet tussen een nieuw persoon en de menigte. Als de nieuwe persoon te ver in de lege ruimte staat (buiten de "manifold", of de natuurlijke vorm van de data), weet de uitsmijter dat er iets mis is.
Om dit te doen, gebruikt GeoDetect een gereedschapskist van geometrische meetlatten. Het controleert zaken zoals Local Intrinsic Dimensionality (LID), wat zoiets is als vragen: "Hoeveel richtingen heeft dit punt nodig om zichzelf te beschrijven?" Het gebruikt ook k-Nearest Neighbors (k-NN) om te zien hoe dicht een punt bij zijn vrienden is, Mahalanobis-afstand om te meten hoe vreemd een punt eruitziet vergeleken met de gemiddelde vorm van de menigte, en Kernel Density Estimation (KDE) om te zien hoe druk het is in de omgeving van een punt. Door deze metingen te combineren, kan het systeem bepalen of een input een normaal, schoon voorbeeld is of een sluwe adversarial eenheid.
De onderzoekers testten dit idee op diverse modellen, waaronder populaire modellen zoals CLIP en ALBEF. Ze ontdekten dat hun theorie standhoudt: adversarial voorbeelden eindigen inderdaad in die "off-manifold" regio's, verder weg van de normale data dan de schone voorbeelden. In hun experimenten was GeoDetect in staat om deze aanvallen te ontdekken over verschillende soorten modellen en verschillende soorten trucjes, inclusief aanvallen die alleen de afbeelding, alleen de tekst, of beide verstoren. Het beste eraan? Het heeft geen training van het model of het leren van nieuwe dingen nodig; het kijkt simpelweg naar de geometrie van de data zoals die is. Dit suggereert dat we, door simpelweg de vorm van de dataruimte te begrijpen, een robuust, lichtgewicht schild kunnen bouwen om deze krachtige AI-modellen te beschermen tegen bedrog.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.