Neither Adversarial Training Nor Purification: Emergent Adversarial Robustness from Oscillatory Predictive Learning
Dit artikel introduceert Oscillatory Predictive Learning (OPL), een raamwerk dat kunstmatige Kuramoto-oscillerende neuronen combineert met voorspellende zelfgesuperviseerde pretraining die concurrerende adversariële robuustheid bereikt op CIFAR-10 en CIFAR-100 zonder te vertrouwen op computationeel dure adversariële training of purificatie tijdens de testtijd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van kunstmatige intelligentie zijn computersystemen voor computervisie opmerkelijk goed in het herkennen van objecten, van een kat in een boom tot een stopbord op straat. Echter, deze systemen hebben een verborgen kwetsbaarheid. Een mens kan naar een foto van een panda kijken en een panda zien, maar als een aanvaller een minuscuul, bijna onzichtbaar patroon van statische ruis aan de afbeelding toevoegt, kan de computer de afbeelding plotseling en vol vertrouwen identificeren als een gibbon. Deze kwetsbaarheid staat bekend als adversariële zwakte. Jarenlang was de standaardmanier om dit op te lossen het trainen van de computer door hem miljoenen van deze misleide afbeeldingen te tonen, om hem te dwingen te leren de ruis te negeren. Dit proces is ongelooflijk duur, vereist enorme hoeveelheden rekenkracht en tijd, en vertraagt het systeem vaak wanneer het daadwerkelijk wordt gebruikt. Onderzoekers vroegen zich al lang af of er een slimmere manier is om deze systemen vanaf het begin te bouwen, bijvoorbeeld door hun interne structuur van nature resistent te maken tegen dergelijke trucjes, in plaats van de oplossing simpelweg af te dwingen door middel van eindeloze training.
Een team van onderzoekers heeft een nieuwe aanpak voorgesteld die de noodzaak voor deze dure trainingssessies volledig omzeilt. In plaats van het model miljoenen gecorrumpeerde afbeeldingen te voeren, hebben ze een systeem gebouwd dat leert wat de volgende stap is in een sequentie van afbeeldingen, gecombineerd met een uniek intern mechanisme dat de ritmische synchronisatie nabootst die in de natuur wordt gevonden. Ze noemen deze methode Oscillatory Predictive Learning (Oscillerend Voorspellend Leren). De kern van het idee is om de computer een specifiek type interne "klok" of ritme te geven dat zijn verschillende onderdelen in sync houdt, waardoor het moeilijker wordt voor een kleine, kwaadwillige verandering om het hele systeem uit balans te brengen. Wanneer ze deze methode testten, ontdekten ze dat het systeem verrassend taai werd tegen aanvallen, waarbij het hoge niveaus van beveiliging bereikte zonder ooit een enkel adversarieel voorbeeld tijdens de training te hebben gezien.
De onderzoekers testten hun systeem op twee standaard datasets met afbeeldingen die worden gebruikt om computers te trainen: één met tien verschillende categorieën zoals vliegtuigen en auto's, en een andere met een honderd categorieën. Ze daagden het systeem uit met een rigoureuze reeks tests die ontworpen waren om de zwakke punten van het model te vinden. In de eerste test, die betrekking had op de dataset met tien categorieën, identificeerde hun nieuwe methode de afbeeldingen in 76,63% van de gevallen correct, zelfs wanneer de afbeeldingen onder een aanval lagen. Dit is een significante verbetering ten opzicht van andere methoden die vertrouwen op willekeur om aanvallen te weerstaan, die doorga af rond de 71% scoren. Wanneer ze overgingen naar de moeilijkere dataset met honderd categorieën, wist het systeem nog steeds stand te houden met een succespercentage van 50,44%. Deze resultaten zijn opmerkelijk omdat het systeem dit niveau van beveiliging bereikte zonder de zware computationele kosten die gewoonlijk nodig zijn om een model robuust te maken.
Om te begrijpen waarom dit werkte, braken het team hun creatie af in de twee belangrijkste onderdelen. Het eerste deel is een speciaal type neuraal netwerklaag dat oscillerende eenheden gebruikt, die lijken op kleine, gekoppelde pendules die elkaar beïnvloeden. Het tweede deel is een leermethode die het systeem leert om toekomstige weergaven van een afbeelding te voorspellen op basis van huidige weergaven. Wanneer ze deze onderdelen afzonderlijk testten, ontdekten ze dat de oscillerende structuur alleen een solide fundament van defensie bood, maar niet voldoende was op zichzelf. Het voorspellende leergedeelte, toegepast op een standaard computervisiemodel, deed bijna niets om aanvallen te stounen. Echter, toen ze de oscillerende structuur combineerden met het voorspellende leren, werd de defensie veel sterker. De voorspellende training leek de natuurlijke stabiliteit van de oscillerende onderdelen te versterken, waardoor een systeem ontstond dat veel veerkrachtiger was dan de som der delen.
De onderzoekers ontdekten ook dat deze robuustheid iets delicaats is, dat alleen bestaat onder zeer specifieke omstandigheden. Ze ontdekten dat de grootte van de interne "klok"-eenheden enorm belangrijk was. Wanneer de eenheden werden ingesteld op een specifieke, kleine dimensie, was het systeem zeer resistent tegen aanvallen. Maar wanneer ze de grootte van deze eenheden vergrootten om het systeem flexibeler en beter in het herkennen van afbeeldingen onder normale omstandigheden te maken, stortte de defensie plotseling in. Het systeem werd bijna volledig kwetsbaar voor aanvallen, ook al was het beter in het identificeren van schone afbeeldingen. Dit suggereert dat de beveiliging van het systeem niet voortkomt uit het simpelweg groter of krachtiger maken van het model. In plaats daarvan rust het op een strikte, nauwe set regels die de interne ritmes gesynchroniseerd houden. Als het systeem te veel vrijheid krijgt, verliest het zijn vermogen om manipulatie te weerstaan.
Dit werk suggereert een nieuwe weg voorwaarts voor het bouwen van veilige kunstmatige intelligentie. Het daagt de langgevestigde overtuiging uit dat de enige manier om een model robuust te maken het trainen op miljoenen adversariële voorbeelden is. Door een specifieke architecturale vormgeving te combineren met een zelflerende methode, lieten de onderzoekers zien dat robuustheid natuurlijk kan ontstaan uit de manier waarop het systeem is gebouwd en hoe het leert. Hoewel het systeem nog steeds verfijnd moet worden om te werken op grotere, complexere beelddatasets, bieden de bevindingen een veelbelovend alternatief voor de huidige, computationeel dure methoden. Het geeft aan dat door de interne dynamiek van een model zorgvuldig te ontwerpen, we AI kunnen creëren die niet alleen slim is, maar ook inherent moeilijk te misleiden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.