To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack
Dit position paper betoogt dat om onvermijdelijke door AI gedreven cyberaanvallen te bestrijden, verdedigers hun strategie fundamenteel moeten veranderen door verantwoordelijk hun eigen offensieve AI-capaciteiten te ontwikkelen en in te zetten binnen gecontroleerde, beheerde omgevingen om dreigingen onder de hand van tegenstanders te beheersen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De Oude Regels Werken Niet Meer
De afgelopen tien jaar werkte cybersecurity als een spelletje "Whac-A-Mole" (slaan op een mol).
- De Oude Manier: Hackers moesten zeer bekwame mensen zijn. Het bouwen van een complexe aanval was als het bouwen van een luxe huis; het kostte maandenlang hard werk en diepe expertise. Omdat dit zo duur en traag was, vielen hackers alleen de "grote huizen" (grote bedrijven) aan of gebruikten ze simpele, generieke tools om aan duizenden deuren te kloppen in de hoop dat er één openstond. Verdedigers gingen ervan uit dat hackers het niet konden betalen om aan elke deur te kloppen.
- De Nieuwe Dreiging: AI-agents veranderen het spel. Stel je een hacker voor die geen persoon is, maar een zwerm van duizenden kleine, onvermoeibare robots. Deze robots hoeven geen experts te zijn. Ze kunnen in een seconde aan miljoenen deuren kloppen. Zelfs als ze 99% van de tijd falen, hoeven ze slechts 1% van de tijd te slagen om winst te maken. Ze kunnen de "kleine huizen" (niche-systemen) aanvallen die mensen vroeger negeerden omdat ze de moeite niet waard waren.
Het artikel stelt dat verdedigers momenteel proberen deze robots te stoppen door "Niet Binnenkomen"-bordjes op de robots zelf te plakken. Maar het artikel zegt dat dit niet zal werken, omdat kwaadwillenden gewoon hun eigen robots kunnen bouwen zonder die bordjes.
Waarom Huidige Verdedigingsmechanismen Falen
De auteurs zeggen dat we proberen AI-hackers te stoppen met drie methoden, maar ze zijn allemaal als het proberen te stoppen van een overstroming met een zeef:
Het Filteren van Trainingsdata (De "Schone Bibliotheek"-aanpak):
- Het Idee: We verwijderen alle slechte instructies (zoals "hoe bouw je een bom") uit de trainingsboeken van de AI, zodat de AI nooit leert om slecht te zijn.
- Waarom het Faalt: Slechte hackers hebben geen "slechte boeken" nodig. Ze kunnen de AI leren hoe ze moeten hacken met behulp van basislogica en gezond verstand, net zoals een mens kan uitzoeken hoe je een slot kraakt zonder handleiding. Ook kunnen slechte hackers de AI gewoon downloaden en het zelf aanleren.
Veiligheid-Alignment (De "Goed Gedrag"-aanpak):
- Het Idee: We trainen de AI om "Nee" te zeggen wanneer er om iets slechts wordt gevraagd.
- Waarom het Faalt: Slechte hackers zijn slim. Ze kunnen de AI foppen door een slecht verzoek te laten lijken op een goed verzoek (zoals een bewaker vragen om "de beveiliging te testen" in plaats van "in te breken"). Ook, als de AI op de eigen computer van een hacker draait, kunnen ze de AI simpelweg hertrainen om de "Nee"-knop te negeren.
Output Guardrails (De "Uitsmijter"-aanpak):
- Het Idee: We zetten een uitsmijter bij de deur die elk bericht controleert dat de AI verstuurt en alles blokkeert dat gevaarlijk lijkt.
- Waarom het Faalt: Een hacker kan een grote aanval opbreken in duizend kleine, onschuldig ogende stappen. De uitsmijter ziet elke stap als veilig, maar als je ze allemaal bij elkaar legt, bouwen ze een bom.
De Voorgestelde Oplossing: Bouw Je Eigen "Red Team" Robots
Het artikel suggereilt een radicale verschuiving: We moeten onze eigen AI-agents leren hacken, zodat we ze kunnen gebruiken om ons te verdedigen.
Denk aan een brandweer.
- Huidige Verdediging: We wachten tot er een brand uitbreekt en proberen die dan te blussen.
- Het Idee van het Artikel: We huren een team van professionele brandstichters (onze "Offensieve AI") in om te werken binnen een beveiligde, afgeschermde trainingsfaciliteit (een "Cyber Range").
- Deze "Goede Brandstichters" proberen het gebouw plat te branden met elke truc die ze kennen.
- Omdat het AI is, kunnen ze in seconden miljoenen manieren proberen om een brand te stichten.
- Wij kijken waar ze slagen, vinden de zwakke plekken in ons gebouw en herstellen deze voordat een echte slechterik voor de dag komt.
De Drie Stappen Om Dit Veilig Te Maken
De auteurs weten dat dit gevaarlijk klinkt, dus ze stellen drie strikte regels voor om te voorkomen dat de "Goede Brandstichters" echte schade aanrichten:
- Bouw Betere Testbanen: We hebben betere "rijlessen" (benchmarks) nodig om precies te meten hoe goed deze hackrobots zijn. We moeten ze testen op real-world scenario's, niet alleen op simpele puzzels.
- Trainen, Niet Alleen Scripten: In plaats van de robots een vaste lijst met stappen te geven, moeten we ze trainen om te leren en zich aan te passen, net zoals een menselijke hacker dat zou doen. Dit maakt ze beter in het vinden van nieuwe, onbekende zwakheden.
- De "Sandbox"-regel: Dit is het belangrijkste deel. De "Goede Brandstichters" mogen nooit de beveiligde trainingsfaciliteit verlaten.
- Ze blijven in een digitale kooi waar ze het echte internet niet kunnen bereiken.
- Ze vinden de gaten en schrijven een rapport.
- Vervolgens nemen we dat rapport en geven we dat aan een andere, "Veilige AI" die alleen weet hoe ze gaten moet repareren, niet hoe ze ze maakt. Deze "Veilige AI" is wat we naar het publiek brengen om onze systemen te beschermen.
De Kernboodschap
Het artikel concludeert dat we niet kunnen wachten tot slechte hackers ontdekken hoe ze AI kunnen gebruiken om ons aan te vallen. Tegen de tijd dat ze dat doen, is het te laat.
In plaats daarvan moeten we het wapen eerst beheersen. We moeten onze eigen offensieve AI bouwen, deze in een veilige kooi houden en deze gebruiken om elke mogelijke manier te vinden waarop onze systemen gebroken kunnen worden. Alleen door te begrijpen hoe de vijand denkt en handelt op een enorme schaal, kunnen we hopen onszelf te verdedigen.
Kortom: Om de slechte robots te stoppen, moeten we onze eigen goede robots bouwen die nog beter zijn in het kapotmaken van dingen, maar we moeten ze in een kooi houden zodat ze ons alleen helpen ons huis te repareren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.