Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
Dit artikel introduceert een uitgebreid auditraamwerk voor de dekking van een 4×6-taxonomie van doelen en technieken en benchmarks, afgeleid van 932 veiligheidsstudies, dat aantoont dat huidige benchmarks voor aanvallen op LLM's gezamenlijk ten hoogste 25% van het bedreigingsoppervlak bestrijken en te kampen hebben met aanzienlijke evaluatiegaten en fragmentatie in de benaming.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Geheel: Het Probleem van de "Veiligheidskaart"
Stel je de wereld van Large Language Models (LLM's) voor als een enorme, bruisende stad. De mensen die deze modellen bouwen, zijn als stadsplanners die proberen te zorgen dat de stad veilig is voor criminelen (hackers).
Sinds een paar jaar vinden onderzoekers nieuwe manieren waarop criminelen de stad kunnen binnenbreken. Maar hier zit het probleem: iedereen gebruikt verschillende kaarten, verschillende namen voor dezelfde misdrijven en verschillende manieren om te meten hoe veilig de stad is. Sommige onderzoekers zeggen: "We hebben de banken gecontroleerd!" terwijl anderen zeggen: "We hebben de energiecentrales gecontroleerd!" Maar niemand heeft gecontroleerd of de hele stad veilig is.
Dit paper is als een team van cartografen dat besloot om te stoppen met ruziën over kaarten en in plaats daarvan één grote, meesterkaart te bouwen van elke mogelijke manier om een AI aan te vallen. Vervolgens hebben ze de huidige patrouilleroutes van de veiligheidsagenten (de "benchmarks") gecontroleerd om te zien of ze eigenlijk wel de hele stad bestrijken.
De schokkende bevinding? De veiligheidsagenten patrouilleren alleen in een klein, drukke wijk (ongeveer 25% van de stad), terwijl enorme, gevaarlijke districten volledig leeg en onbewaakt zijn.
1. De Meesterkaart (De Taxonomie)
De onderzoekers keken naar 932 wetenschappelijke papers die tussen 2023 en 2026 zijn gepubliceerd. Ze vonden meer dan 6.300 vermeldingen van verschillende aanvallen.
De Chaos van de Namen:
Stel je voor dat één type auto-inbraak in de ene stad "Hotwiring" heet, in een andere "Keyless Entry Theft" en in een derde "The Silent Heist". Dat is wat er gebeurde met AI-aanvallen.
- De Analogie: De beroemde "GCG"-aanval (een manier om AI te misleiden) werd in 376 papers 29 verschillende namen gegeven.
- De Oplossing: Het team creëerde een standaardwoordenboek (een taxonomie) met 507 specifieke "bladeren" (categorieën). Ze maakten de rommel op, waarbij ze de 29 namen samenvoegden tot één, zodat iedereen dezelfde taal spreekt.
De Structuur:
Ze organiseerden deze aanvallen in een 4x6 Raster (Matrix):
- De Rijen (Het Doel): Wat wil de crimineel?
- Safety Bypass: De AI iets slechts laten zeggen (zoals haatzaaiende taal).
- System Hijacking: De AI iets slechts laten doen (zoals bestanden verwijderen of geld overmaken).
- Information Theft: Geheimen stelen uit het geheugen van de AI.
- Service Disruption: De AI zo traag of duur maken in gebruik dat het crasht (zoals een file).
- De Kolommen (De Methode): Hoe doen ze dat?
- Door verwarrende woorden te gebruiken, de AI te liegen, code te verbergen of het interne brein van de AI aan te vallen.
2. De Veiligheidscontrole (De Benchmark Audit)
De onderzoekers namen de drie beroemdste "veiligheidstests" die door de industrie worden gebruikt (HarmBench, InjecAgent en AgentDojo) en projecteerden ze op hun Meesterkaart.
Het Resultaat:
- Geen Overlap: De drie tests controleren niet eens dezelfde dingen. Ze zijn als drie verschillende brandweerbrigades: de ene controleert alleen keukens, de andere alleen garages en de derde alleen kelders. Geen van hen controleert het hele huis.
- Het Dekkingsgat: Samen dekken deze tests slechts 25% van de Meesterkaart.
- De Blinde Vlekken:
- Het "Service Disruption"-District: Dit is waar aanvallen proberen de AI te laten crashen of extreem duur te maken om te draaien. Geen enkele van de grote tests controleert dit.
- Het "Model Internals"-District: Dit is waar hackers direct het interne brein van de AI aanpassen. Geen enkele test controleert dit ook.
Waarom dit belangrijk is:
Het paper vond dat aanvallen in deze "blinde vlek"-gebieden eigenlijk zeer effectief zijn. Sommige kunnen de AI 46 keer trager maken of 100 keer duurder om te gebruiken, toch test niemand daarop. Het is alsof je een brandalarm hebt dat alleen piept als je toast verbrandt, maar stil blijft als het hele huis in brand staat.
3. Het "Alles-in-één"-Probleem
De onderzoekers merkten op dat, omdat het veld zich zo snel ontwikkelt, veel wetenschappers nieuwe aanvallen zomaar in een "Miscellaneous"-emmer gooien omdat ze nog geen specifieke naam hebben.
- De Analogie: Het is als een bibliotheek waar 60% van de nieuwe boeken zomaar in een doos worden geduwd met het label "Spul".
- De Impact: Dit maakt het moeilijk om te weten hoeveel echte nieuwe aanvallen er plaatsvinden. Het paper stelt dat we betere namen nodig hebben zodat we de bedreigingen daadwerkelijk kunnen tellen.
4. Wat Ze Hiermee Dedden
In plaats van alleen maar op de gaten te wijzen, hebben de onderzoekers hun tools voor het publiek vrijgegeven:
- De Meesterkaart: Een downloadbare lijst van alle 507 aanvalstypen.
- Het Auditrapport: Een duidelijk diagram dat precies laat zien welke delen van de kaart worden getest en welke worden genegeerd.
- Een Blauwdruk voor Nieuwe Tests: Ze lieten zien hoe je hun kaart kunt gebruiken om een nieuwe test te bouwen, specifiek voor de "blinde vlekken" (zoals het Service Disruption-district).
De Conclusie
Het paper betoogt dat we momenteel "op de verkeerde dingen testen". We zijn erg goed in het testen of een AI iets onbeleefds zal zeggen, maar we zijn slecht in het testen of een AI zal crashen, data zal stelen of gekaapt zal worden om echte schade aan te richten.
De Kernboodschap: Alleen omdat een veiligheidstest zegt dat een AI "veilig" is, betekent niet dat het dat is. Het betekent alleen dat het de specifieke, smalle test die het kreeg, heeft doorstaan. Om echt veilig te zijn, moeten we onze tests uitbreiden om de hele stad te dekken, niet alleen de wijk waar we op dit moment comfortabel bij zitten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.