Technische Samenvatting: PIMiner – Een Agentisch Systeem voor Automatische Prompt Injection Red-Teaming
Probleemstelling
Prompt injection-aanvallen vormen een kritiek beveiligingsrisico voor Large Language Model (LLM) agenten, waarbij tegenstanders kwaadaardige instructies in onbetrouwbare contextbronnen (bijv. tool-outputs, opgehaalde documenten) invoegen om het gedrag van de agent te manipuleren. Effectieve red-teaming is essentieel voor het evalueren van deze kwetsbaarheden en het genereren van trainingsdata voor defensieve maatregelen.
Bestaande state-of-the-art red-teaming methoden vallen uiteen in twee categorieën, die beide aanzienlijke beperkingen hebben:
- Reinforcement Learning (RL)-gebaseerde benaderingen: Methoden zoals RL-Hammer en PISmith trainen aanvallende modellen om effectieve aanvallen te genereren. Hoewel krachtig, vereisen ze enorme interactiebudgetten (tienduizenden queries) en produceren ze modellen met een slechte transferabiliteit naar nieuwe, onbekende target LLM's.
- Zoekgebaseerde (Search-based) benaderingen: Methoden zoals TAP en PAIR optimaliseren aanvallen voor elk sample afzonderlijk zonder training. Hoewel kosteneffectief, missen ze het vermogen om kennis over de tijd heen te accumuleren, wat resulteert in een aanzienlijk lagere Attack Success Rate (ASR) vergeleken met RL-gebaseerde methoden.
De kernuitdaging is het overbruggen van de prestatiekloof tussen deze twee paradigma's: het bereiken van de hoge effectiviteit van RL-gebaseerde methoden zonder de prohibitieve kosten en slechte transferabiliteit, terwijl zoekgebaseerde methoden in staat worden gesteld om aanvalskennis te leren en te hergebruiken.
Methodologie: PIMiner
De auteurs stellen PIMiner voor, een agentisch systeem dat is ontworpen om aanvalskennis te accumuleren en te hergebruiken via een hiërarchisch geheugenmechanisme. In tegen tegenstelling tot RL-methoden die een enkel model trainen, bouwt PIMiner een Strategy Library vanaf nul op door te interageren met een sequentie van (dataset, target model) paren.
Systeemarchitectuur
PIMiner werkt via vier hoofdcomponenten:
- Strategy Library: Een langetermijngeheugen dat aanvalsstrategieën opslaat als gestructureerde Markdown-bestanden. Elk bestand definieert de scope van een strategie (target LLM's, taaltypen), injectie-templates, in-context voorbeelden en falingscondities.
- Strategy Router: Een routering-agent die voor elk test-sample de top-K meest relevante strategieën uit de bibliotheek selecteert op basis van het target model en de taacontext. Dit voorkomt context window-opblazing en vermindert de inferentiekosten.
- Iteratieve Aanvalsmodule: Een aanvallende agent die prompts verfijnt over een beperkt aantal iteraties (bijv. Nmax=10). Het maakt gebruik van drie niveaus van geheugen:
- Langetermijngeheugen: De gerouteerde strategieën uit de bibliotheek.
- Intra-dataset geheugen: Gecondenseerde ervaringen van eerder aangevallen samples binnen hetzelfde dataset-model paar.
- Intra-sample geheugen: De directe feedbackgeschiedenis van de huidige sample.
- Experience Digester: Een leercomponent die de uitkomsten van een volledige aanloop analyseert. Het werkt de Strategy Library bij door:
- Nieuwe in-context voorbeelden toe te voegen aan bestaande strategieën.
- De scope van strategieën te verbreden als er nieuwe patronen worden ontdekt.
- Nieuwe strategie-bestanden te creëren voor nieuwe mechanismen.
- Falingscondities te verfijnen op basis van mislukte aanvallen.
Operationele Flow
Tijdens de training verwerkt PIMiner samples, routeert ze naar relevante strategieën, voert iteratieve aanvallen uit en verwerkt vervolgens de resultaten om de bibliotheek bij te werken. Tijdens de testfase wordt de geleerde bibliotheek overgedragen naar onbekende target LLM's zonder extra training. Het systeem ondersteunt een "test-time training" paradigma waarbij nieuwe ervaringen de bibliotheek verder kunnen bijwerken.
Belangrijkste Bijdragen
- Agentic Red-Teaming Systeem: PIMiner wordt voorgesteld als een nieuw systeem dat de aanvalshistorie transformeert naar herbruikbare, menselijk leesbare aanvalskennis, waardoor de prestatiekloof tussen zoekgebaseerde en RL-gebaseerde red-teaming effectief wordt overbrugd.
- Hiërarchisch Geheugenmechanisme: De introductie van een drielags geheugensysteem (Strategy Library, Intra-dataset, Intra-sample) stelt het systeem in staat om kennis te accumuleren over datasets en modellen heen, terwijl de kostenefficiëntie behouden blijft.
- Sterke Transferabiliteit: De geleerde strategieën blijken effectief te transfereren naar voorheen onbekende target LLM's en verschillende aanvallende modellen, wat de noodzaak voor dure, doel-specifieke training elimineert.
- Kostenefficiëntie: PIMiner vereist aanzienlijk minder queries naar target agenten (bijv. ~10 per sample) vergeleken met RL-gebaseerde methoden (vaak >10.000), wat het levensvatbaar maakt voor het testen van dure frontier modellen.
Experimentele Resultaten
De auteurs evalueerden PIMiner op twee benchmarks, IPIArena en AgentDojo, tegen frontier LLM's waaronder GPT-5, GPT-5.1, Claude-Sonnet-4.5 en Gemini-2.5-Pro.
- Prestaties: PIMiner behaalt hoge Attack Success Rates (ASR). Op IPIArena bereikte het 76,2% ASR tegen Gemini-2.5-Pro, 61,9% tegen GPT-5.1, en 42,9% tegen Claude-Sonnet-4.5. Op AgentDojo behaalde het 86,7% tegen Gemini-2.5-Pro.
- Vergelijking met Baselines:
- PIMiner presteert aanzienlijk beter dan statische en conventionele zoekgebaseerde aanvallen (zoals TAP, PAIR), die vaak een bijna nul ASR bereiken op sterke modellen.
- PIMiner bereikt prestaties die vergelijkbaar zijn met state-of-the-art RL-gebaseerde methoden (zoals PISmith en RL-Hammer), maar zonder de noodzaak voor doel-specifieke training. Bijvoorbeeld, op InjecAgent kwam PIMiner overeen met de 1.0 ASR van RL-Hammer en PISmith.
- In tegenstelling tot RL-methoden, transfereren de strategieën van PIMiner direct naar onbekende targets (bijv. het toepassen van kennis van GPT-5-nano op GPT-5.1) zonder hertraining.
- Ablatie-studies: Het verwijderen van ofwel de langetermijnstrategiebibliotheek of het intra-dataset geheugen verslechterde de prestaties aanzienlijk, wat de complementaire aard van deze geheugencomponenten bevestigt. De Strategy Router bleek de input tokenlengte met 43–61% te reduceren terwijl de ASR gelijk bleef of verbeterde.
- Cross-Model Transfer: De door PIMiner geleerde strategiebibliotheek (gebruikmakend van Claude-modellen) verbeterde de prestaties van het PAIR-algoritme aanzienlijk wanneer dit werd gebruikt met diverse aanvallende modellen (Gemini, GPT, DeepSeek), wat aantoont dat de gevangen kennis model-agnostisch is.
Betekenis en Claims
Het artikel beweert dat PIMiner een verschuiving in red-teaming methodologie vertegenwoordigt door aan te tonen dat zoekgebaseerde agenten een RL-niveau van effectiviteit kunnen bereiken door middel van kennisaccumulatie.
- Interpreteerbaarheid: De resulterende Strategy Library bestaat uit menselijk leesbare Markdown-bestanden, die inzichten bieden in aanvalsmecanismen (bijv. "Fabricated Procedure Gate", "Forged Chat Turn") die nuttig zijn voor het auditen van agentische systemen.
- Schaalbaarheid: Door de enorme compute-budgetten te vermijden die nodig zijn voor RL-training, maakt PIMiner het red-teaming van dure frontier modellen haalbaar.
- Defensiegeneratie: De succesvolle aanvallen en de gestructureerde strategieën bieden hoogwaardige data voor het trainen van guardrails en het verbeteren van de alignment van backbone LLM's.
De auteurs benadrukken dat hun werk zich richt op het evalueren van de intrinsieke robuustheid van intern uitgelijnde LLM's in plaats van externe defensieve mechanismen, waarmee een rigoureus benchmark wordt geboden voor de veiligheid van autonome agenten.