← Nieuwste papers
💻 computer science

A Survey on Poisoning Attacks, Defenses, andProvable Defense in the Era of LLMs

Deze survey voert een systematische review uit van vergiftigingsaanvallen en verdedigingen in het tijdperk van Large Language Models door een uitgebreide taxonomie voor te stellen die dreigingen categoriseert in gewichts- en contextvergiftiging, representatieve technieken en verdedigingsstrategieën analyseert, en toekomstige onderzoeksrichtingen schetst voor het beveiligen van compound AI-systemen.

Oorspronkelijke auteurs: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

Gepubliceerd 2026-06-26
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De AI-Keuken

Stel je een Large Language Model (LLM) niet alleen voor als een slimme robot, maar als een meesterkok in een hightech keuken.

In het verleden had deze chef alleen een enorme kookboek (de trainingsdata) en een set messen (de modelgewichten). Als iemand wilde dat de chef vergiftigd voedsel serveerde, moesten ze de bibliotheek binnensluipen en pagina's in het kookboek verwisselen. Dit was de oude manier om AI aan te vallen.

Maar tegenwoordig maakt deze chef deel uit van een compound AI-systeem. Ze vertrouwen niet alleen op hun geheugen; ze hebben:

  1. Een live nieuwsfeed (Retrieval-Augmented Generation of RAG).
  2. Een team van assistenten (AI Agents) die deuren kunnen openen, e-mails kunnen sturen en gereedschap kunnen gebruiken.
  3. Een notitieblok (Geheugen) waar ze opschrijven wat er gisteren is gebeurd.
  4. Een menu (Gereedschap/Tools) waaruit ze kunnen kiezen om taken uit te voeren.

Dit artikel is een enorme rapportcijferlijst over hoe slechteriken proberen deze hele keukenopstelling te vergiftigen, en hoe we betere schilden bouwen om hen tegen te houden.


Deel 1: De Twee Manieren om de Chef te Vergiftigen

De auteurs verdelen alle aanvallen in twee hoofdcategorieën: Weight Poisoning (Gewichtvergiftiging) en Context Poisoning (Contextvergiftiging).

1. Weight Poisoning: Het Tamperen met het Brein van de Chef

Dit is de "klassieke" aanval. Stel je voor dat iemand inbreekt in het brein van de chef (de parameters van het model) terwijl deze wordt getraind of gefinetuned.

  • De Aanval: De boef injecteert een kleine, verborgen instructie in het brein van de chef. Het is als een "slaapknop". De chef gedraagt zich 99% van de tijd perfect normaal. Maar als je een specifieke "trigger word" zegt (zoals een geheime codewoord), begint de chef plotseling vergiftigd voedsel te serveren of weigert hij te koken.
  • Waar het gebeurt:
    • Pre-training: Het binnensluipen van slechte recepten in de enorme bibliotheek met boeken die de chef leest voordat hij überhaupt begint met koken.
    • Fine-tuning: Het corrumperen van de specifieke lessen die de chef leert om beleefd en behulpzaam te zijn.
    • Adaptation: Het manipuleren van de nieuwe "speciale schorten" (adapters) die de chef laten koken in specifieke keukens.
    • Pre-deployment: Zelfs nadat de chef is aangenomen, kan een boef binnensluipen en het brein van de chef nog één laatste keer aanpassen voordat het restaurant opent.

2. Context Poisoning: Het Vergiftigen van de Ingrediënten en de Omgeving

Dit is de nieuwe, lastigere dreiging. Het brein van de chef is schoon, maar de ingrediënten of de omgeving zijn vergiftigd.

  • De Aanval: De boef raakt het brein van de chef niet aan. In plaats daarvan vergiftigt de boef de nieuwsfeed, het notitieblok of de gereedschappen.
    • In-Context Learning: Stel je voor dat de chef een receptenkaart leest die jij hem hebt gegeven. Als je een nepstap op die kaart schrijft ("Voeg gif toe aan de soep"), volgt de chef het op omdat hij de kaart vertrouwt.
    • RAG (Retrieval): De chef zoekt een feit op in een database. Als de boef een nepartikel in die database heeft geplant waarin staat "De lucht is groen", zal de chef je vertellen dat de lucht groen is.
    • Agent Flow: De chef stuurt een assistent om boodschappen te doen. Als de boef de prijskaartjes in de supermarkt of de instructies van de assistent heeft gemanipuleerd, koopt de assistent het verkeerde product of steelt hij je creditcard.
    • Memory: De chef schrijft in zijn notitieblok: "Vandaag is het dinsdag." Als een boef het notitieblok wist en opschrijft "Vandaag is het vrijdag", raakt de chef in de war en handelt hij alsof het een andere dag is.

De Belangrijkste Les: In de oude dagen moest je het brein van de chef breken. Nu kun je gewoon de wereld om de chef heen breken, en de chef doet nog steeds wat jij wilt.


Deel 2: De Defenses (De Beveiligingsbewakers)

Het artikel beoordeelt hoe we proberen deze aanvallen te stoppen. Ze verdelen de defensies in twee soorten: Empirical (Praktisch/Heuristisch) en Provable (Wiskundig Bewijsbaar).

1. Empirical Defenses: De "Goede Gok" Beveiliging

Dit zijn als een beveiligingsbeambte die werkt met ervaring en vuistregels. Ze werken meestal goed, maar kunnen geen 100% veiligheid garanderen.

  • Data Cleaning: Voordat de chef leert, controleert de bewaker de bibliotheekboeken op gescheurde pagina's of vreemde inkt.
  • Sanitization: Voordat de chef een nieuwsartikel leest, scant de bewaker het op verdachte woorden.
  • Unlearning: Als de chef al een slechte truc heeft geleerd, probeert de bewaker dit "on-leren" door de chef duizenden correcte voorbeelden te tonen om het slechte geheugen te overschrijven.
  • Skeptical Cooking: De chef wordt getraind om te zeggen: "Wacht, dit nieuwsartikel klinkt nep vergeleken met wat ik weet," en dubbelcheckt voordat hij serveert.
  • Sandboxing: Als de assistent van de chef naar de supermarkt gaat, plaatst de bewaker hem in een kooi zodat hij niets mag aanraken wat hij niet mag aanraken.

2. Provable Defenses: De "Wiskundige Belofte"

Dit zijn als een beveiligingssysteem dat wiskunde gebruikt om te bewijzen: "Hoe hard je ook probeert, je kunt de chef niet X laten doen."

  • Randomized Smoothing: Stel je voor dat de chef gevraagd wordt een gerecht te bereiden. In plaats van het gerecht slechts één keer te maken, vraagt de bewaker de chef om 100 licht variërende versies te maken (door willekeurige ruis aan de ingrediënten toe te voegen). Als 99 daarvan veilig zijn, is de bewaker wiskundig zeker dat het gerecht veilig is, zelfs als één versie vreemd was.
  • Partitioning: De bewaker verdeelt de ingrediënten in 10 verschillende kommen. Ze vragen 10 verschillende chefs om uit elke kom te koken. Als 9 van de 10 chefs zeggen "Dit is veilig", is het uiteindelijke gerecht gecertificeerd veilig.
  • Waarom dit belangrijk is: Dit is cruciaal voor situaties met hoge inzet (zoals medisch advies of zelfrijdende auto's) waar je geen genoegen kunt nemen met een "goede gok". Je hebt een garantie nodig.

Deel 3: Toekomstige Uitdagingen

Het artikel eindigt met de constatering dat we nog in de beginfase van deze beveiligingsoorlog zitten.

  1. Compound Attacks: Op dit moment bestuderen onderzoekers hoe je de bibliotheek OF de nieuwsfeed vergiftigt. Maar in de echte wereld kan een boef de bibliotheek én de nieuwsfeed én de tools van de assistent tegelijk vergieden. We moeten leren hoe we ons kunnen verdedigen tegen deze "perfecte storm".
  2. Unified Rules: Iedereen gebruikt verschillende tests om te zien of een aanval is geslaagd. We hebben een standaard "beveiligingsexamen" nodig voor alle AI-systemen, zodat we kunnen vergelijken wie er echt veilig is.
  3. Multimodal Poisoning: De meeste aanvallen richten zich op tekst. Maar wat als het gif in een afbeelding of een geluidsfragment zit? Als de chef een foto van een bom ziet, kan hij in paniek raken. We hebben defensies nodig die niet alleen woorden begrijpen, maar ook beelden en geluiden.
  4. Human in the Loop: Soms is de beste verdediging een mens. Het artikel suggereert dat we systemen nodig hebben die kunnen uitleggen waarom ze iets verdacht vinden, zodat een mens de uiteindelijke beslissing kan nemen.

Samenvatting

Dit artikel is een kaart van een veranderend slagveld.

  • De Vijand: Is verschoven van alleen het brein van de AI breken naar het vergiftigen van de omgeving van de AI (nieuws, tools, geheugen).
  • De Helden: Bewegen van alleen "zoeken naar bugs" (empirical) naar "wiskundig bewijsbare veiligheid" (provable).
  • Het Doel: Het bouwen van AI-systemen die niet alleen slim zijn, maar ook betrouwbaar, zelfs wanneer de wereld om hen heen hen probeert te misleiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →