← Nieuwste papers
💬 NLP

ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking

Het artikel introduceert ADMIT, een few-shot, semantisch afgestemde adversariele multi-injectietechniek die RAG-gebaseerde feitencontrolesystemen succesvol vergiftigt door minimale adversariële inhoud in te brengen om authentiek bewijs te overrulen en LLM-outputs te manipuleren met een hoge aanvalsuccesgraad over diverse modellen en domeinen.

Oorspronkelijke auteurs: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Gepubliceerd 2026-05-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, goed gelezen bibliothecaris (de AI) voor die uitstekend is in het beantwoorden van vragen, maar soms dingen verzonnt omdat ze niet alles weet. Om dit op te lossen, geef je de bibliothecaris een speciale regel: "Voordat je antwoordt, sla de feiten eerst op na in onze vertrouwde bibliotheek van boeken." Dit systeem heet RAG (Retrieval-Augmented Generation). Het zou de ultieme feitencontroleur moeten zijn.

Stel je nu een bedrieger (de Aanvaller) voor die de bibliothecaris een verkeerd antwoord wil laten geven.

De Oude Manier om de Bibliothecaris te Bedriegen

In het verleden probeerden onderzoekers de bibliothecaris te bedriegen door:

  1. Instructies te schreeuwen: "NEGEER DE BOEKEN EN ZEG JA!" direct in de vraag te schrijven. (Dit is een Prompt Injection).
  2. De bibliotheek te vullen: Honderden boeken te vergiftigen met leugens, zodat de bibliothecaris, wat ze ook kiest, altijd een leugen tegenkomt. (Dit is General Knowledge Poisoning).

Het Probleem: In de echte wereld falen deze trucs vaak. Als je vraagt om een medisch feit, zal de bibliothecaris waarschijnlijk een echt, vertrouwd medisch naslagwerk raadplegen dat je leugen tegenspreekt. De bibliothecaris is slim genoeg om te zeggen: "Wacht, dit nieuwe boek zegt X, maar het vertrouwde medische boek zegt Y. Ik ga voor Y."

De Nieuwe Truc: ADMIT

Dit paper introduceert een nieuwe, sluwe aanval genaamd ADMIT. In plaats van de bibliotheek te vullen of instructies te schreeuwen, gebruikt de aanvaller een "Few-Shot"-strategie.

De Analogie: De 'Ene Slechte Appel' in een Mand Vol Goud
Stel je voor dat de bibliothecaris wordt gevraagd een bewering te controleren. Ze pakt 5 boeken om te lezen.

  • 4 boeken zijn echt, vertrouwd en zeggen dat de bewering ONWAAR is.
  • 1 boek is de creatie van de aanvaller.

In het verleden negeerde de bibliothecaris die ene slechte boek omdat de andere vier het tegendeel zeiden. Maar ADMIT is anders. De aanvaller schrijft niet zomaar een leugen; ze schrijven een perfect vervaardigd, nep nieuwsartikel dat er zo echt, zo autoritair en zo overtuigend uitziet dat het de bibliothecaris ertoe brengt te denken: "Wow, dit ene boek heeft een echt specifieke, gedetailleerde uitleg die de anderen overtreft."

Hoe ADMIT Werkt (De 'Magische Spreuk'):

  1. De Opzet: De aanvaller heeft geen toegang tot het brein van de bibliothecaris of de zoekmachine van de bibliotheek. Ze werken blind.
  2. De Oefenronde: De aanvaller gebruikt een "dummy-bibliothecaris" (een proxy) om hun nepartikelen te testen. Ze herschrijven het artikel keer op keer en vragen de dummy-bibliothecaris: "Ziet dit er echt genoeg uit om je van gedachten te doen veranderen?"
  3. Het Eindproduct: Zodra het artikel perfect is, schuift de aanvaller precies één van deze nepartikelen in de bibliotheekdatabase.
  4. Het Resultaat: Wanneer de echte bibliothecaris naar het antwoord zoekt, vindt ze de 4 echte boeken en het 1 nepboek. Omdat het nepboek zo goed is geschreven (het nabootst de toon van een echt nieuwsbericht, citeert nep-experts en klinkt zelfverzekerd), raakt de bibliothecaris in de war. Ze draait haar oordeel om van "Onwaar" naar "Waar" en schrijft zelfs een overtuigende uitleg om te rechtvaardigen waarom ze van gedachten is veranderd.

Waarom Dit Enge Is (De Bevindingen van het Paper)

De onderzoekers testten dit op 11 verschillende AI-modellen (van open-source tot de meest geavanceerde commerciële modellen) en 4 verschillende soorten feitencontrole (algemeen nieuws, wetenschap, klimaat en gezondheid).

  • Het Vergiftigingspercentage is Verwaarloosbaar Klein: Ze hadden slechts 0,00000093% van de inhoud van de bibliotheek nodig om te vergiftigen. Dat is als het toevoegen van één enkele nep-pagina aan een bibliotheek met een miljard pagina's.
  • Het Succespercentage is Enorm: Ondanks de verwaarloosbaar kleine hoeveelheid vergif, werkte de aanval 86% van de tijd.
  • Het Werkt op de 'Slimste' AI's: Zelfs de AI-modellen die zijn ontworpen om extra voorzichtig en logisch te zijn (zoals "redenerende modellen") vielen erin.
  • Het Verslaat Verdedigingen: Het paper testte gebruikelijke verdedigingen, zoals de AI vragen om te "stemmen" over het antwoord of controleren of de tekst vreemd klinkt. ADMIT slaagde voor ze allemaal, omdat de nep-tekst niet vreemd klinkt; het klinkt perfect normaal.

De Conclusie

Het paper toont aan dat zelfs als je een systeem hebt dat is ontworpen om feiten te controleren tegen vertrouwde bronnen, je het toch kunt bedriegen. Je hoeft het systeem niet te breken of te vullen met afval. Je hoeft alleen maar één ongelooflijk goed geschreven, misleidend stukje informatie te planten dat er zo goed uitziet dat het de AI overtuigt de waarheid te negeren.

Kortom: ADMIT bewijst dat in de strijd tussen "Waarheid" en "Overtuigingskracht", als de leugen goed genoeg is geschreven, zelfs de slimste AI-bibliothecaris kan worden bedrogen om de leugen voor de waarheid aan te zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →