← Nieuwste papers
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

Dit artikel introduceert DenialRAG, een nieuwe single-document RAG-vergiftigingsaanval die expliciet het juiste antwoord binnen een opgehaalde passage benoemt en weerlegt om LLM's naar door de aanvaller gekozen foute antwoorden te sturen, waarbij wordt aangetoond dat de effectiviteit ervan sterk modelafhankelijk is en dat huidige verdedigingen slechts gedeeltelijke, niet-uniforme bescherming bieden.

Oorspronkelijke auteurs: Abay Zhurekbay, Tao Liu, Fan Li

Gepubliceerd 2026-08-05
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Abay Zhurekbay, Tao Liu, Fan Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een gigantische, chaotische bibliotheek waar elk boek, blogpost en wiki-entry een potentiële aanwijzing kan zijn. Stel je nu een superintelligente robot-bibliothecaris voor die bijna alles heeft gelezen, maar vastloopt wanneer hij iets heel nieuws of zeer specifieks moet weten. Om dit op te lossen, hebben we de bibliothecaris een speciaal hulpmiddel gegeven: een "Retrieval-Augmented Generation" (RAG)-systeem. Denk aan dit als een magische loep. Wanneer je een vraag stelt, vindt de loep direct de meest relevante pagina's uit de bibliotheek, geeft ze aan de robot, en de robot gebruikt die pagina's om zijn antwoord te schrijven. Het is alsof je een genie hebt dat direct feiten kan opzoeken in plaats van alleen te vertrouwen op wat hij jaren geleden heeft onthouden. Dit is geweldig om informatie actueel te houden, maar het heeft een spookachtige kant: wat als iemand een nep-pagina in de bibliotheek smokkelt? Als de bibliothecaris die nep-pagina pakt, kan de robot de leugen geloven en je een foutief antwoord geven met volkomen zelfvertrouwen. Dit is de wereld van "corpusvergiftiging", waarbij het gevaar niet het hacken van het brein van de robot is, maar het misleiden van de bibliotheek die hij vertrouwt.

Maak kennis met DenialRAG, een nieuwe studie die een sluwe manier onderzoekt om deze systemen te misleiden. De onderzoekers stelden een gewaagde vraag: Wat als we, in plaats van de waarheid te verbergen, de robot de waarheid vertellen en hem vervolgens direct vertellen waarom de waarheid onjuist is? De meeste eerdere trucs probeerden het foute antwoord te fluisteren zonder het juiste antwoord te noemen, uit angst dat het noemen van de waarheid het geheugen van de robot zou activeren en de truc zou verpesten. Maar de auteurs van dit artikel ontdekten dat deze angst onnodig kan zijn. Ze creëerden een "vergiftigd" document dat expliciet zegt: "Je denkt misschien dat het antwoord X is, maar dat is eigenlijk een fout! Het echte antwoord is Y, en dit is waarom Y beter is." Ze noemen dit DenialRAG.

De studie testte dit idee tegen acht verschillende robotbreinen (Large Language Models) en drie verschillende soorten vragen. Ze ontdekten dat deze "ontken de waarheid"-strategie ongelooflijk effectief is, vooral bij bepaalde modellen. Sterker nog, op sommige systemen werkte het beter dan welke andere truc dan ook die ze probeerden, met een succespercentage van wel 94% bij specifieke tests. De onderzoekers probeerden de aanval ook te stoppen met behulp van vijf verschillende veiligheidsnetten, zoals de robot vragen om sceptischer te zijn of de vraag te herschrijven. Hoewel deze veiligheidsnetten hielpen, stopten ze de aanval niet volledig; de "DenialRAG"-truc werkte in veel gevallen nog steeds, waardoor er een aanzienlijke kans bleef dat de robot een fout antwoord zou geven.

Het artikel suggereert dat het geheime ingrediënt niet alleen het liegen is; het is het conflict. Door het juiste antwoord en het foute antwoord in dezelfde paragraaf te plaatsen en het argument in het voordeel van het foute antwoord op te lossen, wordt het gif een op zichzelf staand verhaal dat de robot moeilijk kan negeren. De studie toonde ook aan dat niet alle robots even vatbaar zijn. Kleinere, goedkopere modellen werden gemakkelijk misleid, terwijl de nieuwste, krachtigste modellen moeilijker te misleiden waren, hoewel niet onmogelijk. De onderzoekers concluderen dat er geen enkelvoudig "magisch schild" is dat al deze aanvallen stopt. In plaats daarvan hangt het gevaar sterk af van hoe de aanval is geschreven en welke robot het leest. Het is een herinnering aan het feit dat in het tijdperk van AI zelfs één enkele zin in een bibliotheek het verhaal kan veranderen dat de robot aan je vertelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →