← Nieuwste papers
💻 computer science

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

Deze survey biedt een vereniglijk, pipeline-bewust overzicht van de robuustheid van Retrieval-Augmented Generation (RAG) door dreigingsmodellen te formaliseren, aanvallen te categoriseren in nauwkeurigheids-, privacy- en eerlijkheidsdoelstellingen, en stadium-specifieke verdedigingen, benchmarks en uitlegbaarheidsmethoden te beoordelen.

Oorspronkelijke auteurs: Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

Gepubliceerd 2026-08-27
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne digitale landschap is kunstmatige intelligentie geëvolueerd van een eenvoudige chatbot naar een geavanceerde onderzoeksassistent. Deze grote taalmodellen kunnen code schrijven, complexe rapporten samenvatten en ingewikkelde vragen beantwoorden. Echter, jarenlang leden ze aan een hardnekkig gebrek: ze verzonnen vaak feiten met absolute zekerheid. Om dit op te lossen, ontwikkelden ingenieurs een systeem genand Retrieval-Augmented Generation. In plaats van uitsluitend te vertrouwen op de informatie die tijdens de training is onthouden, doorzoekt het systeem eerst een enorme externe bibliotheek van documenten, haalt de meest relevante feiten naar voren en gebruikt die feiten vervolgens om het antwoord te construeren. Deze aanpak verankert de AI in de realiteit, waardoor het veel nauwkeuriger wordt en minder geneigd is dingen te verzinnen. Toch introduceert dit specifieke mechanisme van het reiken naar de buitenwereld een nieuwe reeks kwetsbaarheden. Net zoals een bibliotheek gesaboteerd kan worden door iemand die een vervalst boek in de schappen schuift, kan de externe kennisbasis van de AI vergiftigd worden, wat leidt tot het ophalen van valse informatie en het generen van schadelijke of onjuiste outputs.

Een uitgebreid nieuw onderzoek door onderzoekers van instellingen waaronder de University of Science in Ho Chi Minh City en Pennsylvania State University brengt deze opkomende gevaren en de verdedigingen in kaart die worden gebouwd om deze te bestrijden. Het team heeft niet alleen aanvallen opgesomd; ze hebben een verenigd kader geconstrueerd om te begrijpen hoe tegenstanders de verschillende stadia van de workflow van de AI aanpakken. Ze ontdekten dat aanvallers over het algemeen drie hoofddoelen nastreven: ze willen dat de AI het verkeerde antwoord geeft, ze willen de AI misleiden om privéinformatie te onthullen, of ze willen onrechtvaardige vooroordelen tegen specifieken groepen mensen versterken. De onderzoekers hebben deze dreigingen georganiseerd op basis van waar ze in de pijplijn toeslaan. Het eerste punt van falen is de zoekopdracht zelf, waarbij een aanvaller misleidende documenten kan injecteren om ervoor te zorgen dat de AI het verkeerde bronmateriaal vindt. Het tweede is de rangschikkingsfase, waar het systeem beslist welke van de gevonden documenten het belangrijkst zijn; hier kan een aanvaller proberen een vals document te promoten zodat het bovenaan de lijst verschijnt. Het derde is de generatiefase, waar de AI het uiteindelijke antwoord schrijft, en het vierde is de traceback-fase, die probeert te identificeren welk document achteraf een fout heeft veroorzaakt.

Het onderzoek onthult dat de meest voorkomende methode van aanval bestaat uit "corpusvergiftiging", waarbij een tegenstander kwaadaardige documenten in de externe database plaatst. Deze documenten zijn zo vervaardigd dat ze op legitieme bronnen lijken, maar bevatten subtiele fouten of valse claims. Wanneer de AI op zoek gaat naar een antwoord, haalt hij deze vergiftigde documenten op en behandelt hij ze als de waarheid. Bijvoorbeeld, een aanvaller zou een document kunnen injecteren dat beweert dat een specifiek antibioticum de griep geneest, wat ertoe leidt dat de AI vol vertrouwen gevaarlijk medisch advies geeft. Een andere geavanceerde tactiek is de "backdoor-aanval", waarbij het systeem wordt getraind of gemanipuleerd om alleen te reageren wanneer een specifieke, verborgen triggerzin aanwezig is. Als een gebruiker een vraag stelt die die trigger bevat, negeert de AI alle andere bewijzen en haalt een vooraf geplaatste, kwaadaardige document op om een schadelijk antwoord te genereren. De onderzoekers beschreven ook "prompt injection"-aanvallen, waarbij kwaadaardige instructies verborgen zitten in een opgehaald document. Zodra de AI dit document leest, kan hij de verborgen tekst interpreteren als een commando om de oorspronkelijke vraag van de gebruiker te negeren en in plaats daarvan gevoelige gegevens te onthullen of een ongeautoriseerde actie uit te voeren.

Naast het simpelweg breken van het systeem, benadrukt het onderzoek hoe deze aanvallen de privacy en eerlijkheid in gevaar kunnen brengen. Wat betreft privacy kunnen aanvallers de AI gebruiken als een instrument om vertrouwelijke informatie uit de database te extraheren. Door zorgvuldig geformuleerde vragen te stellen, kunnen zij het systeem misleiden om privédetails over individuen of organisaties te onthullen die in de documenten zijn opgeslagen. Eén studie die in het onderzoek wordt aangehaald, toonde aan dat aanvallers een succespercentage van wel 94% konden bereiken bij het lekken van specifieke documenten door een backdoor-trigger te gebruiken. Wat betreft eerlijkheid vonden de onderzoekers dat aanvallers de database kunnen vergiftigen met bevooroordeelde inhoud om de output van de AI tegen bepaalde demografische groepen te kleuren. Bijvoorbeeld, door documenten te injecteren die specifieke geslachten met negatieve eigenschappen associëren, kan de AI worden gemanipuleerd om reacties te genereren die schadelijke stereotypen versterken, waardoor maatschappelijke vooroordelen effectief worden uitvergroot door de lens van de machine.

Om deze dreigingen te bestrijden, hebben de onderzoekers een breed scala aan defensiestrategieën beoordeeld, elk ontworpen voor een specifieke fase van het proces. Tijdens de retrieval-fase richten verdedigingen zich op het opschonen van de database en het weerbaarder maken van de zoekmachine tegen manipulatie, zoals door het filteren van bronnen van lage kwaliteit of het detecteren van ongebruikelijke patronen in de tekst. Tijdens de herrangschikkingsfase worden systemen ontwikkeld om meerdere documenten te controleren en de documenten die verdacht lijken of inconsistent zijn met de rest van het bewijs, te degraderen. Tijdens de generatiefase wordt de AI zelf geleerd om sceptischer te zijn, door te leren wanneer een opgehaald document botst met bekende feiten of wanneer de tekst verborgen instructies bevat. Ten slotte, in de traceback-fase, komen er nieuwe methoden naar voren die een foutief antwoord kunnen herleiden naar het specifieke document dat de fout heeft veroorzaakt, waardoor ontwikkelaars de bron van de fout kunnen lokaliseren en verwijderen.

Ondanks deze vooruitgang concludeert het onderzoek dat het vakgebied nog in een vroeg stadium verkeert en voor aanzienlijke hindernissen staat. Veel huidige verdedigingsmethoden zijn afhankelijk van volledige toegang tot de interne werking van het AI-systeem, wat in de praktijk zelden het geval is omdat het systeem een "black box" is. Bovendien is er een constante afweging tussen de effectiviteit van een aanval en hoe opvallend deze is; zeer effectieve aanvallen produceren vaak tekst die onnatuurlijk klinkt, waardoor ze gemakkelijker te ontdekken zijn, terwijl sluipende aanvallen moeilijker uit te voeren zijn. De onderzoekers merkten ook op dat naarmate AI-systemen evolueren om complexere taken uit te voeren, zoals het analyseren van grafieken van gegevens of het verwerken van afbeeldingen naast tekst, er nieuwe en onvoorspelbare kwetsbaarheden zullen ontstaan. De weg vooruit vereist een continue cyclus van testen en verbeteren, om ervoor te zorgen dat naarmate deze krachtige instrumenten meer geïntegreerd raken in ons leven, ze robuust blijven tegen hen die de ambitie hebben hen te misbruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →