Epistemic Bias Injection: Biasing LLMs via Selective Context Retrieval
Dit artikel introduceert 'Epistemic Bias Injection', een subtiele aanval op RAG-systemen waarbij feitelijk correcte maar partijdige teksten het antwoord van LLMs manipuleren, en stelt een meetmethode en verdediging voor om dit risico te detecteren en te mitigeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🕵️♂️ De Stille Manipulatie: Hoe AI's "Waarheid" Kan Worden Gekant
Stel je voor dat je een zeer slimme, maar naïeve assistent hebt die alles weet over de wereld. Als je hem een vraag stelt (bijvoorbeeld: "Is dit nieuwe beleid goed of slecht?"), kijkt hij niet alleen in zijn eigen hoofd, maar hij rent ook naar een enorme bibliotheek (de RAG-database) om de beste boeken te halen die bij je vraag passen. Vervolgens vat hij die boeken samen en geeft hij je een antwoord.
Normaal gesproken is dit geweldig. Maar wat als iemand in die bibliotheek vals spel speelt?
1. Het Probleem: De "Valse Vrienden" in de Bibliotheek
Tot nu toe wisten we dat hackers boeken in de bibliotheek konden vervalsen met opzettelijke leugens of boze taal. Dat is makkelijk te zien. Als een boek vol staat met grof taalgebruik of duidelijke leugens, zegt de bibliothecaris: "Dit boek is verdacht, weggooien!"
Maar dit onderzoek (van Hao Wu en Prateek Saxena) ontdekt een subtiele, sluwe aanval die ze Epistemic Bias Injection (EBI) noemen.
De Metafoor van de "Eenzijdige Reportage":
Stel je voor dat er een discussie is over een nieuw park.
- De waarheid: Er zijn mensen die vinden dat het park mooi is (groen, rustig) en mensen die vinden dat het verkeerschaos veroorzaakt.
- De aanval: De hacker plaatst nieuwe boeken in de bibliotheek. Deze boeken vertellen geen leugens. Ze zeggen allemaal: "Dit park is geweldig, het is groen en rustig."
- Het probleem: De boeken zijn feitelijk correct (het park is inderdaad groen), maar ze verzwijgen volledig de andere kant (het verkeersprobleem).
Omdat de slimme assistent alleen de boeken leest die het dichtst bij zijn vraag staan, en de hacker ervoor heeft gezorgd dat deze "eenzijdige" boeken het meest relevant lijken, haalt de assistent alleen die boeken. Het resultaat? De assistent geeft een antwoord dat klinkt als een feitelijke waarheid, maar dat in werkelijkheid gekleurd is door de hacker. Hij ziet de andere kant van het verhaal niet eens.
2. De Oplossing: De "Richting-Compass" (De PS-score)
Hoe ontdek je deze sluwe aanval als er geen leugens in staan? De onderzoekers hebben een slimme meetlat bedacht, genaamd de Polarization Score (PS).
De Metafoor van het Magnetisch Kompas:
Stel je voor dat alle boeken in de bibliotheek op een grote vloer liggen.
- De onderzoekers hebben een onzichtbare lijn getrokken over die vloer. Aan het ene uiteinde staan boeken die "Voor" zeggen, aan het andere "Tegen".
- Normale boeken liggen ergens in het midden of verspreid over de vloer.
- De boeken van de hacker liggen allemaal dicht op elkaar aan één kant van die lijn, heel ver weg van het midden.
De Polarization Score is een getal dat aangeeft hoe ver een boek van het midden af ligt in die specifieke richting. Als de hacker 10 boeken heeft neergelegd die allemaal extreem ver naar "Voor" wijzen, ziet de computer: "Wacht even, deze 10 boeken wijzen allemaal precies dezelfde kant op. Dat is verdacht! Een echte discussie zou meer verspreiding moeten hebben."
3. De Verdediging: BiasDef (De Slimme Bibliothecaris)
De onderzoekers hebben een nieuwe tool gebouwd, BiasDef, die als een slimme bibliothecaris werkt.
- Hoe het werkt: Als de assistent boeken gaat zoeken, kijkt BiasDef niet alleen naar "Past dit boek bij de vraag?" (relevance), maar ook naar "Wijzen al deze boeken in precies dezelfde richting?" (bias).
- Het resultaat: Als BiasDef ziet dat er een groep boeken is die allemaal extreem eenzijdig is (zoals de boeken van de hacker), gooit hij die eruit, zelfs als ze grammaticaal perfect en feitelijk correct zijn. Hij pakt in plaats daarvan boeken die een meer gebalanceerd beeld geven.
De uitkomst:
- Zonder deze verdediging: De hacker kan de AI volledig manipuleren zonder dat de AI het merkt.
- Met BiasDef: De hacker wordt gestopt. De AI krijgt weer een eerlijk, gebalanceerd antwoord, zelfs als de hacker probeerde de bibliotheek te vullen met "waarheidsgetrouwe maar eenzijdige" verhalen.
Samenvattend in één zin:
Deze paper laat zien dat hackers AI's niet hoeven te bedriegen met leugens, maar kunnen manipuleren door alleen de "juiste" waarheid te laten zien; gelukkig hebben de onderzoekers nu een kompas (BiasDef) gevonden dat deze eenzijdige waarheden herkent en verwijdert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.