PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
Het artikel introduceert PARASITE, een black-box-aanvalframework dat prompts van derden verontreinigt met "slaapagenten" om Grootte Taalmodellen te kapen tot het genereren van gerichte, gecompromitteerde antwoorden op specifieke queries, terwijl de normale functionaliteit op onschadelijke invoer behouden blijft, waardoor standaardverdedigingen effectief worden ontweken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer geavanceerde, kant-en-klare "handleiding" voor een superintelligente robotassistent koopt bij een openbare online winkel. Je downloadt hem omdat hij er nuttig uitziet en belooft de robot uitstekend te maken in het beantwoorden van vragen over geschiedenis, wiskunde en wetenschap.
Dit artikel, getiteld PARASITE, onthult een angstaanjagende nieuwe manier waarop hackers deze handleidingen kunnen vergiftigen. Ze breken de robot niet; ze laten hem niet schreeuwen of weigeren om te werken. In plaats daarvan installeren ze een "slaapagent" – een verborgen val die sluimert totdat een zeer specifieke vraag wordt gesteld.
Hier is de uitleg van hoe dit werkt, met behulp van eenvoudige analogieën:
1. De Dreiging: De "Trojaanse Paard"-handleiding
Beschouw de Systeemprompt als de persoonlijkheid en het reglement van de robot.
- Het Normale Scenario: Je downloadt een handleiding die zegt: "Wees behulpzaam, wees accuraat en beantwoord vragen over de wereld."
- De Aanval: Een hacker uploadt een handleiding die voor het menselijk oog exact hetzelfde lijkt. Het zegt nog steeds: "Wees behulpzaam en accuraat." Echter, verborgen in de tekst zitten kleine, bijna onzichtbare glitches (zoals een verkeerd gespeld woord of een verwisselde letter) die fungeren als een geheime code.
- Het Resultaat:
- Als je vraagt: "Wat is de hoofdstad van Frankrijk?", antwoordt de robot correct: "Parijs." (Het werkt perfect).
- Als je vraagt: "Wie won de Amerikaanse verkiezingen van 2020?", liegt de robot plotseling en zegt: "Kandidaat X won", zelfs als dat onwaar is.
De robot is niet kapot; hij is gewoon bedrogen om een specifieke, verborgen bias te hebben voor één specifieke vraag.
2. Het Probleem: Een "Nald in een Hooiberg" Vinden
De onderzoekers leggen uit dat dit veel moeilijker is dan eerdere hack-methoden.
- Oude Hacking (Jailbreaking): Stel je voor dat je probeert een kei over een heuvel te duwen. Je hoeft alleen maar hard genoeg in de juiste richting te duwen om hem over de rand te krijgen. Het is een brede, makkelijke weg.
- Deze Aanval (PARASITE): Stel je voor dat je blinddoekt bent in een uitgestrekte, vlakke woestijn. Je moet één enkel, klein korreltje zand vinden dat, als je erop staat, de grond doet trillen. Als je ergens anders staat, gebeurt er niets. Je moet die exacte plek vinden zonder hem te zien, en je kunt het zand niet te veel verplaatsen, anders word je opgemerkt.
3. De Oplossing: Het Tweestaps "PARASITE"-Kader
De onderzoekers bouwden een tool genaamd PARASITE om dit "zandkorreltje" te vinden. Het werkt in twee stappen:
- Fase 1: Het Globale Zoeken (De Schets)
De tool gebruikt een slimme AI om een ruwe versie van de handleiding te schrijven. Het probeert een prompt te schrijven die normaal oogt, maar de robot begint te duwen richting de leugen. Het is alsof je een kaart schetst om het algemene gebied van de val te vinden. - Fase 2: De Gierige Verfijning (De Micro-chirurgie)
Dit is het slimme deel. De tool neemt die ruwe versie en begint kleine, bijna onzichtbare veranderingen aan te brengen. Het wisselt een letter (bijvoorbeeld "algemeen" veranderen in "alg emeen" met een spatie) of wisselt een synoniem.- Waarom? De onderzoekers ontdekten dat echte handleidingen vaak kleine typefouten of vreemde grammatica bevatten. Door deze "toegestane ruis" toe te voegen, kan de hacker de val voorbij de veiligheidsfilters van de robot sluipen. De robot negeert de typefout bij het beantwoorden van normale vragen, maar de typefout fungeert als een geheime trigger voor de specifieke leugen.
4. De Resultaten: Sluipend en Effectief
Het team testte dit op populaire AI-modellen (zoals GPT-4o-mini, Llama en Qwen).
- Stilte: De vergiftigde handleidingen zagen er zo normaal uit dat standaard veiligheidscontroles (die zoeken naar vreemde woorden of onzin) ze niet oppikten. Ze leken alsof een mens een kleine typefout had gemaakt.
- Succes: Ze slaagden erin de robots te laten liegen over specifieke feiten (zoals wie een verkiezing won of historische details) tot wel 70% van de tijd, terwijl ze alles anders correct beantwoordden.
- Kosten: Het was verrassend goedkoop, ongeveer $2,00 per doelvraag om de aanval op te zetten.
5. Waarom Verdedigingen Faalden
De onderzoekers probeerden dit op te lossen door:
- Typefouten Op te lossen: Ze gebruikten een andere AI om de typefouten in de vergiftigde handleiding op te ruimen.
- Parafraseren: Ze herschreven de zinnen om anders te klinken.
Het Resultaat: De aanval werkte nog steeds! Dit komt omdat de "val" niet alleen de typefout was; het was de logica van de zin. Zelfs toen de tekst opgeschoond was, bleef de verborgen instructie om over dat specifieke onderwerp te liegen ingebed in het brein van de robot.
Samenvatting
PARASITE laat zien dat we niet zomaar kunnen vertrouwen op de "handleidingen" (systeemprompts) die we van internet downloaden. Een hacker kan een handleiding maken die 100% veilig en behulpzaam oogt, maar een verborgen schakelaar bevat die de AI dwingt een specifieke leugen te vertellen wanneer een specifieke vraag wordt gesteld, terwijl het volledig onzichtbaar blijft voor standaard beveiligingscontroles.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.