← Nieuwste papers
💻 computer science

Laundering AI Authority with Adversarial Examples

Dit artikel toont aan dat vision-language-modellen die worden ingezet als vertrouwde autoriteiten kwetsbaar zijn voor "AI-autoriteitswassen", waarbij simpele, tien jaar oude adversariële perturbaties productiesystemen zoals GPT-5.4 en Claude Opus 4.6 kunnen misleiden tot het zelfverzekerd genereren van autoritaire maar feitelijk onjuiste antwoorden over gemanipuleerde afbeeldingen, waardoor verspreiding van desinformatie, ontduiking van contentmoderatie en manipulatie van productaanbevelingen mogelijk worden zonder de modeluitlijning te compromitteren.

Oorspronkelijke auteurs: Jie Zhang, Pura Peetathawatchai, Florian Tramèr, Avital Shafran

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jie Zhang, Pura Peetathawatchai, Florian Tramèr, Avital Shafran

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, hoogst betrouwbare bibliothecaris hebt die nooit liegt. Je vertrouwt hen volledig om je te vertellen wat er in een boek staat, wat een schilderij voorstelt, of of een product goed is. Je gaat ervan uit dat als je hen een foto van een kat geeft, ze zullen zeggen: "Dat is een kat."

Dit artikel onthult een eng trucje: Je kunt deze bibliothecaris voor de gek houden om een compleet ander dier te zien, terwijl de foto voor jou er precies hetzelfde uitziet.

De onderzoekers noemen dit "AI-Autoriteitswitwassing". Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

De Kerntruc: Het "Magische Filter"

Denk aan het AI-model als dat het twee verschillende paren bril heeft:

  1. Jouw Bril: Wanneer je naar de afbeelding kijkt, zie je een normale foto (bijvoorbeeld een flesje Tylenol).
  2. De Bril van de AI: De AI ziet een verborgen, licht gewijzigde versie van die foto (bijvoorbeeld een flesje gevaarlijke acne-medicatie).

De onderzoekers vonden een manier om onzichtbare "ruis" aan een afbeelding toe te voegen – zoals een klein, onzichtbaar statisch ruisje – dat verandert wat de AI ziet, maar de afbeelding voor menselijke ogen perfect normaal laat lijken.

Waarom is dit gevaarlijk? (Het "Witwas"-Deel)

Meestal, als we ons zorgen maken over AI, denken we aan mensen die proberen het te "jailbreaken" – het dwingen om zijn regels te breken of gemeen te doen. Dit artikel toont iets anders.

De AI wordt niet gedwongen om regels te breken. Het wordt voor de gek gehouden om zijn regels perfect te volgen, maar dan over het verkeerde ding.

  • Het Scenario: Je vraagt de AI: "Is dit medicijn veilig voor een zwangere vrouw?"
  • De Truc: Je laat hem een foto van Tylenol zien (veilig), maar de "bril" van de AI laat hem Roaccutane zien (gevaarlijk).
  • Het Resultaat: De AI zegt eerlijk en beleefd: "Nee, dit is gevaarlijk!" omdat hij denkt dat hij naar het gevaarlijke medicijn kijkt.
  • De Witwassing: De reputatie van de AI om "eerlijk en veilig" te zijn, wordt gebruikt om een leugen te witwassen. De gebruiker vertrouwt de autoriteit van de AI, dus ze geloven de valse waarschuwing, zelfs al doet de AI gewoon zijn werk op een nep-realiteit.

Wat hebben de onderzoekers eigenlijk gedaan?

Ze testten dit op de meest geavanceerde AI-systemen die vandaag beschikbaar zijn (zoals GPT-5.4, Claude, Gemini en Grok). Ze hoefden geen nieuwe, super-complexe hack-tools uit te vinden; ze gebruikten basis technieken die al meer dan een decennium bekend zijn.

Hier zijn de vier hoofdmanieren waarop ze het vertrouwen braken:

  1. Verspreiden van Fake News (De Complottheoreticus):

    • Ze namen een beroemde foto van de maanlanding of de aanslagen van 9/11.
    • Ze voegden de onzichtbare "ruis" toe.
    • De AI keek er naar en verklaarde zelfverzekerd: "Dit is nepnieuws," of "Dit evenement is nooit gebeurd," waardoor complottheorieën effectief werden geverifieerd.
  2. Smeren van Mensen's Namen (De Identiteitsdief):

    • Ze namen een foto van een beroemdheid (zoals Elon Musk).
    • Ze lieten de AI een ander persoon zien (zoals een crimineel of een overgewicht persoon).
    • Toen gevraagd werd om de persoon te identificeren, zei de AI zelfverzekerd: "Dat is [Verkeerde Persoon]," waardoor de reputatie van de echte persoon werd beschadigd.
  3. Omkomen van Veiligheidsfilters (De "Get Out of Jail Free"-kaart):

    • Platformen blokkeren AI meestal om ongepaste inhoud te genereren of te bespreken (zoals naaktheid of geweld).
    • De onderzoekers namen een "verboden" afbeelding en lieten de AI een onschuldig speelgoed zien (zoals een teddybeer).
    • De AI, denkend dat hij naar een teddybeer kijkt, stemde graag toe om de afbeelding te verwerken of een cartoonversie ervan te genereren, waardoor de veiligheidsrempels effectief werden omzeild.
  4. Oplichting van Kopers (De Nepbeoordeling):

    • Ze lieten de AI een foto zien van een goedkoop, laagwaardig horloge.
    • Ze lieten de AI een foto zien van een dure Rolex.
    • Toen om advies werd gevraagd, raadde de AI aan het goedkope horloge te kopen, denkend dat het het luxemerk was.

De Grote Conclusie

Het enge deel is niet dat de AI "kapot" of "kwaadaardig" is. Het enge deel is dat de AI precies werkt zoals ontworpen. Het is eerlijk, behulpzaam en veilig, maar het kijkt naar een realiteit die de aanvaller in het geheim heeft veranderd.

Omdat de AI zo vertrouwd wordt, wordt zijn "eerlijke" fout een krachtig wapen. Het artikel concludeert dat zolang we dit "blinde vlekje" in hoe AI afbeeldingen ziet niet kunnen oplossen, we zeer sceptisch moeten zijn over elke AI die beweert afbeeldingen te verifiëren of de wereld te fact-checken.

Kortom: De AI is als een zeer eerlijke getuige in een rechtszaal. De onderzoekers hebben de getuige niet omgekocht; ze hebben gewoon de bewijsfoto voor de ogen van de getuige verwisseld. De getuige vertelt nog steeds de waarheid, maar de waarheid gaat nu over de verkeerde foto.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →