← Nieuwste papers
💻 computer science

DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models

Het artikel introduceert DarkLLM, een nieuw raamwerk dat gebruikmaakt van een Large Language Model met 1 miljard parameters om instructies in natuurlijke taal te vertalen naar veelzijdige, hoog-effectieve adversariële perturbaties, waardoor aanvallen op diverse visuele en multimodale fundamentele modellen worden verenigd en geschaald.

Oorspronkelijke auteurs: Ye Sun, Xin Wang, Jiaming Zhang, Yifeng Gao, Yixu Wang, Yifan Ding, Qixian Zhang, Henghui Ding, Xingjun Ma, Yu-Gang Jiang

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ye Sun, Xin Wang, Jiaming Zhang, Yifeng Gao, Yixu Wang, Yifan Ding, Qixian Zhang, Henghui Ding, Xingjun Ma, Yu-Gang Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een super slimme robot voor die de wereld kan "zien". Het kan objecten identificeren, scènes beschrijven en zelfs omtrekken rondom dingen in een foto tekenen. Dit is wat moderne AI-modellen (zoals CLIP, SAM of ChatGPT) doen.

Jarenlang hebben beveiligingsonderzoekers geprobeerd deze robots te misleiden door tiny, onzichtbare vlekjes "ruis" aan afbeeldingen toe te voegen—zoals stof op een camera-lens—die zo klein zijn dat mensen ze niet kunnen zien, maar die de robot volledig in de war brengen.

Het probleem met oude trucs
Vroeger was het maken van deze "stofvlekjes" alsof je een andere hoofdsleutel had voor elk afzonderlijk slot. Als je een robot wilde misleiden die auto's identificeert, had je een specifieke sleutel nodig. Als je een robot wilde misleiden die omtrekken tekent, had je een totaal andere sleutel nodig. Als je een robot wilde misleiden die Engels spreekt, had je weer een andere nodig. Het was traag, stijf en kon niet makkelijk aanpassen aan nieuwe soorten robots.

De nieuwe oplossing: DarkLLM
Dit artikel introduceert DarkLLM, een nieuwe manier om deze AI-modellen aan te vallen. In plaats van complexe wiskundige formules te gebruiken om de "stofvlekjes" te berekenen, leerden de onderzoekers een Groot Taalmodel (een AI die menselijke taal begrijpt) om de "hoofdsleutelmaker" te zijn.

Zo werkt het, met een eenvoudige analogie:

1. De "Magische Vertaler" (De LLM-controller)

Stel je een hoogst bekwame vertaler voor die "Mens" en "Robot Sabotage" spreekt.

  • Oude manier: Je moest voor elke specifieke robot die je wilde misleiden een complexe wiskundige vergelijking schrijven.
  • DarkLLM-methode: Je spreekt gewoon met de vertaler in gewoon Engels.
    • Jij zegt: "Laat deze robot denken dat de foto van een kat eigenlijk een hond is."
    • Of: "Laat deze robot niets zien in deze foto."
    • Of: "Laat deze robot de omtrek van de kat niet tekenen, EN laat het tegelijkertijd denken dat de kat een hond is."

De vertaler (de LLM) begrijpt je intentie en zet je woorden direct om in een geheim "blauwdruk" voor de aanval.

2. De "Onzichtbare Schilder" (De Perturbatie-generator)

Zodra de vertaler het blauwdruk heeft gemaakt, fungeert een tweede deel van het systeem als een onzichtbare schilder. Het neemt dat blauwdruk en schildert de tiny, onzichtbare "stofvlekjes" op de afbeelding.

  • Omdat de vertaler je specifieke instructie begreep (bijvoorbeeld "laat het falen bij segmentatie"), weet de schilder precies welk soort stof toe te passen om dat specifieke resultaat te bereiken.

3. De "Universele Afstandsbediening"

Het krachtigste deel van DarkLLM is dat het werkt als een universele afstandsbediening.

  • Eén instructie, vele doelen: Je kunt dezelfde instructie geven om een robot die afbeeldingen identificeert, een robot die omtrekken tekent, of zelfs een robot die met je praat, te misleiden.
  • Kruis-model magie: Het artikel laat zien dat een enkele "stofvlek" die door DarkLLM is gemaakt, een robot die is getraind om auto's te herkennen, een robot die is getraind om omtrekken te tekenen, en een robot die is getraind om te chatten, allemaal tegelijkertijd kan misleiden. Het vond een "zwakke plek" die in allemaal voorkomt.

Wat hebben ze bewezen?

De onderzoekers testten dit systeem op 13 verschillende datasets en 15 verschillende AI-modellen (inclusief bekende namen zoals CLIP, SAM en commerciële chatbots zoals GPT-4o en Gemini).

  • Het werkt: Ze lieten zien dat door simpelweg een zin te typen zoals "Laat de robot deze afbeelding niet herkennen", het systeem succesvol een afbeelding creëerde die de robot in de war bracht.
  • Het is flexibel: Ze konden om specifieke trucs vragen (zoals "doen alsof dit een hond is") of algemene trucs (zoals "breek de robot"), en het systeem hanteerde beide.
  • Het is eng (op een goede manier voor beveiliging): Het feit dat één eenvoudige taal-instructie zoveel verschillende soorten geavanceerde AI kon breken, suggereert dat deze krachtige modellen een gemeenschappelijke kwetsbaarheid delen.

De conclusie

DarkLLM is een tool die natuurlijke taal omzet in een wapen tegen AI-visie. In plaats van een PhD in wiskunde nodig te hebben om een AI te hacken, hoef je alleen maar te weten hoe je een vraag stelt. Het artikel laat zien dat als je kunt beschrijven wat je wilt dat er met een AI gebeurt in het Engels, je het waarschijnlijk precies dat kunt laten doen, zelfs als het een volledig andere AI is dan degene waarop je de tool hebt getraind.

De auteurs benadrukken dat dit een veiligheidstool is. Net zoals je moet weten hoe je een slot breekt om een betere te bouwen, helpt dit onderzoek ontwikkelaars te begrijpen hoe makkelijk deze krachtige AI-systemen kunnen worden misleid, zodat ze sterkere verdedigingen kunnen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →