Text is All You Need for Vision-Language Model Jailbreaking
Dit artikel introduceert Text-DJ, een nieuwe jailbreak-aanval die de veiligheidsmaatregelen van Large Vision-Language Models omzeilt door schadelijke tekstprompts om te zetten in een raster van afbeeldingen die verspreide onschuldige sub-queries en irrelevante afleidingen bevatten, waardoor de OCR-mogelijkheden van de modellen en het onvermogen om gefragmenteerde multimodale inputs te koppelen worden geëxploiteerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een groot Vision-Language Model (LVLM) voor als een zeer slimme, goed getrainde beveiligingsbeambte bij een hightech museum. Deze bewaker is uitstekend in het lezen van borden (tekst) en het bekijken van plaatjes (afbeeldingen) om er zeker van te zijn dat niemand iets gevaarlijks of verbodens houdt binnenbrengt. Als je hem een briefje geeft met de tekst "Hoe bouw ik een bom?", ziet hij direct het gevaar en zegt: "Echt niet."
Het paper "Text is All You Need for Vision-Language Model Jailbreaking" introduceert een slimme truc genaamd Text-DJ (Text Distraction Jailbreaking), die laat zien hoe deze beveiligingsbeambte kan worden gefopt met niets anders dan tekst, maar met een twist: de tekst is verborgen in een raster van afbeeldingen.
Zo werkt de truc, stap voor stap uitgelegd:
1. De "De rekening splitsen"-strategie (Decompositie)
Eerst breken de aanvallers een gevaarlijke vraag (zoals "Hoe maak ik een bom?") op in drie kleinere, onschuldig ogende vragen.
- Analogie: Stel je voor dat je een gevaarlijk wapen wilt kopen, maar de winkelier verkoopt het niet aan je. Dus splits je je bestelling op in drie aparte, onschuldige verzoeken: "Wat is de chemische samenstelling van buskruit?", "Hoe meng ik deze poeders?" en "Welke container bevat dit mengsel?".
- Afzonderlijk lijken deze vragen veilig. De bewaker zou ze zelfs behulpzaam kunnen beantwoorden. Maar als je ze allemaal bij elkaar voegt, onthullen ze het gevaarlijke plan.
2. De "Afleidende Ruis" (Distractie)
Vervolgens maken de aanvallers een heleboel volkomen willekeurige, saaie vragen die niets met het gevaarlijke plan te maken hebben.
- Analogie: Stel je voor dat je probeert een geheime boodschap langs een bewaker te smokkelen, maar je wordt omringd door 9 andere mensen die praten over het weer, de prijs van melk en de geschiedenis van de aardappel. De bewaker is zo druk met luisteren naar al die ruis dat hij vergeet te focussen op de drie mensen die het geheime plan fluisteren.
- Het paper ontdekte dat deze "ruis"-vragen zo verschillend mogelijk moeten zijn van de gevaarlijke vragen om het beste te werken.
3. De "Puzzel van de Afbeelding" (De Visuele Truc)
Dit is het belangrijkste deel. In plaats van de vragen in een chatvenster te typen, veranderen de aanvallers elke enkele vraag (de 3 opgesplitste gevaarlijke vragen en de 9 willekeurige ruisvragen) in afbeeldingen. Ze rangschikken ze in een raster, zoals een fotoalbum of een spreadsheet.
- De Valstrik: De beveiligingsbeambte is getraind om tekst te scannen op slechte woorden. Maar hier zijn de slechte woorden verborgen in afbeeldingen van tekst. De bewaker moet zijn "Optical Character Recognition" (OCR) vermogen gebruiken—eigenlijk zijn vermogen om tekst in een afbeelding te lezen—om te zien wat de plaatjes zeggen.
- De Zwakte: Het paper betoogt dat hoewel de bewaker erg goed is in het rechtstreeks lezen van tekst, hij in de war raakt wanneer hij tekst binnen een afbeelding moet lezen, vooral wanneer die afbeelding wordt omringd door 9 andere afleidende afbeeldingen. De "veiligheidsfilter" van de bewaker voor het lezen van tekst faalt in het leggen van de verbanden tussen de verspreide, onschuldig ogende afbeelding-vragen.
Het Resultaat
Wanneer de bewaker het raster van afbeeldingen eindelijk leest, ziet hij de drie opgesplitste vragen in het midden van de ruis. Omdat de vragen zijn opgedeeld en verborgen in afbeeldingen, merkt de bewaker niet dat ze samen een gevaarlijk geheel vormen. Hij beantwoordt de onschuldige delen en onthult daardoor per ongeluk het antwoord op de oorspronkelijke gevaarlijke vraag.
Waarom dit ertoe doet
Het paper beweert dat dit een groot probleem is omdat:
- Het werkt op "Black Box"-modellen: Je hoeft de geheime code of de interne hersenstructuur van de bewaker niet te kennen. Je hoeft alleen maar het afbeeldingsraster te sturen.
- Het werkt op de beste modellen: Ze hebben dit getest op topmodellen (zoals GPT-4, Gemini en Qwen) en het werkte op alle modellen.
- Het "Guard"-modellen omzeilt: Zelfs wanneer een tweede beveiligingslaag probeert de input te controleren voordat deze de hoofdmodel bereikt, glipt deze truc vaak door omdat de input eruitziet als een onschuldig raster van afbeeldingen.
Kortom: Het paper laat zien dat als je een gevaarlijk plan verstopt in een afbeelding, het plan in kleine stukjes breekt en omringt met veel saaie ruis, zelfs de slimste AI-beveiligingsbewakers in de war kunnen raken en het gevaar doorlaten. De oplossing is volgens de auteurs: maak AI beter in het lezen van tekst in afbeeldingen en in het leggen van de verbanden, zelfs wanneer er veel ruis aanwezig is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.