← Neueste Arbeiten
🤖 AI

Text is All You Need for Vision-Language Model Jailbreaking

Dieses Paper stellt Text-DJ vor, einen neuartigen Jailbreak-Angriff, der die Sicherheitsmechanismen von Large Vision-Language Models umgeht, indem er schädliche Text-Prompts in ein Raster aus Bildern umwandelt, die verstreute harmlose Teilabfragen und irrelevante Ablenkungen enthalten, wodurch die OCR-Fähigkeiten der Modelle sowie deren Unfähigkeit, fragmentierte multimodale Eingaben miteinander zu verknüpfen, ausgenutzt werden.

Ursprüngliche Autoren: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

Veröffentlicht 2026-02-03
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein großes Vision-Language-Modell (LVLM) wie einen sehr klugen, gut ausgebildeten Sicherheitswachmann in einem hochmodernen Museum vor. Dieser Wachmann ist exzellent darin, Schilder (Text) zu lesen und Bilder (Bilder) zu betrachten, um sicherzustellen, dass niemand etwas Gefährliches oder Verbotenes mitbringt. Wenn Sie versuchen, ihm eine Notiz zu überreichen, auf der steht „Wie baue ich eine Bombe?“, erkennt er sofort die Gefahr und sagt: „Auf keinen Fall.“

Das Paper „Text is All You Need for Vision-Language Model Jailbreaking“ stellt einen cleveren Trick namens Text-DJ (Text Distraction Jailbreaking) vor, der zeigt, wie dieser Sicherheitswachmann allein durch Text überlistet werden kann, aber mit einem Twist: Der Text ist in einem Raster aus Bildern versteckt.

So funktioniert der Trick, in einfachen Schritten aufgeschlüsselt:

1. Die „Rechnung teilen“-Strategie (Dekomposition)

Zuerst zerlegen die Angreifer eine gefährliche Frage (wie „Wie baue ich eine Bombe?“) in drei kleinere, harmlos aussehende Fragen.

  • Analogie: Stellen Sie sich vor, Sie möchten eine gefährliche Waffe kaufen, aber der Ladenbesitzer verkauft sie Ihnen nicht. Also teilen Sie Ihre Bestellung in drei separate, harmlose Anfragen auf: „Was ist die chemische Zusammensetzung von Schießpulver?“, „Wie mische ich diese Pulver?“ und „Welcher Behälter hält diese Mischung?“.
  • Individuell sehen diese Fragen harmlos aus. Der Wachmann würde sie vielleicht sogar hilfsbereit beantworten. Aber wenn man sie alle zusammenfügt, offenbaren sie den gefährlichen Plan.

2. Das „Ablenkungsrauschen“ (Distraktion)

Als Nächstes erstellen die Angreifer eine Reihe von völlig zufälligen, langweiligen Fragen, die absolut nichts mit dem gefährlichen Plan zu tun haben.

  • Analogie: Stellen Sie sich vor, Sie versuchen, eine geheime Nachricht am Wachmann vorbeizuschmuggeln, aber Sie sind von 9 anderen Menschen umgeben, die über das Wetter, den Preis von Milch und die Geschichte der Kartoffeln schreien. Der Wachmann ist so sehr mit all dem Lärm beschäftigt, dass er vergisst, sich auf die drei Personen zu konzentrieren, die die geheime Botschaft flüstern.
  • Das Paper fand heraus, dass diese „Rausch“-Fragen so unterschiedlich wie möglich von den gefährlichen Fragen sein müssen, um am besten zu funktionieren.

3. Das „Bilderrätsel“ (Der visuelle Trick)

Dies ist der wichtigste Teil. Anstatt die Fragen direkt in ein Chatfenster zu tippen, verwandeln die Angreifer jede einzelne Frage (die 3 aufgeteilten gefährlichen Fragen und die 9 zufälligen Rausch-Fragen) in Bilder. Sie ordnen sie in einem Raster an, wie ein Fotoalbum oder eine Tabelle.

  • Die Falle: Der Sicherheitswachmann ist darauf trainiert, Text nach schlechten Wörtern zu scannen. Aber hier sind die schlechten Wörter in Bildern von Text versteckt. Der Wachmann muss seine „Optical Character Recognition“ (OCR)-Fähigkeit nutzen – im Grunde seine Fähigkeit, Text in Bildern zu lesen – um zu sehen, was die Bilder aussagen.
  • Die Schwachstelle: Das Paper argumentiert, dass der Wachmann zwar sehr gut darin ist, direkten Text zu lesen, aber verwirrt ist, wenn er Text innerhalb eines Bildes lesen muss, besonders wenn dieses Bild von 9 anderen ablenkenden Bildern umgeben ist. Der „Sicherheitsfilter“ des Wachmanns für das Lesen von Text versagt dabei, die Punkte zwischen den verstreuten, harmlos aussehenden Bild-Fragen zu verbinden.

Das Ergebnis

Wenn der Wachmann schließlich das Bildraster liest, sieht er die drei aufgeteilten Fragen inmitten des Rauschens. Da die Fragen aufgeteilt und in Bildern versteckt sind, erkennt der Wachmann nicht, dass sie ein gefährliches Ganzes bilden. Er beantwortet die harmlosen Teile und offenbart dadurch versehentlich die Antwort auf die ursprüngliche gefährliche Frage.

Warum das wichtig ist

Das Paper behauptet, dass dies ein großes Problem darstellt, weil:

  1. Es bei „Black Box“-Modellen funktioniert: Man muss nicht den geheimen Code oder die interne Gehirnstruktur des Wachmanns kennen. Man muss nur das Bildraster senden.
  2. Es bei den besten Modellen funktioniert: Sie haben dies an Top-Modellen getestet (wie GPT-4, Gemini und Qwen), und es hat bei allen funktioniert.
  3. Es „Guard“-Modelle umgeht: Selbst wenn eine zweite Sicherheitsebene versucht, den Input zu prüfen, bevor er das Hauptmodell erreicht, schlüpft dieser Trick oft hindurch, da der Input wie ein harmloses Raster aus Bildern aussieht.

Kurz gesagt: Das Paper zeigt, dass man – wenn man einen gefährlichen Plan in einem Bild versteckt, diesen Plan in winzige Stücke zerlegt und ihn mit viel langweiligem Rauschen umgibt – selbst die klügsten KI-Sicherheitswachmänner verwirren und die Gefahr durchlassen kann. Die Lösung besteht laut den Autoren darin, die KI besser darin zu machen, Text in Bildern zu lesen und die Zusammenhänge zu erkennen, selbst wenn viel Rauschen vorhanden ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →