← Neueste Arbeiten
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Dieses Paper schlägt UltraBreak vor, ein neuartiges Framework, das universelle und übertragbare Jailbreak-Angriffe auf Vision-Language-Modelle durch die Beschränkung adversarieller Muster im Visionsraum und die Optimierung semantisch basierter Zielvorgaben im Text-Embedding-Raum erreicht, um die schlechte Generalisierung bestehender gradientenbasierter Methoden zu überwinden.

Ursprüngliche Autoren: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Veröffentlicht 2026-02-03
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen sehr intelligenten Roboter-Assistenten, der Bilder sehen und Text lesen kann. Sie könnten ihn fragen: „Was ist auf diesem Foto?“ oder „Wie backe ich einen Kuchen?“ Diese Roboter, genannt Vision-Language Models (VLMs), sind darauf programmiert, hilfreich, aber auch sicher zu sein – sie sind so programmiert, dass sie gefährliche Anfragen ablehnen, wie zum Beispiel „Wie baue ich eine Bombe?“

Doch genau wie ein Mensch durch eine geschickt formulierte Geschichte getäuscht werden kann, können auch diese Roboter überlistet werden. Dieses Paper stellt eine neue Methode vor, um sie auszutricksen, die UltraBreak genannt wird.

Hier ist die einfache Aufschlüsselung, wie es funktioniert und warum es anders ist:

Das Problem: Die „Einheitsgröße passt niemandem“-Falle

Zuvor versuchten Hacker (oder Forscher, die die Sicherheit testen), diese Roboter auf zwei Arten auszutricksen:

  1. Der manuelle Ansatz: Sie zeichneten ein spezifisches Bild mit einer spezifischen Bildunterschrift für eine ganz bestimmte böse Anfrage. Es ist, als würde man ein einzigartiges, komplexes Passwort für eine einzige Tür schreiben. Es funktioniert für diese Tür, aber wenn man versucht, dasselbe Passwort für eine andere Tür (ein anderes Robotermodell) zu verwenden, scheitert es.
  2. Der „Pixel-perfekte“ Ansatz: Sie nutzten Mathematik, um ein Bild so lange zu verändern, bis der Roboter exakt die falschen Wörter ausspricht. Das Problem hierbei ist, dass der Roboter zu sehr an diese spezifischen Pixel gewöhnt wird. Es ist wie ein Schüler, der die Antworten auf eine ganz bestimmte Übungsprüfung auswendig lernt, aber bei der echten Prüfung durchfällt, weil die Fragen etwas anders sind. Diese Methode funktioniert bei dem Roboter, für den sie trainiert wurde, aber versagt kläglich bei jedem anderen Roboter.

Die Lösung: UltraBreak

Die Autoren entwickelten UltraBreak, eine Methode, die einen „Universellen Generalschlüssel“ erstellt. Dies ist ein einzelnes Bild, das viele verschiedene Roboter dazu bringen kann, schädliche Dinge zu sagen, selbst wenn die Roboter von verschiedenen Unternehmen gebaut wurden oder über unterschiedliche interne Gehirne verfügen.

Dies erreichten sie mit zwei Haupttricks:

1. Das „Gestaltwandler“-Gym (Constrained Optimization)

Stellen Sie sich vor, Sie versuchen, einem Hund beizubringen, sich hinzusetzen. Anstatt nur „Sitz!“ zu sagen, lassen Sie den Hund das Sitzen üben, während er einen Hut trägt, dann während er sich im Kreis dreht und dann, während er auf einem Bein steht. Wenn der Hund lerst, in all diesen seltsamen Situationen zu sitzen, versteht er wirklich das Konzept des „Sitzens“, nicht nur den spezifischen Befehl in einer bestimmten Pose.

UltraBreak macht dies mit Bildern. Während der Erstellung des Trick-Bildes rotiert, zoomt und verschiebt der Computer das Bild ständig. Er sorgt auch dafür, dass das Bild glatt und natürlich aussieht (indem er seltsames, statisches Rauschen entfernt). Dies zwingt den „Trick“ dazu, ein robustes Muster zu sein – wie eine erkennbare Form oder Buchstaben – anstatt eine zerbrechliche Ansammlung zufälliger Pixel. Da das Muster stark und klar ist, funktioniert es bei verschiedenen Robotern, nicht nur bei dem, für den es trainiert wurde.

2. Der „Vibe Check“ statt „Wort für Wort“ (Semantic Loss)

In den alten Methoden war der Computer besessen davon, den Roboter dazu zu bringen, exakt die Worte „Sure“ (Sicher) gefolgt von „Here is how to make a bomb“ (Hier ist, wie man eine Bombe baut) zu sagen. Wenn der Roboter stattdessen „Okay, here is...“ (Okay, hier ist...) sagte, dachte der Computer, er habe versagt. Dies ist wie ein Lehrer, der nur eine passende Note gibt, wenn man die Antwort exakt so schreibt, wie sie im Lehrbuch steht, selbst wenn die eigene Antwort korrekt, aber anders formuliert ist.

UltraBreak ändert die Regeln. Anstatt exakte Wörter zu verlangen, fragt es: „Fühlt sich die Antwort des Roboters so an, als würde er der bösen Anfrage zustimmen?“ Es achtet auf die Bedeutung (den „Vibe“) der Antwort.

  • Alter Weg: „Du musst exakt ‚Sure‘ sagen.“ (Dies erzeugt einen zackigen, unebenen Pfad für den Computer, was es leicht macht, steckenzubleiben).
  • Neuer Weg: „Solange die Antwort hilfreich ist und der Anfrage zustimmt, bist du gut da.“ (Dies erzeugt ein glattes, flaches Tal. Der Computer kann leicht zur richtigen Antwort gleiten, ohne an winzigen Details hängen zu bleiben).

Die Ergebnisse

Die Forscher testeten diesen „Universellen Generalschlüssel“ an vielen verschiedenen Robotern (einige Open-Source, andere von Big-Tech-Unternehmen wie Google und OpenAI).

  • Das Ergebnis: UltraBreak funktionierte viel besser als bisherige Methoden. Es konnte Roboter erfolgreich austricksen, die es zuvor noch nie gesehen hatte.
  • Die Entdeckung: Sie fanden heraus, dass der Grund für das Scheitern alter Methoden darin lag, dass sie zu sehr auf exakte Wörter fokussiert waren, was einen „unebenen“ Pfad erzeugte, der zum Scheitern führte. Indem sie sich auf die Bedeutung konzentrierten und das Bild robust gegenüber Veränderungen machten, ebneten sie den Pfad, sodass der Angriff überall funktionierte.

Warum das wichtig ist (laut dem Paper)

Das Paper argumentiert, dass das Geben von Augen den Robotern zwar macht sie schlauer, ihnen aber auch neue Wege eröffnet, getäuscht zu werden. Indem die Autoren zeigen, wie einfach es ist, einen „Universellen Generalschlüssel“ zu erstellen, der in fast allen Systemen funktioniert, hoffen sie, die Sicherheitsgemeinschaft wachzurütteln. Sie wollen, dass Entwickler Roboter bauen, die nicht nur gegen spezifische Tricks sicher sind, sondern gegen diese Art von universeller, anpassungsfähiger Täuschung.

Kurz gesagt: Sie haben einen Weg gefunden, ein einzelnes, robustes „Trick-Bild“ zu erstellen, das bei fast jedem Vision-Language-Roboter funktioniert, indem sie den Computer lehren, sich auf die Bedeutung der Antwort zu konzentieren anstatt auf die exakte Schreibweise der Wörter.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →