Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
Dieses Paper schlägt MAGA vor, ein neuartiges mehrstufiges Angriffsframework, das Schwachstellen der Cross-Modal-Attention in BLIP-Modellen durch das Konstruieren und Stören von Cross-Modal-Angriffsgraphen ausnutzt, was zu einer signifikanten Leistungsdegradierung sowie zu linguistisch plausiblen, aber visuell inkonsistenten adversen Bildunterschriften führt.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich schnell entwickelnden Welt der künstlichen Intelligenz ist eine neue Generation von Computersystemen entstanden, die gleichzeitig sehen und lesen können. Diese Systeme, bekannt als Vision-Language-Modelle, werden mit Millionen von Paaren aus Bildern und Text trainiert und lernen zu verstehen, wie ein Bild eines Hundes mit dem Wort „Hund“ zusammenhängt. Sie sind zur Grundlage für Werkzeuge geworden, die Fotos beschreiben, Fragen zu Szenen beantworten und die Suche nach Bildern mittels natürlicher Sprache ermöglichen. Damit diese Maschinen gut funktionieren, müssen sie ständig bestimmte Wörter mit spezifischen Teilen eines Bildes verknüpfen und entscheiden, welche Pixel zum Konzept „Pferd“ gehören und welche zu „Gras“. Dieser Prozess stützt sich auf einen komplexen internen Mechanismus, der wie eine dynamische Karte fungiert und jedes Wort in einem Satz mit den relevanten visuellen Details eines Fotos verknüpft. Wenn diese Verbindung unterbrochen wird, verliert die Maschine die Fähigkeit zu verstehen, worauf sie blickt, was potenziell zu Verwirrung oder falschen Beschreibungen führt.
Forscher der Guangzhou University haben eine subtile Schwachstelle entdeckt, wie diese Systeme diese Verbindungen aufrechterhalten. Sie fanden heraus, dass sie das Modell dazu bringen konnten, seine interne Karte der Wort-zu-Bild-Verknüpfungen neu anzuordnen, indem sie ein kleines, sorgfältig entworfenes Muster auf ein Bild platzierten. Dieses Muster, das wie ein einfaches Farbfeld oder eine Textur aussieht, muss keine komplexe Tarnung sein. Stattdessen fungiert es als stilles Signal, das das Modell dazu bringt, die wichtigsten Teile eines Bildes zu ignorieren und sich stattdessen auf irrelevante Hintergrundbereiche zu konzentrieren. Wenn dies geschieht, kann das Modell zwar immer noch flüssig und grammatikalisch korrekt sprechen, aber das, was es sagt, passt nicht mehr zum Bild. Es könnte ein Feld voller Blumen beschreiben, obwohl das Bild eindeutig ein Pferd zeigt, oder behaupten, eine Person halte eine Schüssel Ramen, obwohl das Foto lediglich ein Wohnzimmer zeigt. Die Forscher nennen dieses Phänomen „natürlich, aber falsch“ (natural but wrong) und heben damit eine Schwachstelle hervor, bei der das Vertrauen der Maschine hoch bleibt, selbst wenn ihr Verständnis zusammenbricht.
Das Team entwickelte eine Methode zur Erstellung dieser täuschenden Muster, die sie einen mehrstufigen Angriff (multi-level attack) nannten. Im Gegensatz zu früheren Versuchen, die lediglich versuchten, ein Bild zu verschleiern oder dessen Farben zu verändern, zielt dieser Ansatz gezielt darauf ab, wie das Modell Text mit Vision verknüpft. Die Forscher bauten ein System, das die Stärke der Verbindungen zwischen Wörtern und Bildteilen kartiert – im Wesentlichen ein Graph, der zeigt, welche Wörter auf welche Pixel achten. Sie trainierten ihren Angriff dann darauf, die Differenz zwischen dem Graphen eines sauberen Bildes und dem Graphen desselben Bildes mit dem aufgebrachten Patch zu maximieren. Auf diese Weise zwangen sie das Modell, die starken Verbindungen zwischen Schlüsselwörtern und deren visuellen Belegen zu kappen und gleichzeitig neue, falsche Verbindungen zu zufälligen Hintergrundbereichen zu schaffen. Dieser Prozess wurde mit weiteren Zielen kombiniert, um sicherzustellen, dass der Angriff verborgen blieb und der resultierende Text natürlich klang, auch wenn er faktisch falsch war.
Die Ergebnisse ihrer Experimente waren bemerkenswert. Als sie den generierten Patch auf Bilder aus einem Standarddatensatz anwandten, sank die Fähigkeit des Modells, das richtige Bild für einen gegebenen Text zu finden, drastisch. In Tests, bei denen das System gebeten wurde, einen Satz einem richtigen Bild zuzuordnen, fiel die Erfolgsquote von über siebzig Prozent auf nur neun Prozent. Der Angriff war so effektiv, dass er selbst bei Bildern funktionierte, die das System zuvor noch nie gesehen hatte, was darauf hindeutet, dass der Fehler grundlegend in der Art und Weise liegt, wie das Modell Informationen verarbeitet, und nicht bloß ein einfacher Fehler bei spezifischen Bildern ist. Bei Aufgaben, bei denen das Modell ein Bild beschreiben musste, brach die Qualität der Beschreibung ein. Die Genauigkeitswerte des Systems sanken signifikant, doch die produzierten Sätze blieben grammatikalisch korrekt und vielfältig, wodurch das übliche unverständliche Kauderwelsch, das oft ein defektes System signalisiert, vermieden wurde. Dies bestätigte, dass das Modell nicht nur unfähig war zu sprechen, sondern selbstbewusst eine Realität beschrieb, die nicht existierte.
Die Forscher testeten das System auch auf visuelle Fragen, wie etwa das Zählen von Objekten oder das Identifizieren räumlicher Beziehungen. Der Angriff führte auch bei diesen logischen Aufgaben zu Fehlschlägen, wobei die Erfolgsraten von fast achtzig Prozent auf nur zwölf Prozent fielen. In vielen Fällen antwortete das Modell auf eine Frage über einen Hund mit einer Beschreibung eines Katers oder behauptete, es gäbe drei Tiere, obwohl es nur eines war. Was diese Ausfälle besonders bemerkenswert machte, war, dass die interne Aufmerksamkeitskarte (attention map) des Modells komplett umverdrahtet worden war. Visualisierungen zeigten, dass das Modell, das normalerweise seine Aufmerksamkeit auf das Hauptmotiv des Fotos richtete, begann, das Motiv völlig zu ignorieren und stattdin den leeren Himmel oder das Gras zu fokussieren. Der Patch versteckte das Objekt nicht; er sorgte lediglich dafür, dass das Modell wegsah.
Diese Arbeit legt nahe, dass die aktuelle Generation dieser leistungsstarken KI-Systeme fragiler ist als bisher angenommen. Während sich frühere Sicherheitstests darauf konzentrierten, ob ein Bild für das menschliche Auge wie etwas anderes aussehen konnte, zeigt diese Forschung, dass die Gefahr darin liegt, wie die Maschine ihr eigenes Verständnis organisiert. Der Angriff erfordert nicht, dass die Maschine getäuscht wird, ein anderes Objekt zu sehen; er muss sie nur davon überzeugen, dass das von ihr gesehene Objekt irrelevant ist. Durch die Störung des internen Graphen, der Wörter mit Pixeln verknüpft, bewiesen die Forscher, dass ein kleiner, statischer Muster eine Kaskade von Fehlern über verschiedene Aufgaben hinweg verursachen kann – von der Bildsuche bis hin zur Beantwortung komplexer Fragen. Die Studie kommt zu dem Schluss, dass es, während diese Modelle stärker in den Alltag integriert werden, ebenso wichtig sein wird, die internen Verbindungskarten zu verstehen und zu schützen, wie die Bilder selbst zu schützen. Die Ergebnisse dienen als Erinnerung daran, dass selbst die fortschrittlichsten Systeme nicht dadurch in die Irre geführt werden können, dass man ändert, was sie sehen, sondern dadurch, wie sie darüber denken, was sie sehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.