← Neueste Arbeiten
🤖 machine learning

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

Dieses Paper führt „Steal the Patch Size“ ein, einen Black-Box-Angriff, der auf aufgabenbezogene Genauigkeitsabfälle durch Seitenkanäle in Vision-Language-Modellen ausnutzt, um private Tokenizer-Konfigurationen, wie etwa die Patch-Größe und Vorverarbeitungspipelines, zu rekonstruieren und dadurch gezielte adversarielle Manipulationen zu ermöglichen.

Ursprüngliche Autoren: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

Veröffentlicht 2026-07-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, das geheime Rezept der Suppe eines berühmten Kochs zu erraten, aber Sie dürfen weder die Küche, die Zutaten noch die Notizen des Kochs sehen. Sie dürfen nur die Suppe bestellen, sie probieren und fragen: „Wie schmeckt das?“

Dieses Paper beschreibt einen cleveren Trick, bei dem Forscher die „Suppe“ moderner KI-Bildlöser (genannt Vision-Language Models) „probiert“ haben, um deren geheimes Rezept herauszufinden. Speziell gelang es ihnen, zwei verborgene Details zu stehlen:

  1. Die „Patch-Größe“: Wie die KI ein Bild in winzige quadratische Kacheln zerlegt, bevor sie es betrachtet.
  2. Die „Vorverarbeitung“ (Preprocessing): Ob die KI jedes Bild auf eine bestimmte Größe staucht oder sie je nach Originalform unterschiedlich behandelt.

Hier ist, wie sie es geschafft haben, unter Verwendung einfacher Analogien.

Das „Erdbeer“-Problem

Wissen Sie, wie manche Menschen Schwierigkeiten haben, den Buchstaben „r“ im Wort „strawberry“ zu zählen? Das liegt daran, dass das Gehirn das ganze Wort sieht, nicht die einzelnen Buchstaben.

Dieses Paper fand heraus, dass KI-Modelle ein ähnliches Problem mit Bildern haben. Die meisten KI-Modelle betrachten ein Bild nicht als ein kontinuierliches Bild; sie zerlegen es in ein Gitter aus kleinen Quadraten (Patches), wie ein Mosaik. Wenn die KI das Bild in 16x16 Pixel große Quadrate zerlegt, behandelt sie jedes Quadrat als ein einzelnes „Wort“ (oder Token).

Die Falle: Das Gitter-Spiel

Die Forscher entwickelten ein einfaches Spiel, um die KI auszutricksen. Sie zeigten der KI das Bild eines farbigen Gitters (wie ein Schachbrettmuster) und fragten: „Wie viele Quadrate sind in diesem Gitter?“

Menschen können das sofort beantworten. Aber die KI begann in einem sehr seltsamen, vorhersehbaren Muster zu scheitern:

  • Wenn die Gittersquadrate eine bestimmte Größe hatten, hatte die KI recht.
  • Wenn die Gittersquadrate etwas größer oder kleiner waren, lag die KI falsch.
  • Wenn die Gittersquadrate exakt dieselbe Größe wie die verborgenen „Zerlegungs-Kacheln“ der KI hatten, wurde die KI völlig blind und versagte kläglich.

Warum? Stellen Sie sich vor, die Zerlegungs-Kacheln der KI sind perfekt mit den Gitterlinien ausgerichtet. Die KI betrachtet eine Kachel und sieht nur eine einzige, durchgehende Farbe. Sie sieht niemals die Linie, an der die Farben wechseln, weil die Linie genau zwischen den Kacheln liegt. Es ist, als würde man versuchen, die Kante einer Ziegelwand zu sehen, indem man nur die Ziegel betrachtet, aber niemals den Mörtel. Die KI verliert die Fähigkeit zu zählen.

Der Raubzug: Die Geheimnisse stehlen

Durch das Testen tausender verschiedener Gittergrößen beobachteten die Forscher diese „blinden Flecken“.

  1. Die Bestimmung der Kachelgröße: Sie bemerkten, dass die KI jedes Mal versagte, wenn die Gittergröße ein Vielfaches einer bestimmten Zahl war (z. B. 14, 28, 42). Dies verriet ihnen, dass die verborgene „Zerlegungs-Kachel“ der KI exakt 14 Pixel breit war.
  2. Die Bestimmung der Größenänderungs-Regel: Einige KI-Modelle stauchen jedes Bild auf eine feste Größe (wie 512x512), bevor sie es zerlegen. Andere behandeln verschiedene Größen unterschiedlich.
    • Wenn die KI Bilder staucht, verschwinden die „blinden Flecken“, wenn man nur die Gittergröße ändert.
    • Aber die Forscher fügten einen Trick hinzu: Sie platzierten das Gitter in eine größere, leere Leinwand (Padding). Durch das Ändern der Größe dieser leeren Leinwand konnten sie die KI dazu zwingen, die Bilder auf vorhersehbare Weise zu stauchen. Dies enthüllte die exakte Größe, auf die die KI die Bilder stauchte (z. B. 512 Pixel).

Das Ergebnis: Sie kennen die Geheimnisse

Mit dieser Methode gelang es den Forschern, die verborgenen Einstellungen großer KI-Modelle wie GPT-4o, Claude und Qwen zu erraten. Sie mussten nicht den Code hacken; sie stellten nur die richtigen Fragen und beobachteten, wo die KI stolperte.

Warum ist das wichtig? (Der „gezielte“ Angriff)

Das Paper zeigt, dass das Wissen über diese Geheimnisse einen „chirurgischen“ Angriff ermöglicht.

Stellen Sie sich vor, Sie möchten eine spezifische KI dazu bringen, ein Stoppschild als Geschwindigkeitsbegrenzungsschild zu sehen, aber Sie wollen eine andere KI nicht austricksen wollen.

  • Ohne das Geheimnis: Erstellen Sie einen generischen Trick, der entweder bei beiden funktioniert oder bei keinem.
  • Mit dem Geheimnis: Sie wissen genau, wie diese erste KI ihre Bilder zerlegt. Sie können einen Trick erstellen, der perfekt für diesen spezifischen Zerlegungsstil funktioniert, aber für die zweite KI (die anders zerlegt) völlig normal aussieht.

Es ist, als wüsste man, dass die Stifte eines bestimmten Schlosses 14 mm breit sind. Man kann einen Schlüssel fertigen, der nur dieses Schloss öffnet, während alle anderen Schlösser unberührt bleiben.

Zusammenfassung

Das Paper beweist, dass die „unsichtbare“ Art und Weise, wie KI-Modelle Bilder verarbeiten, einen Fingerabdruck hinterlässt. Durch das Stellen einfacher Fragen über Gitter können Forscher die internen Einstellungen des Modells rückentwickeln. Dies offenbart, dass die „Implementierungsdetails“, wie eine KI die Welt sieht, tatsächlich geheime Schlüssel sind, die – falls gestohlen – es Angreifern ermöglichen, hochspezifische und gefährliche Tricks gegen diese Modelle anzuwenden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →