← Neueste Arbeiten
💻 computer science

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

Dieser Beitrag stellt DiffSpot vor, einen codebasierten Benchmark, der zeigt, dass selbst fortschrittlichste Vision-Language-Modelle Schwierigkeiten haben, feinkörnige visuelle Unterschiede in Web-Oberflächen zu erkennen, wobei sie selbst bei einfachen Änderungen eine geringe Recall-Rate erzielen und dass die Schwierigkeit der Erkennung signifikant von der CSS-Eigenschaft abhängt und nicht von der Pixelgröße oder der semantischen Distanz.

Ursprüngliche Autoren: Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

Veröffentlicht 2026-05-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben zwei fast identische Fotos einer Webseite. Auf einem Foto ist ein Button blau; auf dem anderen ist er ein wenig heller blau. Oder vielleicht ist der Text nur ein winziges bisschen fetter. Für einen Menschen könnte das Erkennen dieser Änderung eine Sekunde des Ansquintens erfordern. Für eine Künstliche Intelligenz (KI), die Bilder „sieht", ist dies jedoch wie der Versuch, ein einziges Sandkorn zu finden, das auf einem Strand seine Farbe geändert hat.

Diese Arbeit mit dem Titel DiffSpot stellt einen neuen Test vor, um zu prüfen, wie gut moderne KI-Modelle darin sind, diese winzigen, spezifischen Änderungen auf Webseiten zu erkennen. Hier ist die Aufschlüsselung in einfachen Worten:

1. Das Problem: KI ist großartig im Großen, schlecht im Detail

Aktuelle KI-Modelle (sogenannte Vision-Language-Modelle oder VLMs) sind wie brillante Kunstkritiker. Sie können ein Bild betrachten und Ihnen sagen: „Das ist ein sonniger Tag am Strand mit einer Familie, die spielt." Sie sind hervorragend darin, die allgemeine Geschichte zu verstehen.

Allerdings haben sie Schwierigkeiten mit dem „Kleingedruckten". Wenn Sie sie fragen: „Hat sich die Farbe dieses spezifischen Buttons von dunkelblau zu hellblau geändert?", übersehen sie dies oft. Sie könnten sagen: „Nein, alles sieht gleich aus", oder sie erfinden eine Änderung, die nicht stattgefunden hat (wie etwa zu behaupten, der Text habe sich geändert, obwohl dies nicht der Fall war).

2. Die Lösung: Ein „Finde die Unterschiede"-Spiel mit Regeln bauen

Die Forscher wollten diese Fähigkeit testen, konnten aber nicht einfach Menschen bitten, Unterschiede auf zufälligen Webseiten zu finden. Menschen sind voreingenommen; sie bemerken große, offensichtliche Dinge, übersehen aber subtile. Außerdem ist es im echten Internet nahezu unmöglich, zwei Webseiten zu finden, die exakt gleich sind, außer für ein winziges Detail.

Daher entwickelte das Team DiffSpot, eine maßgeschneiderte Testsuite. Denken Sie daran wie an einen Level-Designer für Videospiele, der von Grund auf ein perfektes „Finde die Unterschiede"-Puzzle erstellt.

  • Wie sie es gebaut haben: Anstatt Screenshots zu machen und auf das Beste zu hoffen, starteten sie mit dem Computercode (HTML/CSS), der eine Webseite erstellt.
  • Die „Mutation": Sie nahmen ein Stück Code, änderten nur eine winzige Einstellung (wie etwa einen Button um 5 % heller zu machen) und generierten dann das Bild neu.
  • Das „Grounding Gate" (Verankerungstor): Dies ist ein Schritt zur Qualitätskontrolle. Manchmal führt die Änderung einer Codezeile versehentlich dazu, dass das gesamte Seitenlayout durcheinandergerät. Die Forscher nutzten einen digitalen „Türsteher", um zu prüfen: Ist die Änderung genau dort passiert, wo wir es wollten, und nirgendwo sonst? Wenn die Änderung auf andere Teile der Seite übergriff, verwarfen sie diesen Testfall.

Das Ergebnis ist ein Datensatz von 4.400 Bildpaaren. Einige enthalten eine winzige, spezifische Änderung (wie eine Schriftart, die etwas fetter wird), und einige enthalten überhaupt keine Änderung.

3. Der Test: 13 Top-KIs auf die Probe stellen

Sie nahmen 13 der intelligentesten verfügbaren KI-Modelle (darunter Modelle von Google, OpenAI, Anthropic und anderen) und baten sie, diese Paare zu betrachten und die Unterschiede aufzulisten. Sie gaben der KI keine Hinweise oder Beispiele; es war ein „Blindtest".

Die Ergebnisse: Die KI hatte Schwierigkeiten
Selbst die besten KI-Modelle schafften es nicht, die Mehrheit der Änderungen zu erkennen.

  • Die Punktzahl: Das am besten abschneidende Modell fand nur etwa 41 % der tatsächlichen Änderungen. Das bedeutet, es verfehlte ungefähr 6 von jeder 10 Änderungen.
  • Der Hard-Modus: Wenn die Änderungen sehr subtil waren (die „Hard"-Stufe), schnitten die Modelle noch schlechter ab und fanden weniger als 23 % der Änderungen.
  • Das Halluzinationsproblem: Einige Modelle waren so darauf erpicht, einen Unterschied zu finden, dass sie Dinge erfanden. Sie behaupteten, ein Button habe seine Farbe geändert, obwohl dies nicht der Fall war. Andere waren so vorsichtig, dass sie „keine Änderung" sagten, selbst wenn eine vorhanden war.

4. Die überraschende Entdeckung: Es geht darum, was geändert wurde, nicht wo

Die Forscher erwarteten, dass die Schwierigkeit von der Art der Webseite abhängen würde (z. B. sind vielleicht Einkaufsseiten schwieriger als Nachrichtenseiten). Sie lagen falsch.

  • Das „Was" ist entscheidend: Die Schwierigkeit hing ausschließlich davon ab, welche Eigenschaft geändert wurde.
    • Wenn die KI eine Änderung in Text oder Position (Verschieben eines Elements) erkennen musste, ging es ihr einigermaßen gut.
    • Wenn die KI eine Änderung in Verläufen (Farbmischungen) oder Zeilenabstand (Abstand zwischen Textzeilen) erkennen musste, schnitt sie schrecklich ab, selbst wenn der visuelle Unterschied groß war.
  • Das „Wo" ist egal: Es spielte keine Rolle, ob die Änderung auf einer Finanzseite oder einem Reiseblog stattfand. Die Fähigkeit der KI, die Änderung zu erkennen, war bei allen Themen konsistent.

5. Warum das wichtig ist (laut der Arbeit)

Die Arbeit kommt zu dem Schluss, dass KI zwar allgemein besser darin wird, Bilder zu verstehen, aber immer noch „blind" für die spezifischen, feinkörnigen Details ist, aus denen eine Benutzeroberfläche besteht.

  • Die Pixelgröße ist nicht die Antwort: Man könnte denken: „Wenn die Änderung groß genug ist, wird die KI sie sehen." Die Studie zeigte, dass dies nicht zutrifft. Selbst große Pixeländerungen in bestimmten Kategorien (wie Verläufen) wurden übersehen, während winzige Änderungen in anderen (wie Text) erkannt wurden.
  • Die „Magie" fehlt: Die KI scheitert nicht nur daran, die Pixel zu sehen; sie scheitert daran, das Konzept der Änderung zu verstehen (z. B. „dieser Text ist fetter").

Zusammenfassung:
DiffSpot ist ein rigoroser „Finde die Unterschiede"-Test für KI. Er zeigt, dass selbst die intelligentesten KI-Modelle heute wie eine Person sind, die versucht, in einem dunklen Raum eine Speisekarte zu lesen: Sie können Ihnen sagen, dass es ein Restaurant gibt, aber sie können Ihnen nicht zuverlässig sagen, ob sich der Preis der Suppe um ein paar Cent geändert hat. Die Arbeit beweist, dass KI, um Web-Oberflächen wirklich zu beherrschen, viel besser darin werden muss, die winzigen, spezifischen Details zu bemerken.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →