← Neueste Arbeiten
💻 computer science

Investigating Relational Reasoning in VLMs

Diese Arbeit untersucht unter Verwendung eines synthetischen geometrischen Datensatzes und des Modells Qwen3-VL-4B, ob Vision-Language-Modelle visuelle Relationen tatsächlich verstehen oder sich auf sprachliche Abkürzungen verlassen, wobei sie aufzeigt, dass aktuelle VLMs echte visuelle Argumentation mit Strategien kombinieren, die primär in sprachlichen Hinweisen verwurzelt sind.

Ursprüngliche Autoren: Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

Veröffentlicht 2026-08-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Landschaft der künstlichen Intelligenz hat eine neue Generation von Computern gelernt, gleichzeitig zu sehen und zu sprechen. Diese Systeme, bekannt als Vision-Language-Modelle, können ein Foto betrachten und dessen Inhalt beschreiben, Fragen zu dem beantworten, was sie sehen, oder sogar Rätsel lösen, die auf einem Bild basieren. Für den menschlichen Beobachter wirken sie so, als besäßen sie ein echtes Verständnis der visuellen Welt, ähnlich wie ein Mensch, der einen Blick auf eine Szene wirft und sofort erfasst, wie die Objekte zueinander in Beziehung stehen. Eine grundlegende Frage bleibt jedoch unbeantwortet: Verstehen diese Maschinen wirklich die räumlichen Beziehungen und Verbindungen zwischen Objekten, oder sind sie lediglich geschickte Mustervergleicher, die sich auf linguistische Tricks und statistische Vermutungen verlassen? Diese Ungewissheit ist wichtig, denn wenn diese Systeme durch Abkürzungen nur Verständnis imitieren, könnten sie bei Situationen, die nicht mit ihren Trainingsdaten übereinstimmen, unvorhersehbar versagen, was zu Fehlern in kritischen Anwendungen führen kann.

Ein Team von Forschern setzte sich zum Ziel, die inneren Abläufe dieser Modelle zu entschlüsseln, indem es die Komplexität der realen Welt entfernte und sie durch eine kontrollierte, synthetische Umgebung ersetzte. Sie erstellten einen benutzerdefinierten Datensatz, der aus tausenden einfachen Bildern bestand, von denen jedes eine geringe Anzahl einfacher geometrischer Formen wie Kreise, Quadrate und Dreiecke in spezifischen Mustern darstellte. Diesen Formen wurden unterschiedliche Farben und Größen zugewiesen, und in einigen Fällen wurden Pfeile gezeichnet, um sie explizit zu verbinden, während die Verbindung in anderen Fällen nur durch ihre relative Position impliziert wurde. Die Forscher stellten dann einer modernen Vision-Language-Modell eine Reihe präziser Fragen, indem sie es baten, die Anzahl der Formen zu identifizieren, bestimmte Farben zu erkennen oder die Richtung eines Pfeils zwischen zwei Objekten zu bestimmen. Durch den Vergleich der Antworten des Modells mit den bekannten Fakten der synthetischen Bilder konnten sie genau messen, wie gut die Maschine performte.

Die Ergebnisse offenbarten eine drastische Kluft zwischen dem, was das Modell mühelos leisten konnte, und dem, was es nur schwer verstand. Bei einfachen Erkennungsfragen, wie etwa dem Zählen der Gesamtzahl der Formen oder der Identifizierung, ob ein grünes Quadrat vorhanden war, arbeitete das Modell mit nahezu perfekter Genauigkeit und übertraf oft die sechsundneunzig Prozent. Es schien ein festes Verständnis für die greifbaren Elemente des Bildes zu haben. Sobald die Fragen jedoch erforderten, dass das Modell Beziehungen ohne explizite visuelle Hinweise verstand, sank seine Leistung signifikant. Wenn es beispielsweise darum ging, welche Objekte durch einen Pfeil verbunden waren, ohne dass der Pfeil gezeichnet war, oder die Position einer Form relativ zu einer anderen allein basierend auf deren Anordnung zu beschreiben, fiel die Genauigkeit des Modells auf etwa sechzig Prozent oder weniger. Interessanterweise behielt das Modell eine hohe Genauigkeit von über zweiundneunzig Prozent bei, wenn die Anfrage explizite visuelle Marker bereitstellte, wie etwa die Frage nach der Richtung eines gezeichneten Pfeils. Dies deutete darauf hin, dass die Maschine keine kohärente mentale Karte der Szene aufbaute, sondern stattdessen stark auf die spezifischen Wörter in der Frage und die bereitgestellten expliziten visuellen Marker vertraute.

Um zu bestimmen, ob das Modell die Beziehungen tatsächlich „sah“ oder nur basierend auf Sprache rät, führten die Forscher einen strengen Test durch, indem sie die Bilder selbst veränderten. Sie erstellten modifizierte Versionen der Originalbilder, in denen sie ein spezifisches Element, wie eine einzelne Form oder einen Pfeil, digital entfernten, und stellten dann dieselben Fragen erneut. Wenn das Modell tatsächlich über die visuellen Beweise nachdenken würde, sollte das Entfernen eines Schlüsselteils des Bildes dazu führen, dass seine Genauigkeit drastisch sinkt. In einigen Fällen geschah genau das: Als das Modell gefragt wurde, Formen zu zählen oder einer Pfeilrichtung zu folgen, verursachte das Entfernen des relevanten visuellen Elements einen Leistungsabfall von fast fünfundzwanzig Prozent. Dies deutete darauf hin, dass das Modell bei diesen Aufgaben das Bild zwar tatsächlich betrachtete, aber auch diese visuellen Daten mit internen Verzerrungen mischte, die es anfällig machten, wenn sich die Szene änderte.

Überraschenderweise fanden die Forscher, dass das Entfernen visueller Elemente bei anderen Arten von Fragen die Leistung des Modells verbesserte oder unverändert ließ. Wenn es um die relative Position von Formen oder das Vorhandensein einer Verbindung ohne einen Pfeil ging, lieferte das Modell etwas bessere Antworten, wenn die visuellen Beweise verdeckt waren. Dieses kontraintuitive Ergebnis, das in der Arbeit als „überraschend“ und „direkt im Widerspruch zu visuellem Denken stehend“ bezeichnet wird, legt stark nahe, dass das Modell die visuellen Daten überhaupt nicht zur Lösung dieser Probleme nutzte. Stattdessen stützte es sich auf statistische Muster, die es aus seinen Trainingsdaten gelernt hatte, und rät im Wesentlichen basierend auf der Formulierung der Frage, anstatt basierend auf dem, was tatsächlich im Bild zu sehen war. Die Maschine dachte nicht über den Raum nach; sie zitierte eine wahrscheinliche Antwort basierend auf sprachlichen Hinweisen.

Indem sie in die Schichten der Prozessverarbeitung des Modells blickten, verfolgten die Forscher, wie die Informationen vom initialen Bildeingang bis zur endgülten Antwort flossen. Sie fanden heraus, dass die frühesten Schichten des Modells sehr gut darin waren, einfache Details wie das Vorhandensein einer bestimmten Farbe oder Form zu erkennen. Während die Informationen tiefer in das System vordrangen, wurde das Modell besser im Zählen und im Identifizieren grober Beziehungen. Die tieferen Schichten versäumten es jedoch, konsistent komplexe, abstrakte Beziehungen zwischen Objekten zu kodieren, wie etwa die präzise Richtung eines Pfeils oder die räumliche Anordnung von Gegenständen ohne explizite Marker. Die Studie kommt zu dem Schluss, dass diese leistungsstarken Systeme zwar hohe Punktzahlen bei vielen visuellen Aufgaben erreichen können, ihr Verständnis jedoch strikt auf das begrenzt ist, was explizit beobachtbar ist. Sie weisen kein wahres visuelles Verständnis auf, sondern verlassen sich stattdessen auf eine hybride Strategie, die echte visuelle Wahrnehmung mit linguistischen Abkürzungen kombiniert. Diese Entdeckung verdeutlicht eine kritische Einschränkung der aktuellen künstlichen Intelligenz und legt nahe, dass wahres visuelles Verständnis mehr erfordert als nur das Verarbeiten von Pixeln und Wörtern; es verlangt eine tiefere, robustere Form des Denkens, die diese Modelle bisher noch nicht erreicht haben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →