← Neueste Arbeiten
🤖 AI

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

Dieses Paper stellt CompareBench vor, eine umfassende Benchmark-Suite bestehend aus TallyBench, OmniCaps und einem Datensatz für visuellen Vergleich mit 1.200 Fragen, um systematische Schwächen aktueller Vision-Language-Modelle in Bezug auf das Zählen von Objekten sowie geometrisches, räumliches und zeitliches Denken zu bewerten und aufzuzeigen.

Ursprüngliche Autoren: Jie Cai

Veröffentlicht 2026-08-31✓ Author reviewed
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jie Cai

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das menschliche Sehvermögen besteht nicht bloß aus dem Sehen; es geht um das Vergleichen. Wenn wir einen Raum betrachten, registrieren wir nicht nur, dass Stühle und Tische existieren; wir beurteilen augenblicklich, welcher Stuhl höher ist, welcher Tisch näher steht, wie viele Tassen auf der Arbeitsplatte stehen oder ob eine Fotografie eine Szene aus der Vergangenheit oder der Gegenwart zeigt. Diese Fähigkeit, eine Sache gegen eine andere abzuwägen, ist ein grundlegender Bestandteil dessen, wie wir die Welt verstehen. In den letzten Jahren haben Computer gelernt, mit bemerkenswerter Geschicklichkeit zu sehen, fähig dazu, Bilder zu beschreiben und Fragen über deren Inhalt zu beantworten. Diese Systeme, bekannt als Vision-Language-Modelle, sind die Motoren hinter vielen modernen Werkzeugen, die ein Diagramm lesen, ein Foto beschreiben oder ein visuelles Rätsel lösen können. Doch während diese Maschinen geschickt in der Erkennung und Beschreibung geworden sind, blieb unklar, ob sie über dasselbe intuitive Verständnis für Vergleiche verfügen, das Menschen in jeder Sekunde ihres Tages nutzen.

Ein Forscher hat nun einen spezialisierten Test entwickelt, um diese Frage zu beantworten, indem er eine neue Evaluierungssuite erschuf, die darauf ausgelegt ist, den spezifischen Akt des Vergleichens visueller Informationen zu isolieren. Er fand heraus, dass die fortschrittlichsten Computersysteme bei allgemeinen Aufgaben zwar gut abschneiden, aber erheblich Schwierigkeiten haben, wenn sie direkt gebeten werden, Vergleiche hinsichtlich Menge, Größe, Distanz oder Zeit anzustellen. Die Studie zeigt, dass selbst die intelligentesten Modelle daran scheitern können, Objekte zu zählen, die klar sichtbar sind, feststellen können, welches von zwei Gegenständen länger ist, oder sich darüber verwirren können, welche von zwei Personen näher an der Kamera steht. Der Forscher entdeckte, dass diese Systeme oft bei Aufgaben stolpern, die für einen Menschen trivial sind, was darauf hindeutet, dass die Fähigkeit zum Vergleich visueller Details eine systematische Schwäche der aktuellen künstlichen Intelligenz bleibt.

Um diese Lücke zu untersuchen, konstruierte der Forscher einen umfassenden Testsatz namens CompareBench, der von zwei weiteren, von ihm entwickelten Ressourcen unterstützt wird: TallyBench und OmniCaps. TallyBench ist eine Sammlung von zweitausend Bildern, von denen jedes mit einer einfachen Frage gepaart ist, die den Computer bittet, einen bestimmten Typ von Objekt zu zählen, wie etwa Hunde, Bücher oder Löffel. Diese Ressource dient als Grundlage für das Testen, wie gut ein Modell einzelne Gegenstände zählen kann, und liefert auch die Quellbilder für die Mengenvergleichsaufgabe. OmniCaps ist ein kleinerer Satz von siebenhundertsechzehn Bildern, die historische Ereignisse, berühmte Wahrzeichen und bedeutende Persönlichkeiten zeigen, wobei jedes Bild mit einem spezifischen Datum versehen ist. Diese Sammlung ermöglicht es dem Forscher zu testen, ob ein Modell das Vergehen der Zeit verstehen kann, indem es Bilder chronologisch ordnet. Der Haupttest, CompareBench, führt diese Elemente in zwölfhundert Fragen zusammen, die den Computer bitten, direkte Vergleiche anzustellen. Diese Fragen sind in vier Kategorien unterteilt: den Vergleich von Mengen, den Vergleich geometrischer Eigenschaften wie Länge und Dicke, das Beurteilen räumlicher Beziehungen wie Tiefe und Höhe sowie das Ordnen von Ereignissen in der Zeit. Die Teilmenge für den Mengenvergleich nutzt spezifisch TallyBench, um sechshundert Fragen zu bilden.

Der Forscher testete neun verschiedene Versionen führender Computervisionssysteme von drei großen Technologieunternehmen. Er bat diese Modelle, die zwölfhundert Vergleichsfragen und die zweitausend Zählaufgaben zu lösen. Die Ergebnisse zeigten eine klare Kluft zwischen menschlicher Leistung und maschineller Leistung. Menschen erreichten bei fast jeder Aufgabe nahezu perfekte Werte, da sie Objekte mühelos zählten und Größen beurteilten. Die Computermodelle hingegen zeigten beständige Fehler. Bei den Zählaufgaben erhielten die besten Modelle etwa siebenundachtzig Prozent der Antworten korrekt, was bedeutet, dass sie Objekte in mehr als einer von zehn Bildern übersehenen oder falsch zählten. Bei den Vergleichsaufgaben variierte die Leistung je nach Kategorie. Die Modelle waren bei Mengenvergleichen recht gut, hatten aber erhebliche Schwierigkeiten mit dem räumlichen Denken und scheiterten oft daran, zu bestimmen, welches Objekt näher an der Kamera war oder welcher Punkt höher vom Boden entfernt war. Sie hatten auch Probleme mit geometrischen Vergleichen, wie etwa der Entscheidung, welches von zwei Büchern dicker war.

Eine der überraschendsten Erkenntnisse ergab sich in der Kategorie des temporalen, oder zeitbasierten, Vergleichs. In diesem Abschnitt wurden die Modelle gebeten, Bilder historischer Szenen, Wahrzeichen oder berühmter Persönlichkeiten anzusehen und zu entscheiden, welches zeitlich früher in der Geschichte auftrat. Hier übertrafen die Computermodelle tatsächlich die menschlichen Testpersonen. Die Menschen, die auf das bloße visuelle Beweismaterial in den Bildern beschränkt waren, konnten die korrekte Reihenfolge oft nicht bestimmen, da die Bilder sehr ähnlich aussahnen. Die Computermodelle jedoch hatten Zugriff auf ein riesiges, bereits existierendes Wissen über Geschichte, Architektur und berühmte Persönlichkeiten. Sie konnten auf diese interne Datenbank zurückgreifen, um die Bilder korrekt zu ordnen, selbst wenn die visuellen Hinweise allein nicht ausreichten. Dies deutet darauf hin, dass die Modelle zwar über ein wahres visuelles Verständnis von Raum und Größe verfügen mögen, dies aber manchmal kompensieren können, indem sie ihr massives Gedächtnis an Fakten nutzen, um Probleme zu lösen, die externes Wissen erfordern.

Trotz dieser gelegentlichen Erfolge hebt die Studie hervor, dass die Kernfähigkeit zum Vergleich visueller Elemente von der künstlichen Intelligenz noch nicht vollständig beherrscht wird. Der Forscher beobachtete, dass die Modelle häufig die Länge eines Objekts mit seiner Höhe verwechselten oder nicht zwischen einem Vordergrundobjekt und einem Hintergrundobjekt unterscheiden konnten. Er stellte auch fest, dass die Modelle beim Zählen oft teilweise verborgene Objekte übersehen, eine Aufgabe, die Menschen instinktiv bewältigen. Der Forscher kam zu dem Schluss, dass aktuelle Systeme noch nicht zuverlässig für Aufgaben sind, die einen feingliedrigen visuellen Vergleich erfordern, und dass diese Fehler keine zufälligen Irrtümer, sondern systematische Einschränkungen in der Art und Weise sind, wie die Modelle visuelle Informationen verarbeiten. Durch die Bereitstellung eines fokussierten Satzes von Tests, der diese spezifischen Fähigkeiten isoliert, bietet der neue Benchmark einen klaren Weg, um Fortschritte in diesem Bereich zu messen. Der Forscher hofft, dass durch die Veröffentlichung seiner Daten und Methoden andere Wissenschaftler in der Lage sein werden, diese Werkzeuge zu nutzen, um bessere Modelle zu bauen, die schließlich die menschliche Fähigkeit erreichen können, die Welt um uns herum zu sehen, zu vergleichen und zu verstehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →