GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
Das Papier stellt GUI-Primitives vor, einen Benchmark, der aufzeigt, dass Vision-Language-Modelle primär daran scheitern, Kandidaten-Interface-Elemente zu lokalisieren, anstatt räumliche Beziehungen zu verstehen, wie die hohe Genauigkeit bei Beschränkung auf korrekte Regionen bei gleichzeitig schlechter Leistung bei unbeschränkter Koordinatenvorhersage belegt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich einen Computer vor, der einen Screenshot eines Softwareprogramms betrachten, einen Satz wie „Klicken Sie auf die Schaltfläche rechts neben dem Speichern-Symbol“ lesen und dann den Mauszeiger genau an diese Stelle bewegen kann. Dies ist das Versprechen einer neuen Generation von KI-Agenten, die darauf ausgelegt sind, unsere Computer für uns zu bedienen. Sie werden entwickelt, um Aufgaben zu erledigen, die vom Ausfüllen von Formularen bis hin zum Navigieren durch komplexe Menüs reichen, und fungieren als digitale Assistenten, die die grafischen Benutzeroberflächen sehen und mit ihnen interagieren können, die wir jeden Tag nutzen. Damit diese Agenten funktionieren, müssen sie über eine grundlegende Fähigkeit verfügen, die „Grounding“ (Verankerung) genannt wird: die Fähigkeit, ein bestimmtes Wort in einem Satz mit einer bestimmten Form oder Schaltfläche auf einem Bildschirm zu verknüpfen. Wenn der Agent nicht zuverlässig die „Schaltfläche rechts“ finden kann, kann er die Aufgabe nicht ausführen, egal wie intelligent er bei der Planung oder beim Tippen ist.
Forscher wissen schon lange, dass diese Computer-Agenten manchmal Fehler machen, aber sie hatten Schwierigkeiten, genau zu bestimmen, warum. Versagt der Computer, weil er den Text auf dem Bildschirm nicht lesen kann? Ist er verwirrt darüber, was „rechts“ bedeutet? Oder ist er schlichtweg nicht in der Lage, die Schaltflächen überhaupt zu lokalisieren? Bestehende Tests für diese Systeme mischen oft all diese Fähigkeiten zusammen, was es unmöglich macht, festzustellen, welcher Teil des „Gehirns“ defekt ist, wenn der Agent auf das Falsche klickt. Um dieses Rätsel zu lösen, entwickelte ein Team von Wissenschaftlern einen neuen, hochkontrollierten Test, der darauf ausgelegt ist, eine einzige, grundlegende Fähigkeit zu isolieren: das Verständnis räumlicher Beziehungen in einer Computer-Benutzeroberfläche.
Die Forscher erstellten einen Datensatz namens GUI-PRIMITIVES, der aus fast tausend Paaren von Fragen besteht. Jedes Paar verwendet exakt denselben Screenshot und exakt denselben Ausgangspunkt oder „Anker“, ändert jedoch nur ein einziges Wort in der Anweisung. In einer Version wird der Computer gebeten, das Element links von einem bestimmten Symbol anzuklicken; in der gepaarten Version wird er gebeten, das Element rechts von demselben Symbol anzuklicken. Da das Bild und der Anker identisch sind, ist der einzige Unterschied die Richtung. Wenn der Computer die Sprache wirklich versteht, sollte er beim ersten السؤال die linke Schaltfläche und beim zweiten die rechte Schaltfläche anklicken. Wenn er jedoch dieselbe Schaltfläche für beide Fragen anklickt oder einen völlig anderen Bereich anklickt, offenbart dies ein Versagen im Verständnis der räumlichen Beziehung. Das Team testete neunzehn verschiedene Modelle künstlicher Intelligenz bei dieser Herausforderung, die von leistungsstarken, teuren kommerziellen Systemen bis hin zu kleineren Open-Source-Versionen reichten.
Die Ergebnisse waren drastisch. Selbst die fortschrittlichsten Modelle schnitten schlecht ab, wobei das beste System in nur etwa zweiunddreißig Prozent der Fälle die richtige Antwort gab. Dies ist eine massive Lücke im Vergleich zur menschlichen Leistung, bei der Menschen in fast siebenundneunzig Prozent der Fälle richtig antworteten. Die Forscher gruben tiefer, um zu verstehen, wo die Fehler auftraten. Sie entdeckten, dass das Problem nicht primlich darin bestand, dass die Modelle durch die Wörter „links“ oder „rechts“ verwirrt waren. Stattdessen versagten die Modelle primär dabei, den korrekten Bereich auf dem Bildschirm überhaupt zu finden. In sechzig bis zweiundneunzig Prozent der Fehler landete der vorhergesagte Klick des Computers außerhalb sowohl des korrekten Ziels als auch des falschen Ablenkers, oft in einem völlig leeren Teil des Bildes.
Als die Forscher diese „verlorenen“ Vorhersagen herausfilterten und nur die Fälle betrachteten, in denen der Computer tatsächlich auf eine der beiden Kandidatenschaltflächen zeigte, änderte sich das Bild. Für horizontale und vertikale Richtungen waren die Modelle recht gut darin, die richtige zu wählen, sobald sie den Bereich eingegrenzt hatten. Bei komplexeren Beziehungen jedoch, wie etwa der Bestimmung, ob ein Objekt innerhalb eines Panels liegt oder hinter einem Pop-up-Fenster verborgen ist, schnitten die Modelle nicht besser ab als beim bloßen Raten, selbst wenn sie die richtigen Kandidaten vor sich hatten. Dies deutet darauf hin, dass die Modelle zwar manchmal die Wörter verstehen können, aber erheblich mit der visuellen Aufgabe kämpfen, zu lokalisieren, worauf sich diese Wörter auf einem komplexen Bildschirm beziehen.
Die Studie untersuchte auch, ob diese räumlichen Fähigkeiten Auswirkungen auf die Leistung in der realen Welt hatten. Sie fanden eine starke Verbindung: Modelle, die in diesen grundlegenden räumlichen Tests besser abschnitten, waren auch besser in einem separaten, komplexeren Benchmark für das Klicken auf echte Desktop-Anwendungen. Dies bestätigt, dass die Fähigkeit, einfache räumliche Anweisungen zu verstehen, ein grundlegender Baustein für die fortgeschrittene Computernutzung ist. Die Forscher probierten auch mehrere Tricks aus, um den Modellen zu helfen, wie etwa sie dazu aufzufordern, Schritt für Schritt zu denken, oder visuelle Markierungen auf dem Bildschirm hinzuzufügen, um die Optionen hervorzuheben. Eine Methode, bei der nummerierte Tags direkt auf den Kandidatenschaltflächen platziert wurden, verbesserte die Ergebnisse drastisch und hob einige Modelle von dreißig Prozent auf fast neunzig Prozent. Dies war jedoch eher ein diagnostisches Werkzeug als eine praktische Lösung, da der Computer bereits wissen muss, wo sich die Schaltflächen befinden, um die Tags zu platzieren.
Letztendlich zeigt die Studie, dass der aktuellen Generation von computerbedienenden Agenten ein entscheidendes Puzzleteil fehlt. Sie scheitern nicht daran, dass sie nicht über Sprache nachdenken können oder nicht den Bildschirm sehen können; sie scheitern daran, dass sie nicht zuverlässig eine einfache räumliche Anweisung einer spezifischen Position auf einer überfüllten, komplexen Schnittstelle zuordnen können. Bis diese grundlegende Fähigkeit, Wörter mit visuellen Standorten zu verknüpfen, behoben ist, werden diese digitalen Assistenten weiterhin mit den einfachsten Aufgaben bei der Navigation in unserer digitalen Welt zu kämpfen haben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.