← Nieuwste papers
💬 NLP

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

Het artikel introduceert GUI-Primitives, een benchmark die onthult dat vision-language modellen primair falen in het lokaliseren van kandidaat-interface-elementen in plaats van in het begrijpen van ruimtelijke relaties, zoals blijkt uit hun hoge nauwkeurigheid wanneer ze beperkt zijn tot de juiste regio's maar slechte prestaties bij onbeperkte coördinaatvoorspelling.

Oorspronkelijke auteurs: Md Abrar Jahin, Md Rizwan Parvez

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Abrar Jahin, Md Rizwan Parvez

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computer voor die naar een screenshot van een softwareprogramma kan kijken, een zin als "klik op de knop rechts van het opslagicoon" kan lezen, en vervolgens de muisaanwijzer naar die exacte plek kan bewegen. Dit is de belofte van een nieuwe generatie AI-agenten die ontworpen zijn om onze computers voor ons te bedienen. Ze worden gebouwd om taken uit te voeren variërend van het invullen van formulieren tot het navigeren door complexe menu's, optredend als digitale assistenten die de grafische interfaces kunnen zien en waarmee ze kunnen interageren die we dagelijks gebruiken. Om deze agenten te laten werken, moeten ze over een fundamentele vaardigheid beschikken die "grounding" (verankering) wordt genoemd: het vermogen om een specifiek woord in een zin te verbinden aan een specifiek vormpje of een knop op een scherm. Als de agent niet betrouwbaar de "knop rechts van" kan vinden, kan hij de taak niet uitvoeren, ongeacht hoe slim hij is in plannen of typen.

Onderzoekers weten al lang dat deze computeragenten soms fouten maken, maar ze hebben moeite gehad om precies te achterhalen waarom. Faalt de computer omdat hij de tekst op het scherm niet kan lezen? Is hij in de war over wat "rechts" betekent? Of is hij simpelweg niet in staat om de knoppen te lokaliseren? Bestaande tests voor deze systemen combineren vaak al deze vaardigheden, waardoor het onmogelijk is om te zeggen welk deel van het brein defect is wanneer de agent op het verkeerde punt klikt. Om dit puzzelstukje op te lossen, heeft een team wetenschappers een nieuwe, zeer gecontroleerde test ontwikkeld die is ontworpen om één enkele, basisvaardigheid te isoleren: het begrijpen van ruimtelijke relaties in een computerinterface.

De onderzoekers hebben een dataset gebouwd genaamd GUI-PRIMITIVES, die bestaat uit bijna duizend paren vragen. Elk paar gebruikt exact dezelfde screenshot en exact hetzelfde startpunt, of "anker", maar verandert slechts één woord in de instructie. In de ene versie wordt de computer gevraagd om het element links van een specifiek icoon aan te klikken; in de gepaard versie wordt hem gevraagd om het element rechts van datzelfde icoon aan te klikken. Omdat de afbeelding en het anker identiek zijn, is het verschil enkel de richting. Als de computer de taal echt begrijpt, zou hij bij de eerste vraag op de linkerknop klikken en bij de tweede vraag op de rechterknop. Als hij voor beide vragen op dezelfde knop klikt, of op een volledig ander gebied klikt, onthult dit een falen in het begrijpen van de ruimtelijke relatie. Het team testte negentien verschillende kunstmatige intelligentiemodellen op deze uitdaging, variërend van krachtige, dure commerciële systemen tot kleinere, open-source versies.

De resultaten waren schokkend. Zelfs de meest geavanceerde modellen presteerden slecht, waarbij het beste systeem het antwoord slechts in ongeveer tweeendertig procent van de gevallen correct had. Dit is een enorme kloof vergeleken met menselijke prestaties, waarbij mensen bijna zevenennegentig procent van de tijd correct antwoordden. De onderzoekers groeven dieper om te begrijpen waar de fouten optraden. Ze ontdekten dat het probleem niet primair was dat de modellen in de war waren door de woorden "links" of "rechts". In plaats daarvan faalden de modellen erin om het juiste gebied op het scherm te vinden. In zestig tot tweeënnegentig procent van de fouten landde de voorspelde klik van de computer buiten zowel het juiste doel als de verkeerde afleider, vaak in een volledig leeg deel van de afbeelding.

Wanneer de onderzoekers deze "verdwaalde" voorspellingen wegfilterden en alleen keken naar de momenten waarop de computer daadwerkelijk op een van de twee kandidaat-knoppen wees, veranderde het beeld. Voor horizontale en verticale richtingen waren de modellen vrij goed in het kiezen van de juiste knop zodra ze het gebied hadden vernauwd. Echter, voor complexere relaties, zoals bepalen of een item zich binnen een paneel bevindt of verborgen is achter een pop-upvenster, presteerden de modellen niet beter dan bij toeval, zelfs wanneer ze naar de juiste kandidaten keken. Dit suggereert dat hoewel de modellen de woorden soms begrijpen, ze aanzienlijk moeite hebben met de visuele taak om te lokaliseren waar die woorden van toepassing zijn op een complex scherm.

De studie testte ook of deze ruimtelijke vaardigheden ertoe deden voor prestaties in de echte wereld. Ze vonden een sterke link: modellen die beter waren in deze basisruimtelijke tests, waren ook beter in een aparte, complexere benchmark voor het klikken op echte desktopapplicaties. Dit bevestigt dat het vermogen om eenvoudige ruimtelijke instructies te begrijpen een fundamentele bouwsteen is voor geavanceerder computergebruik. De onderzoekers probeerden ook verschillende trucjes om de modellen te helpen, zoals hen stap-voor-stap te laten nadenken of visuele markeringen aan het scherm toe te voegen om de opties te benadrukken. Eén methode, die numerieke labels direct op de kandidaat-knoppen plaatste, verbeterde de scores spectaculair en tilde sommige modellen van dertig naar bijna negentig procent. Dit was echter een diagnostisch hulpmiddel in plaats van een praktische oplossing, aangezien de computer de knoppen al moest weten te vinden om de labels te kunnen plaatsen.

Uiteindelijk onthult de studie dat de huidige generatie computergebruikende agenten een cruciaal onderdeel van de puzzel mist. Ze falen niet omdat ze niet over taal kunnen redeneren of omdat ze het scherm niet kunnen zien; ze falen omdat ze niet betrouwbaar een eenvoudige ruimtelijke instructie kunnen koppelen aan een specifieke locatie op een drukke, complexe interface. Totdat deze fundamentele vaardigheid van het verbinden van woorden aan visuele locaties wordt opgelost, zullen deze digitale assistenten blijven worstelen met de meest basale taken van het navigeren door onze digitale wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →