← Nieuwste papers
🤖 AI

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench is een nieuwe benchmark die de prestaties van beeldgeneratiemodellen evalueert bij het creëren van dynamische en coherente gebruikersinterfaces (GUI's) door middel van een nieuw meetinstrument genaamd GE-Score.

Oorspronkelijke auteurs: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxi
Gepubliceerd 2026-02-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot hebt die een smartphone moet bedienen. Je zegt tegen de robot: "Open de instellingen en zet de wifi uit." De robot kijkt naar het scherm, begrijpt je, en 'tekent' vervolgens een nieuw plaatje van hoe het scherm eruitziet nadat hij op de knop heeft gedrukt.

Dat klinkt simpel, toch? Maar voor een computer is dit ontzettend moeilijk. Het is niet genoeg om gewoon een "mooi plaatje" te maken; het moet een logisch plaatje zijn. Als je op een knop drukt, moet er een menu verschijnen, niet ineens een foto van een kat.

Dit wetenschappelijke artikel introduceert GEBench, een soort 'examen' voor AI-modellen om te testen of ze deze taak goed kunnen.

Hier is de uitleg in begrijpelijke taal:

1. Het probleem: De "Dromende Kunstenaar"

De huidige AI-modellen (zoals die van Midjourney of DALL-E) zijn als fantastische kunstenaars. Als je vraagt om een "zonsondergang op het strand", maken ze een prachtig schilderij. Maar ze zijn een beetje als dromende kunstenaars: ze hebben geen besef van regels of logica.

Als je een AI vraagt om een screenshot te maken van een app nadat je op "Verwijder" hebt geklikt, maakt de AI misschien een prachtig plaatje, maar de tekst is onleesbaar (als hiërogliefen) of de knop die je indrukte is ineens verdwenen zonder dat er iets gebeurt. De AI begrijpt de regels van een app niet; hij begrijpt alleen hoe mooie plaatjes eruitzien.

2. De oplossing: GEBench (Het Ultieme Examen)

De onderzoekers hebben GEBench bedacht. Zie dit als een streng examen voor AI-modellen. In plaats van te vragen: "Maak een mooi plaatje van een boom", vraagt GEBench: "Hier is een screenshot van een bank-app. De gebruiker klikt op 'Overboeken'. Teken nu precies wat het volgende scherm is."

Het examen bestaat uit vijf verschillende onderdelen:

  • De Sprint (Single-step): Eén simpele actie. Klik op de knop, laat het resultaat zien.
  • De Marathon (Multi-step): Een hele reeks acties. "Bestel een koffie via deze app." De AI moet vijf stappen achter elkaar tekenen zonder dat de app onderweg ineens verandert in een weerbericht.
  • De Fantasie (Fiction-app): De AI moet een app bedenken die nog niet bestaat, maar die wel logisch werkt.
  • De Zeldzame Route (Real-app): De AI moet situaties nabootsen die niet vaak voorkomen, om te zien of hij echt begrijpt wat er gebeurt.
  • De Precisie-test (Grounding): De AI krijgt een coördinaat (bijv. "klik op punt X,Y") en moet precies op die plek de actie uitvoeren.

3. De GE-Score: De Cijferlijst

Om te weten hoe goed de AI is, hebben ze de GE-Score bedacht. Dit is geen simpel cijfer voor "is het mooi?", maar een rapportcijfer op vijf vlakken:

  1. Doel bereikt? (Heb je echt die koffie besteld?)
  2. Logica? (Is de overgang tussen de schermen logisch, of is het een willekeurige sprong?)
  3. Consistentie? (Blijft de rest van het scherm hetzelfde, of verandert de achtergrondkleur ineens?)
  4. UI-logica? (Zien de knoppen en menu's eruit als een echte app, of als een rommeltje?)
  5. Visuele kwaliteit? (Is de tekst leesbaar of is het een vage vlek?)

4. De Conclusie: Waar staan we nu?

De onderzoekers ontdekten dat de huidige AI's nog steeds een beetje "dom" zijn als het op logica aankomt. Ze zijn heel goed in het maken van één mooi plaatje (de sprint), maar zodra ze een langere route moeten bewandelen (de marathon), raken ze de draad kwijt. Ze maken fouten in de tekst, begrijpen iconen niet altijd goed en weten niet precies waar op het scherm ze moeten "klikken".

Waarom is dit belangrijk?
Als we ooit echte digitale assistenten willen hebben die onze computers en telefoons volledig kunnen bedienen, moeten ze eerst leren hoe ze de wereld van interfaces kunnen "tekenen" en begrijpen. GEBench is de eerste stap om die assistenten slimmer te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →