UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
Het artikel introduceert UI2App, de eerste benchmark die ontworpen is om het vermogen van vision-language-modellen te evalueren om uitvoerbare interactiegedragingen af te leiden uit louter statische UI-screenshots, waarbij een aanzienlijke kloof wordt onthuld tussen de visuele reconstructiecapaciteiten van huidige modellen en hun vermogen om complexe, staat-coherente webapplicaties te genereren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Van "Kijken" naar "Doen"
Stel je voor dat je een meesterkok bent. Je hebt een foto van een prachtige, complexe taart op tafel staan.
- De Oude Manier (Tekstgestuurd): Je vraagt de kok: "Maak een taart die eruit ziet als deze foto, die drie lagen heeft, van chocolade is en een geheim knopje binnenin heeft dat bij druk sprinkles vrijlaat." De kok heeft jou nodig om elke details in woorden te beschrijven. Als je vergeet te vermelden dat er een geheim knopje is, zal de kok het niet maken.
- De Nieuwe Manier (Afbeeldinggestuurd): Je overhandigt de kok gewoon de foto. De kok kijkt ernaar en probeert de taart te bakken.
Een lange tijd zijn AI-modellen (de "koks" in dit verhaal) erg goed geworden in het bekijken van een foto en het bakken van een taart die er precies uitziet als de afbeelding. Ze kunnen de kleuren, de glazuurkrullen en de vorm perfect matchen.
Maar hier is het probleem: Alleen omdat de taart er echt uitziet, betekent het nog niet dat hij ook werkt.
- Komt het geheime knopje daadwerkelijk sprinkles vrij?
- Als je een stuk neemt, smaakt de binnenkant dan naar chocolade, of is het slechts een holle schil?
- Als je een laag verplaatst, blijven de andere lagen dan verbonden?
Het paper UI2App zegt: "We moeten stoppen met alleen maar controleren of de taart er goed uitziet. We moeten controleren of de taart ook daadwerkelijk werkt."
De Nieuwe Benchmark: UI2App
De onderzoekers hebben een nieuwe test ontwikkeld genaamd UI2App. In plaats van de AI te vragen een website te bouwen op basis van een lange lijst met geschreven instructies, gaven ze de AI een stapel screenshots (foto's van een website) en zeiden:
"Bouw een werkende, klikbare website die zich exact gedraagt als deze foto's, zonder dat wij je vertellen hoe de knoppen werken."
De AI moet de "verborgen magie" ontdekken door alleen naar de plaatjes te kijken. Als een foto bijvoorbeeld een winkelwagentje laat zien met 1 item, en de volgende foto laat het zien met 2 items, dan moet de AI beseffen: "Ah, er moet een verborgen systeem zijn dat onthoudt wat ik heb toegevoegd!"
Het Rapportcijfer met Vier Punten
Om het werk van de AI te beoordelen, keken de onderzoekers niet alleen naar het eindproduct. Ze gebruikten een checklist met vier onderdelen:
- Kan het überhaupt draaien? (Executability): Werkt de code daadwerkelijk, of crasht het direct? Het is alsof je controleert of de oven wel in het stopcontact zit voordat je de taart proeft.
- Kun je er rondvaren? (Navigation Reachability): Als de website een "Contact Us"-pagina heeft in de foto's, kun je dan ook daadwerkelijk op een link klikken om daar te komen? Of is de link kapot?
- Ziet het er goed uit? (Visual Fidelity): Ziet de website eruit als de foto? (Dit is de oude manier van testen, waar de meeste AI's goed in zijn).
- Doet het goed? (Interaction Inference Score - IIS): Dit is het belangrijkste nieuwe onderdeel. Als je op "Toevoegen aan winkelwagen" klikt, gaat het aantal dan omhoog? Als je inlogt, onthoudt de pagina je dan? Dit test of de AI het gedrag heeft begrepen, en niet alleen het uiterlijk.
De Schokkende Resultaten
De onderzoekers testten zes van de slimste AI-modellen die momenteel beschikbaar zijn. Dit is wat ze vonden:
- De "Look-Alike" Valstrik: Het AI-model dat het beste was in het laten lijken op de website (Visual Fidelity), was ook de vierde beste in het laten werken van de website (Interaction).
- Analogie: Stel je een model voor dat een nepauto van klei bouwde. Het zag er exact uit als een Ferrari (glimmend, perfecte vorm), maar als je probeerde de motor te starten, gebeurde er niets. Het was een "bevroren façade".
- De "Doener" Wint: Het model dat het beste was in het laten werken van de website (items aan winkelwagentjes toevoegen, wachtwoorden onthouden, van pagina wisselen) was een totaal ander model.
- Het "Geheugen" Probleen: Het moeilijkste voor alle AI's was Cross-Route State.
- Analogie: Stel je voor dat je in een videogame zit. Je pakt een zwaard op in het "Bos"-level. Je loopt naar het "Kasteel"-level. Een slimme AI onthoudt dat je nog steeds het zwaard hebt. De AI's in deze test vergaten dit vaak. Ze bouwden een Bos waar je een zwaard kon oppakken, maar wanneer je naar het Kasteel liep, was het zwaard verdwenen en deed het spel alsof je het nooit had opgepakt.
- Het resultaat: De helft van de modellen scoorde nul op deze specifieke vaardigheid. Ze konden geen informatie bijhouden terwijl je tussen verschillende pagina's bewoog.
Waarom Dit Er Toe Doet
Het paper concludeert dat Visual Fidelity niet gelijk staat aan Intelligentie.
Alleen omdat een AI een perfect plaatje van een knop kan tekenen, betekent niet dat de AI weet wat er gebeurt als je erop klikt. De huidige generatie AI is geweldig in het zijn van een kunstenaar (het kopiëren van het uiterlijk), maar worstelt nog steeds met het zijn van een ingenieur (het bouwen van de logica).
De UI2App-benchmark is een nieuw hulpmiddel om AI te dwingen te stoppen met alleen maar "doen alsof" en echt te beginnen met "doen". Het benadrukt dat de grootste kloof in AI op dit moment niet het mooi maken van dingen is, maar het begrijpen van de onzichtbare regels die een website tot leven wekken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.