← Nieuwste papers
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench introduceert een geautomatiseerd, agentisch framework dat de evaluatie van webgeneratie herdefinieert als een dynamisch, collaboratief beoordelingsproces waarbij gespecialiseerde rollen betrokken zijn om de interactieve, diverse en snel evoluerende aard van frontend-artefacten aan te pakken, waardoor afstemming met het oordeel van menselijke experts wordt bereikt.

Oorspronkelijke auteurs: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen met je chatten, maar ook echt dingen bouwen. In het domein van Kunstmatige Intelligentie, specifiek Large Language Models (LLM's), hebben we een punt bereikt waarop deze digitale geesten code kunnen schrijven om complete websites te creëren, en niet alleen losse zinnen. Beschouw een LLM als een supersnelle, ongelooflijk deskundige leerling-architect. Als je het vraagt om "een boomhut te bouwen", kan het de blauwdrukken opstellen, het hout zagen en zelfs de muren schilderen. Maar hier komt het lastige deel: hoe weet je of de boomhut eigenlijk veilig is om in te klimmen? Een lange tijd hebben we deze AI-bouwers getest door naar hun blauwdrukken (de code) te kijken of door één enkele foto van het voltooide huis te nemen. Maar websites zijn geen statische foto's; het zijn levende, ademende speeltuinen waar knoppen klikken, animaties stuiteren en gebruikers ronddwalen. Als je alleen de blauwdrukken controleert, mis je misschien een wiebelige ladder of een deur die niet opengaat. Dit is de grote vraag waar onderzoekers zich mee bezighouden: Hoe testen we of een AI een website kan bouwen die daadwerkelijk werkt en goed aanvoelt in gebruik, in plaats van dat het er alleen op papier goed uitziet?

Maak kennis met LiveEvalBench, een nieuw en slim framework dat ontworpen is om exact dit probleem op te lossen. De auteurs stellen dat de oude manier van testen—zoals een leraar die een statisch essay beoordeelt—niet genoeg is voor interactieve webprojecten. In plaats daarvan hebben ze een systeem gebouwd dat werkt als een team van deskundige inspecteurs, elk met een andere taak, om de creaties van de AI grondig te testen.

Zo werkt hun "inspectieteam":

  1. De Bouwtechnicus: Stel je een bouwplaatsvoorman voor die probeert het huis daadwerkelijk te assembleren. Deze agent neemt de code van de AI en probeert de website te lanceren. Als de website crasht of de instructies verwarrend zijn, vangt deze technicus dit op.
  2. De Code-ingenieur: Dit is een kwaliteitscontroleur die naar de blauwdrukken (de broncode) kijkt zonder het huis aan te raken. Zij controleren of de materialen goed georganiseerd zijn, of de structuur stevig is en of de AI de specifieke regels heeft gevolgd die je hebt gegeven (zoals "gebruik blauwe verf" of "maak er een React-app van").
  3. De UI-Tester: Dit is het nieuwsgierige kind dat door de speeltuin rent. Deze agent kijkt helemaal niet naar de code, maar klikt op knoppen, zweeft over afbeeldingen en probeert de website precies te gebruiken zoals een mens dat zou doen. Het controleert of de animaties vloeiend zijn, of de tekst leesbaar is en of de site daadwerkelijk doet wat je hebt gevraagd.

Wat LiveEvalBench bijzonder maakt, is dat het adaptief is. In het verleden waren tests rigide, zoals een meerkeuzetoets waarbij er slechts één juist antwoord is. Maar in de echte wereld zijn er een miljoen manieren om een geweldige website te bouwen. LiveEvalBench kijkt naar wat de AI daadwerkelijk heeft gebouwd en stelt een aangepaste checklist op voor die specifieke versie. Als de AI een uitschuifmenu heeft gebouwd in plaats van een uitklapmenu, past de test zich aan om te controleren of het uitschuifmenu werkt, in plaats van het te laten falen omdat het geen uitklapmenu is. Het is als een rechter die begrijpt dat een pizza vierkant of rond kan zijn, zolang hij maar heerlijk smaakt.

De onderzoekers hebben dit nieuwe systeem getest op 100 real-world verzoeken (variërend van eenvoudige taken tot complexe, meerpagina-applicaties) en vroegen 11 van de slimste AI-modellen om deze te bouwen. De resultaten waren onthullend. Hoewel veel modellen goed waren in het schrijven van code en het lanceren van de website, struikelden ze vaak wanneer het kwam aan de werkelijke gebruikerservaring. De "UI-Tester" vond dat de grootste problemen optraden wanneer gebruikers met de site probeerden te interageren—knoppen die niet klikbaar waren, animaties die bevroren, of lay-outs die uit elkaar vielen.

Toen ze hun AI-inspecteurs vergeleken met menselijke experts, waren de resultaten zeer dichtbij, wat suggereert dat dit geautomatiseerde team een betrouwbare manier is om AI-bouwers te beoordelen. De studie vond dat de beste modellen rond de 70 van de 90 scoorden, waarbij de toppresteerders (zoals Claude Opus 4.7) sterke vaardigheden toonden, terwijl anderen aanzienlijk worstelden met de interactieve onderdelen. Het artikel suggereert dat hoewel AI beter wordt in bouwen, het "leuke" deel—dingen maken die levendig en responsief aanvoelen—nog steeds de grootste uitdaging is. LiveEvalBench biedt een nieuwe, flexibele manier om deze vooruitgang te meten, zodat we, naarmate AI beter wordt in bouwen, de juiste instrumenten hebben om ervoor te zorgen dat die gebouwen veilig, leuk en klaar voor de wereld zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →