← Nieuwste papers
🤖 AI

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

Dit artikel introduceert LongWebBench, een uitgebreide benchmark die is ontworpen om de structurele getrouwheid en functionele uitvoerbaarheid van langdurige webpagina-generatie door vision-language modellen te evalueren, waarbij wordt onthuld dat huidige state-of-the-art systemen moeite hebben met langetermijncoherentie en interactieve mogelijkheden ondanks visuele plausibiliteit.

Oorspronkelijke auteurs: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Gepubliceerd 2026-06-17
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een getalenteerde architect inhuurt om een huis te bouwen op basis van één enkele, enorme foto van een landhuis.

Het Probleem:
Tot nu toe vroegen de meeste tests voor AI-"architecten" (genaamd Vision-Language Modellen) hen alleen om kleine, eenkamerige huisjes te bouwen. Deze tests controleerden of de voordeur er goed uitzag of dat de verfkleur overeenkwam. Maar echte websites zijn als enorme landhuizen met tientallen kamers, meerdere verdiepingen en complexe bedrading. Als je een AI vraagt om een heel landhuis te bouwen op basis van één foto, kan het de voordeur wel goed krijgen, maar vergeet het hoe de trap verbonden moet worden met de tweede verdieping, of bouwt het een keuken die er echt uitziet, maar waar geen werkende kraan zit.

De Oplossing: LongWebBench
De auteurs van dit artikel hebben een nieuwe, moeilijkere test ontwikkeld genaamd LongWebBench. In plaats van alleen te controleren of het huis op de foto lijkt, controleren ze twee dingen:

  1. De Blauwdruk (Structuur): Maakt het hele gebouw ergens zin van? Liggen de kamers in de juiste volgorde? Is het dak verbonden met de muren?
  2. De Waterleiding & Elektriciteit (Functionaliteit): Als je de kraan opendraait, komt er dan water uit? Als je de lichtschakelaar omzet, gaat het licht dan aan?

Hoe ze de test hebben gebouwd:
Ze hebben twee enorme collecties echte "foto's van landhuizen" (lange webpagina's) verzameld:

  • 490 "Look-Alike" Tests: Ze namen foto's van zeer lange websites (sommige zo lang dat je wel 30 schermen naar beneden zou moeten scrollen om de onderkant te zien). Ze vroegen AI-modellen om de code voor deze pagina's te recreëren. De test controleerde of de AI de lay-out consistent kon houden van de bovenkant van de pagina tot aan de absolute onderkant.
  • 507 "Do-It" Tests: Ze kozen 129 websites en gaven de AI specifieke taken, zoals "Zoek een vlucht naar Tokio", "Voeg een artikel toe aan de winkelwagen" of "Filter de zoekresultaten". De AI moest code schrijven die deze dingen daadwerkelijk deed in een echte webbrowser, in plaats van alleen maar te doen alsof.

De Resultaten: De "Reality Gap"
Toen ze de beste AI-modellen door deze nieuwe test lieten gaan, ontdekten ze enkele verrassende zaken:

  • Het "Lange Scroll"-probleem: Naarmate de websites langer werden, verslechterde het vermogen van de AI om de structuur correct te houden. Het is alsof een architect een perfecte eerste verdieping kan ontwerpen, maar vergeet hoe de tweede verdieping ermee verbonden moet worden.
  • Het "Nep Huis"-probleem: Veel AI's bouwden websites die er prachtig en realistisch uitzagen (zoals een filmset), maar wanneer je op een knop probeerde te klikken of een formulier wilde invullen, gebeurde er niets. De "waterleidingen" waren kapot.
  • Het Input-probleem: Zelfs toen de onderzoekers de lange foto in kleinere stukjes braken om het de AI makkelijker te maken om te zien, had de AI nog steeds moeite om de stukjes samen te voegen tot een werkend geheel.

De Conclusie
Het artikel concludeert dat we AI niet alleen kunnen beoordelen op hoe mooi hun tekeningen eruitzien. Om echt nuttig te zijn, moet een AI in staat zijn om lange, complexe websites te bouren die ook daadwerkelijk werken wanneer je ermee interacteert. LongWebBench is de nieuwe liniaal die zij gebruiken om dit te meten, en het laat ons zien dat hoewel AI goed wordt in tekenen, het nog een lange weg te gaan heeft voordat het een volledig functioneel digitaal huis kan bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →