← Nieuwste papers
💻 computer science

UIBenchKit: A unified toolkit for design-to-code model evaluation

Dit artikel introduceert UIBenchKit, een open-source, geünificeerde toolkit die het gebrek aan gestandaardiseerde evaluatie in design-naar-code-generatie aanpakt door een plug-and-play-omgeving te bieden voor eerlijke benchmarking, consistente metriekanalyse en versnelde innovatie in webengineering.

Oorspronkelijke auteurs: Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo

Gepubliceerd 2026-05-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een prachtige tekening van een website hebt (een "mockup") en je wilt dat een computer die afbeelding direct omzet in de daadwerkelijke code die de website doet werken. Dit heet "Design-to-Code". In de afgelopen jaren zijn AI-modellen hier steeds beter in geworden, maar er is een groot probleem: iedereen speelt volgens andere regels.

Sommige onderzoekers gebruiken één set instructies, anderen gebruiken een ander computerprogramma om de resultaten te controleren, en weer anderen gebruiken verschillende soorten AI-hersenen. Het is alsof je probeert de snelheid van twee raceauto's te vergelijken, maar de ene rijdt op een nat circuit en de andere op een zonnige snelweg. Je kunt niet zeggen welke auto echt sneller is.

UIBenchKit is de oplossing die de auteurs hebben gebouwd om deze rommel op te lossen. Denk eraan als een "Universeel Racecircuit en Scorebord" voor AI-websitebouwers.

Hier is hoe het werkt, met eenvoudige analogieën:

1. Het Universele Racecircuit (De Toolkit)

Voordat UIBenchKit bestond, moest je als je een nieuwe AI wilde testen, je eigen testlaboratorium vanaf de grond opbouwen. UIBenchKit is een kant-en-klaar, plug-and-play laboratorium.

  • De Opstelling: Je plaatst je website-tekening (de invoer) in het systeem.
  • De Bestuurders: Je kunt verschillende AI-modellen (de "bestuurders") en verschillende coderingsstrategieën (de "bestuurstechnieken") inwisselen.
  • De Regels: De toolkit dwingt elke AI om op precies hetzelfde circuit te rijden, onder exact dezelfde omstandigheden. Het regelt alle rommelige technische opzet zodat onderzoekers dat niet zelf hoeven te doen.

2. Het Scorebord (De Analyse)

Zodra de AI klaar is met het bouwen van de website, zegt UIBenchKit niet zomaar "Goed gedaan" of "Slecht gedaan". Het fungeert als een superprecieze scheidsrechter met een vergrootglas. Het controleert het resultaat op drie manieren:

  • De "Op-Elkaar-Lijkt"-Test: Ziet de uiteindelijke website eruit als de originele tekening? (Visuele gelijkenis).
  • De "Blauwdruk"-Test: Is de code-structuur correct? (Structurele nauwkeurigheid).
  • De "Brandstofmeter"-Test: Hoeveel "hersencapaciteit" (rekenkosten) heeft de AI gebruikt om de klus te klaren?

De toolkit geeft je een dashboard waar je vergelijkingen naast elkaar kunt zien, zodat je precies kunt zien welke AI het beste is in welke taak.

3. De Grote Race (De Studie)

De auteurs hebben niet alleen het circuit gebouwd; ze hebben er daadwerkelijk een enorme race op laten rijden om te zien wie wint. Ze hebben getest:

  • 16 verschillende AI-modellen (inclusief grote namen zoals GPT, Claude en Gemini).
  • 5 verschillende coderingsstrategieën (sommige AI's proberen de hele code in één keer te schrijven, terwijl anderen de afbeelding in kleine stukjes breken en het stukje voor stukje bouwen).
  • Honderden website-ontwerpen.

Wat hebben ze ontdekt?

  • De "Stukje voor Stukje"-Strategie: Het breken van een complexe website in kleinere stukjes (zoals het in elkaar zetten van een Lego-set) werkt over het algemeen beter voor ingewikkelde ontwerpen. Het helpt de AI zich te focussen op kleine details.
  • De "Glitch" in het Systeem: Het grootste probleem is niet het vermogen van de AI om code te schrijven, maar het vermogen van de AI om de afbeelding correct op te delen. Als de AI verkeerd interpreteert waar een knop begint of eindigt in de afbeelding, wordt de hele website verkeerd gebouwd. Het is alsof een chef-kok een maaltijd probeert te bereiden maar de maten in het recept verkeerd leest.
  • De Afweging: Hoewel het opsplitsen van dingen helpt, creëert het een nieuw probleem: als de eerste stap (het opdelén van de afbeelding) iets verkeerd is, wordt die fout versterkt naarmate de AI de rest van de site bouwt.

De Conclusie

UIBenchKit is een tool die eerlijkheid en duidelijkheid brengt in de wereld van AI-websitebouw. Het stopt onderzoekers met ruziën over wie de "beste" AI heeft, door iedereen dezelfde test te geven. De auteurs hopen dat door gebruik te maken van dit duidelijke scorebord, toekomstig onderzoek zich zal richten op het oplossen van de echte knelpunt: het AI leren de structuur van afbeeldingen beter te begrijpen voordat het probeert de code te schrijven.

De toolkit is open voor iedereen om te gebruiken, net als een openbaar park, zodat onderzoekers samen kunnen blijven testen en deze tools kunnen verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →