← Nieuwste papers
💬 NLP

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

Dit paper introduceert StructEval, een uitgebreide benchmark die de prestaties van grote taalmodellen evalueert bij het genereren van diverse gestructureerde outputformaten via generatie- en conversietaken, waarbij de resultaten aanzienlijke prestatiekloven tussen state-of-the-art en open-source modellen aantonen.

Oorspronkelijke auteurs: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu
Gepubliceerd 2026-04-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu, Quy Duc Do, Ziyan Jiang, Ping Nie, Wenhu Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat Large Language Models (LLMs) zoals GPT-4 of Llama niet alleen slimme praters zijn, maar ook bouwmeesters. Tot nu toe hebben we vooral gekeken of ze mooie verhalen kunnen vertellen of moeilijke vragen kunnen beantwoorden. Maar in de echte wereld, in softwareontwikkeling en data-analyse, is het vaak niet genoeg om gewoon "iets" te zeggen. Je hebt precieze blauwdrukken nodig.

Deze paper introduceert StructEval, een nieuwe test die kijkt of deze AI's echt kunnen bouwen volgens de regels, en niet alleen maar klinken alsof ze het kunnen.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Leuke Verhaaltjes" vs. De "Strakke Bouwplaat"

Stel je voor dat je een architect vraagt om een huis te ontwerpen.

  • De oude test: De architect schrijft een prachtig gedicht over het huis. Het klinkt mooi, maar als je erin gaat wonen, vallen de muren in elkaar omdat de balken niet op de juiste plek zitten.
  • De nieuwe test (StructEval): We vragen de architect niet om een gedicht, maar om een exacte bouwtekening in een specifieke taal (zoals JSON, HTML of React). De muren moeten op de centimeter precies staan, en de deur moet op de juiste plek zitten. Als de AI ook maar één haakje verkeerd zet, is het hele huis onbewoonbaar.

De auteurs zeggen: "Onze huidige AI's zijn geweldig in het schrijven van gedichten, maar ze struikelen vaak over de bouwplaten."

2. Wat is StructEval? De "Superkeuring"

StructEval is een enorme testbank met 44 verschillende soorten taken en 18 verschillende bouwstijlen (formaten). Het is verdeeld in twee hoofdkamers:

  • De "Stille" Kamer (StructEval-T): Hier moet de AI tekstuele data omzetten in strakke lijsten en tabellen, zoals JSON, YAML of CSV.
    • Vergelijking: Het is alsof de AI een recept moet omzetten in een perfecte, gestructureerde boodschappenlijst. Als je "2 eieren" schrijft in plaats van "2", of de lijst niet alfabetisch sorteert, faalt de test.
  • De "Visuele" Kamer (StructEval-V): Hier moet de AI code schrijven die direct zichtbaar wordt, zoals HTML, React, SVG of LaTeX.
    • Vergelijking: De AI moet niet alleen zeggen "maak een rode knop", maar daadwerkelijk de code schrijven zodat de knop op het scherm verschijnt, rood is, en op de juiste plek staat. Als de knop grijs is of uit het beeld valt, is het een mislukking.

3. Hoe testen ze dit? De "Twee-Deurs" Methode

De test kijkt op twee manieren of de AI het goed doet:

  1. De Vertaaltaak (Conversion): Je geeft de AI een bestaande bouwplaat in het Nederlands en vraagt: "Zet dit om naar Engels."
    • Resultaat: Dit gaat vaak goed. Het is als een tolk die een bestaand verhaal vertaalt.
  2. De Creatie-taak (Generation): Je zegt: "Bouw een huis met een rode deur en een blauwe tuin."
    • Resultaat: Dit is veel moeilijker. De AI moet zelf de blauwdruk bedenken. Hier zakken de meeste AI's door de bodem.

De "Visuele Vraagbaan" (VQA):
Voor de visuele taken gebruiken ze een slimme truc. Ze laten de gegenereerde code een plaatje maken, en dan sturen ze een andere AI (een "visuele detective") om vragen te stellen over dat plaatje.

  • Vraag: "Hoeveel rijen heeft de tabel?"
  • Antwoord: "3".
  • Check: Kijkt de detective naar het plaatje en ziet hij 3 rijen? Zo ja, goed gedaan! Zo nee, de AI heeft gelogen.

4. De Resultaten: De "Gouden Medaille" is nog ver weg

De test heeft 12 verschillende AI-modellen getest, van de goedkoopste open-source modellen tot de duurste, slimste commerciële modellen (zoals OpenAI's o1-mini).

  • De top: Zelfs de allerbeste AI (o1-mini) haalde maar 75,58 punten op 100. Dat klinkt hoog, maar in de wereld van software betekent 25 punten fouten vaak dat een hele website crasht.
  • De kloof: De beste open-source modellen (zoals Qwen3) zaten ongeveer 10 punten lager dan de dure commerciële modellen. Het is alsof de dure modellen een Ferrari hebben en de open-source modellen een fiets, terwijl ze beide dezelfde race moeten rijden.
  • De moeilijkste taken: Het bouwen van complexe diagrammen (zoals Mermaid of TikZ) of het omzetten van specifieke dataformaten (zoals CSV naar YAML) was voor bijna niemand goed te doen. Het was alsof je de AI vroeg om een kathedraal te bouwen terwijl ze net leren hoe je een huisje van blokken maakt.

5. Waarom is dit belangrijk?

Vandaag de dag gebruiken bedrijven AI om code te schrijven, data te verwerken en websites te bouwen. Als die AI's niet perfect kunnen bouwen volgens de regels, ontstaan er:

  • Websites die niet werken.
  • Data-pipelines die vastlopen.
  • Fouten in financiële rapporten.

Conclusie:
De auteurs zeggen met deze paper: "We moeten stoppen met alleen te kijken of AI's leuk praten. We moeten kijken of ze nuttig kunnen bouwen." De huidige AI's zijn nog niet klaar voor de zware bouwklus, maar met deze nieuwe test (StructEval) weten we precies waar ze moeten oefenen.

Kortom: StructEval is de rijbewijstest voor AI's om te zien of ze echt kunnen autorijden, en niet alleen maar toeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →