← Nieuwste papers
💬 NLP

LLMStructBench: Benchmarking Large Language Model Structured Data Extraction

Dit paper introduceert LLMStructBench, een nieuw benchmark voor het evalueren van het vermogen van grote taalmodellen om gestructureerde JSON-data te extraheren, waarbij wordt vastgesteld dat de keuze van de promptstrategie belangrijker is dan het modelgrootte voor het garanderen van structurele validiteit.

Oorspronkelijke auteurs: Sönke Tenckhoff, Mario Koddenbrock, Erik Rodner

Gepubliceerd 2026-02-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sönke Tenckhoff, Mario Koddenbrock, Erik Rodner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt vol met rommelige, handgeschreven briefjes van mensen. Op sommige briefjes staat: "Ik wil graag een laptop lenen, mijn naam is Jan, en ik heb hem nodig tot vrijdag." Op andere briefjes staat een wirwar van zinnen over een ziekteverlof of een projectverlenging.

Jouw doel is om al die rommelige tekst om te zetten in een strakke, digitale lijst (een JSON-bestand) die een computer direct kan begrijpen en verwerken. Bijvoorbeeld: {"naam": "Jan", "item": "laptop", "datum": "vrijdag"}.

Dit is precies wat LLMStructBench onderzoekt. Het is een test voor de slimste kunstmatige intelligenties (LLMs) om te zien hoe goed ze die rommelige tekst in een strakke lijst kunnen zetten.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Vertaler" die soms hallucineert

Stel je voor dat je een vertaler hebt die heel goed Engels spreekt, maar als je hem vraagt om een recept in een strakke tabel te zetten, doet hij soms raar.

  • Soms schrijft hij de hele tabel in een verhaal (de computer kan het niet lezen).
  • Soms vergeet hij een ingrediënt (de lijst is incompleet).
  • Soms schrijft hij "suiker" in plaats van "zout" (de structuur klopt, maar de inhoud is fout).

De auteurs van dit paper zeggen: "We weten niet precies welke vertaler het beste is, of of het helpt als je de vertaler een heel strakke sjabloon geeft."

2. De Test: Een "Kookwedstrijd" met 22 Chefs

Om dit uit te zoeken, hebben de onderzoekers een enorme wedstrijd georganiseerd:

  • De Ingrediënten: Ze hebben 995 verschillende scenario's gemaakt (zoals een klacht over een defecte printer, een ziekteverlofaanvraag, of een vergaderinschrijving).
  • De Chefs: Ze hebben 22 verschillende AI-modellen uitgenodigd (van kleine, snelle modellen tot gigantische, dure modellen).
  • De Sjablonen: Ze hebben de chefs verschillende instructies gegeven. Sommigen kregen alleen een simpele zin: "Zet dit in een lijstje." Anderen kregen een heel gedetailleerd bouwplan met voorbeelden.

3. De Grote Ontdekking: De Chef is minder belangrijk dan het Recept!

Dit is het meest verrassende resultaat van de paper. Je zou denken dat de grootste, duurste AI (de "Superchef") altijd het beste zou zijn. Maar dat bleek niet zo te zijn.

  • De Analogie: Het is alsof je een beroemde kok vraagt om een cake te bakken. Als je hem alleen zegt: "Maak een cake," maakt hij misschien een rommelige brij. Als je hem echter een perfect recept geeft met foto's van hoe de cake eruit moet zien, maakt hij zelfs met minder ervaring een perfecte cake.
  • De Conclusie: De manier waarop je de AI vraagt (de "prompt-strategie") is belangrijker dan hoe groot of slim de AI zelf is. Een klein model met het juiste recept deed het vaak beter dan een groot model met een slecht recept.

4. Twee Soorten Fouten: De "Lege Bak" vs. De "Verkeerde Ingrediënt"

De onderzoekers keken naar twee soorten fouten:

  1. Structuurfouten (De lege bak): De AI gaf helemaal geen lijstje, of het lijstje was zo kapot dat de computer het niet kon openen. Dit is een ramp voor een computer.
  2. Inhoudsfouten (Het verkeerde ingrediënt): De AI gaf een perfect lijstje, maar schreef "suiker" in plaats van "zout". De computer kan het bestand wel openen, maar het resultaat is verkeerd.

Wat ze zagen:

  • Als je de AI heel strikt instructies geeft (het "PJ+" recept), krijg je bijna altijd een perfect lijstje (geen structuurfouten).
  • MAAR: De AI maakt dan vaker inhoudsfouten. Het lijkt alsof de AI zo gefocust is op het volgen van de regels, dat hij soms de betekenis van de tekst een beetje kwijtraakt.
  • Als je de AI vrijer laat (het "P" recept), maakt hij vaker structuurfouten (geen lijstje), maar als hij er wel een maakt, is de inhoud vaak beter.

5. De Grootte van de AI: Meer is niet altijd beter

Je zou denken: "Hoe groter de AI, hoe slimmer."

  • Bij het begrijpen van tekst (inhoud) helpt een grotere AI zeker.
  • Maar bij het volgen van regels (het maken van een perfect lijstje) maakt de grootte minder uit dan je denkt. Een klein model dat goed getraind is op het volgen van instructies, kan een gigantisch model verslaan.

Samenvatting voor de Praktijk

Stel je voor dat je een bedrijf runt en je wilt AI gebruiken om e-mails om te zetten in bestellingen.

  • Koop niet direct de duurste, grootste AI.
  • Investeer in het vinden van de juiste instructies. Leer de AI precies hoe je het bestandje wilt zien.
  • Wees voorzichtig: Als je de AI dwingt om perfect te zijn, kan hij soms de inhoud verdraaien. Je moet misschien een extra controle toevoegen om te kijken of de "suiker" wel echt "suiker" is.

Kortom: In de wereld van AI is het niet alleen belangrijk wie je hebt (het model), maar vooral hoe je met hem praat (de prompt). Een goed gesprek is vaak belangrijker dan een groot brein.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →