← Nieuwste papers
💬 NLP

Information Extraction from Electricity Invoices with General-Purpose Large Language Models

Deze studie toont aan dat voor algemene Large Language Models die informatie uit Spaanse elektriciteitsfacturen halen zonder fine-tuning, de kwaliteit van prompt engineering de kritische factor is die de prestaties bepaalt, waarbij few-shot-strategieën aanzienlijk beter presteren dan zero-shot-baselines en F1-scores van meer dan 96% behalen.

Oorspronkelijke auteurs: Javier Gómez, Javier Sánchez

Gepubliceerd 2026-04-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Javier Gómez, Javier Sánchez

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme stapel elektriciteitsrekeningen van verschillende bedrijven hebt. Sommige zijn netjes en ordelijk, andere zijn rommelig, en ze zien er allemaal iets anders uit. Je doel is om specifieke nummers en namen (zoals "Totale Kosten" of "Klantnaam") uit elk document te halen en ze in een nette spreadsheet te plaatsen.

Jarenlang hadden computers hier moeite mee. Oude programma's waren als stijve robots: als een rekening er zelfs maar een klein beetje anders uitzag dan waarvoor ze waren getraind, raakten ze in de war en faalden ze.

Dit artikel gaat over het leren aan een nieuw soort "super-slimme robot" (een Groot Taalmodel, of LLM) hoe het deze rekeningen moet lezen zonder dat het voor elk nieuw ontwerp opnieuw getraind hoeft te worden. De onderzoekers stelden de vraag: Kunnen we deze slimme robots gewoon de juiste instructies geven, en zullen ze het dan zelf uitzoeken?

Hier is de uiteenzetting van hun bevindingen, met behulp van alledaagse analogieën:

1. Het "Recept" is belangrijker dan de "Chefsmuts"

De onderzoekers testten twee verschillende "chefs" (AI-modellen): Gemini 1.5 Pro (een enorme, complexe chef) en Mistral-small (een kleinere, snellere, efficiëntere chef).

Ze probeerden ook de "kookinstellingen" aan te passen (technische parameters zoals temperatuur en willekeur). Ze verwachtten dat misschien de grotere chef of de perfecte kookinstellingen het grootste verschil zouden maken.

De verrassing: Het maakte niet veel uit welke chef ze gebruikten of hoe ze de instellingen aanpasten. Het verschil in resultaten was minimaal – zoals het verschil tussen een taart die 99% perfect is en een die 99,5% perfect is.

De echte winnaar: De Prompt (de instructies gegeven aan de AI).
Zie de prompt als het recept.

  • Zero-Shot (Geen Recept): Gewoon zeggen "Lees deze rekening en geef me de nummers" is alsof je een chef vraagt te koken zonder recept. De resultaten waren acceptabel (ongeveer 78% nauwkeurig), maar niet geweldig.
  • Few-Shot (Met Voorbeelden): De AI een paar voorbeelden geven van "Hier is een rekening, en hier zijn de gegevens die ik wil" is alsof je de chef een proefgerecht geeft om te kopiëren. De nauwkeurigheid steeg naar meer dan 96%.

De les: Het gaat niet om het hebben van de duurste chef of de meest chique oven; het gaat om het schrijven van een heel goed recept.

2. De "Kopieer" strategie werkt het beste

De onderzoekers probeerden verschillende manieren om voorbeelden te geven:

  • De "One-Shot" methode: Eén voorbeeld tonen. Goed, maar niet het beste.
  • De "Cross-Validation" methode: Dit is de kampioen. Ze lieten de AI drie verschillende soorten rekeningen zien (zoals een tabelvormige, een lijstvormige en een complexe) en vroegen haar vervolgens om een vierde type te lezen dat ze nog nooit had gezien.
    • Resultaat: De AI werd een meester-kopieerder. Ze leerde het concept van een elektriciteitsrekening, niet alleen het uiterlijk van één specifieke rekening. Ze bereikte 97,6% nauwkeurigheid met Gemini en 96,1% met Mistral.

3. Het "Vertaal" probleem

Voordat de AI de rekeningen kon lezen, moesten de onderzoekers de PDF-bestanden omzetten naar tekst (Markdown).

  • De analogie: Stel je voor dat je probeert een handgeschreven notitie te lezen die is gekopieerd door een vuil raam. Als de notitie in een nette tabel staat, komt de tekst helder naar voren. Als de notitie geperst zit in een rommelige, meervoudige kolom-indeling, raakt de tekst door elkaar.
  • De bevinding: De AI was slechts zo goed als de tekst die ze ontving. Als de rekening een schone, tabelachtige indeling had, was de AI bijna perfect. Als de rekening een rommelig, dicht ontwerp had, had de AI moeite omdat de "vertaling" van PDF naar tekst belangrijke aanwijzingen verloor.

4. De "Hallucinatie" valkuil

Ze merkten een persoonlijkheidsverschil op tussen de twee chefs:

  • Gemini (De Voorzichtige Chef): Als ze niet zeker was waar een getal stond, zei ze: "Ik zie het niet." Ze was zeer nauwkeurig, maar miste soms dingen.
  • Mistral (De Zekere Chef): Als ze niet zeker was, gokte ze toch een getal. Ze vond bijna alles (hoge "Recall"), maar bedacht ook getallen die er niet waren (lage "Precision").
  • De conclusie: Als je 100% zeker wilt zijn dat het getal echt is, wil je de voorzichtige chef. Als je alles wilt vinden en de antwoorden later kunt controleren, is de zekere chef acceptabel.

5. De oude robots verslaan

Het artikel vergelijkt deze nieuwe AI-chefs met de oude-school "robots" (traditioneel Machine Learning).

  • De oude robot: Als je deze trainde op Rekeningtype A, kon deze Rekeningtype A perfect lezen (91% nauwkeurigheid). Maar als je haar Rekeningtype B gaf, crashte en brandde ze (daling naar 67% nauwkeurigheid). Ze had het uiterlijk van het papier gememoriseerd, niet de betekenis.
  • De nieuwe AI: Deze hoefde niet getraind te worden op Rekeningtype B. Omdat ze het concept van een elektriciteitsrekening begreep, las ze de nieuwe types met meer dan 95% nauwkeurigheid. Ze generaliseerde de vaardigheid in plaats van het patroon te memoriseren.

Samenvatting

Het artikel concludeert dat je om een computer perfect bedrijfsdocumenten te laten lezen, geen op maat gemaakt brein hoeft te bouwen voor elk enkel documenttype. In plaats daarvan hoef je alleen maar betere instructies te schrijven en haar een paar goede voorbeelden te tonen.

De "geheime saus" is niet de grootte van het AI-model of de complexe wiskundige instellingen; het is de kwaliteit van de prompt (de instructies) en hoe goed het document is omgezet naar tekst voor de AI om te lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →