← Nieuwste papers
💬 NLP

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

Dit artikel introduceert DataGovBench, een nieuwe benchmark afgeleid van overheidsopen data die Large Language Models evalueert op complexe tabel-QA en exploratieve inzichtstaken, waarbij significante prestatiekloven tussen huidige modellen en de eisen van real-world data-analyse aan het licht worden gebracht.

Oorspronkelijke auteurs: So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, breed opgeleide robotassistent hebt. Je hebt hem getraind op miljoenen boeken, nieuwsartikelen en websites. Hij kan poëzie schrijven, films samenvatten en trivia-vragen over geschiedenis beantwoorden. Je zou kunnen denken: "Geweldig! Laten we deze robot vragen om mijn bedrijfsverkoopgegevens of de verkeersgegevens van de stad te analyseren."

Maar volgens dit artikel, als je die robot een echte, rommelige stapel gegevens geeft, struikelt hij vaak over zijn eigen voeten.

De auteurs van dit artikel, onderzoekers van Fujitsu, besloten deze theorie te testen. Ze bouwden een nieuwe "examen" genaamd DataGovBench om te zien hoe goed Large Language Models (LLM's) werkelijk omgaan met data-analyse in de echte wereld.

Hier is een overzicht van hun bevindingen met behulp van eenvoudige analogieën:

1. Het Probleem: Het "Leerboek" versus de "Wilde Natuur"

De meeste eerdere tests voor deze AI-modellen waren als het maken van een wiskundetoets in een stille klas. De problemen waren klein, de cijfers waren schoon en de regels waren duidelijk.

  • De Realiteit: Real-world data is als een chaotische keuken na een dinerfeest. Er liggen enorme stapels bonnetjes (miljoenen rijen), briefjes met instructies (metadata) en recepten van verschillende chefs (externe kennis) overal verspreid.
  • De Kloof: Het artikel stelt dat huidige AI-modellen geweldig zijn in de "klasstoets", maar falen in de "chaotische keuken". Ze hebben moeite met het verbinden van verschillende tafels, het begrijpen van de context of het vinden van verborgen patronen zonder in de war te raken.

2. Het Nieuwe Examen: DataGovBench

Om dit op te lossen, creëerden de onderzoekers een nieuw benchmark met behulp van overheidsopen data (zoals gemeentelijke bouwrecords of gezondheidsstatistieken). Deze data is rommelig, enorm groot en vereist externe kennis om begrepen te worden.

Ze testten de AI op twee specifieke taken:

  • Taak A: De "Specifieke Vraag" (Table QA)

    • De Analogie: Stel dat je de robot vraagt: "Hoeveel gebouwen in Boston zijn na 2010 gebouwd, en laat me een grafiek zien van hun hoogtes."
    • De Uitdaging: De robot moet het juiste bestand vinden, de verkeerde jaren eruit filteren, de berekening uitvoeren en de afbeelding tekenen.
    • Het Resultaat: Zelfs de slimste robots gingen dit in 60-70% van de gevallen fout. Ze vergaten vaak te filteren op "totaal" tellingen wanneer ze naar "mannelijke" en "vrouwelijke" tellingen apart keken, of ze raakten in de war door verschillende datumformaten.
  • Taak B: Het "Detectiewerk" (Table Insight)

    • De Analogie: In plaats van een specifieke vraag te stellen, geef je de robot gewoon een stapel data en zeg je: "Vertel me wat hier interessant is."
    • De Uitdaging: De robot moet handelen als een menselijke analist, zoekend naar trends, verrassingen of verhalen die verborgen liggen in de cijfers.
    • Het Result resultaat: De robots waren slecht in dit werk. Ze konden het algemene onderwerp wel benoemen (bijv. "Radongasniveaus"), maar ze faalden in het uitleggen waarom het ertoe deed of het geven van de specifieke cijfers die hun punt bewezen. Ze klonken alsoer ze gokten in plaats van te analyseren.

3. Het "Agent" Experiment

De onderzoekers probeerden de robots te helpen door ze een "gereedschapsriem" te geven (een Agentic Framework genoemd). In plaats van alleen maar te gokken, werd de robot geprogrammeerd om:

  1. Een computerscript (Python-code) te schrijven om de berekening te doen.
  2. Het script uit te voeren.
  3. Zijn eigen werk te controleren. Als het script crashte of het resultaat er vreemd uitzag, zou hij proberen de code te herstellen en het opnieuw uit te voeren.

Werkte het?
Ja, maar slechts een beetje. Het was alsof je een leerling een rekenmachine gaf; hun scores gingen omhoog, maar ze konden nog steeds de moeilijkste problemen niet oplossen. De beste modellen faalden nog steeds meer dan de helft van de tijd.

4. Waar Faalden Ze?

Het artikel identificeerde twee belangrijke "superkrachten" die huidige AI mist:

  • Narratieve Redenering: De AI kan een getal vinden, maar kan dat getal niet verweven in een logisch verhaal of argument. Het is alsof je een lijst met ingrediënten hebt, maar niet weet hoe je een maaltijd kookt.
  • Feiten ophalen (Fact Retrieval): Wanneer de data enorm en rommelig is, grijpt de AI vaak het verkeerde getal of de verkeerde tabel, wat leidt tot een zelfverzekerd maar volkomen foutief antwoord.

De Kernboodschap

Het artikel concludeert dat hoewel AI geweldig is in chatten en schrijven, het nog niet klaar is om een betrouwbare data-analist te zijn voor real-world, rommelige situaties.

De onderzoekers hebben dit "DataGovBench" examen gebouwd om de wereld precies te laten zien waar de robots falen, in de hoop dat toekomstige AI-ontwikkelaars zich op het oplossen van deze specifieke zwakheden zullen richten voordat we hen vertrouwen met onze kritieke data.

Kortom: We hebben een zeer slimme robotbibliothecaris gebouwd, maar we wachten nog op een robotboekhouder die daadwerkelijk de administratie kan doen zonder een puinhoop te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →