← Nieuwste papers
📊 statistics

Flaws in the LLM Automation Narrative

Dit artikel daagt het narratief uit dat Large Language Models de prestaties van menselijke experts evenaren door via een nieuwe programmeerbenchmark aan te tonen dat mensen de voorheen grensverleggende LLM's overtreffen in zowel gemiddelde nauwkeurigheid als consistentie, terwijl het tegelijkertijd de kritieke noodzaak benadrukt om de foutgrootte en responsvariantie te evalueren in plaats van uitsluitend te vertrouwen op standaard benchmarks.

Oorspronkelijke auteurs: George Perrett, Javae Elliott, Jennifer Hill, Marc Scott

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: George Perrett, Javae Elliott, Jennifer Hill, Marc Scott

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Perfecte Student" versus de "Echte Wereld"

Stel je een student voor die het antwoordmodel van elke oefentoets die hij ooit heeft gemaakt, uit zijn hoofd heeft geleerd. Op die specifieke toetsen haalt hij telkens een 100%. De schoolbesturen (en de technologiebedrijven die de diensten van de student verkopen) beweren dat deze student een genie is die alle leraren en artsen kan vervangen.

Dit paper betoogt dat deze student eigenlijk een bedrieger is. Hij lijkt alleen slim omdat hij de vragen al eerder heeft gezien. Wanneer je hem een gloednieuwe, lastige opdracht geeft die hij niet uit zijn hoofd heeft geleerd, maakt hij niet alleen kleine foutjes; hij maakt soms catastrofale fouten, en hij is extreem inconsistent.

Het Experiment: Een Kookwedstrijd met een Twist

Om dit te testen, zetten de onderzoekers een unieke "kookwedstrijd" op.

  • De Uitdaging: Ze moesten een computerprogramma (een recept) schrijven om 7.700 verschillende datasets (ingrediënten) te analyseren om een specifieke waarheid te vinden (de smaak).
  • De Regels: De deelnemers mochten de werkelijke data vooraf niet zien. Ze kregen alleen een geschreven instructiehandleiding. Dit zorgde ervoor dat de "studenten" de antwoorden niet simpelweg konden memoriseren.
  • De Deelnemers:
    1. Menselijke Experts: Een team van statistici op PhD-niveau (de meesterchefs).
    2. De AI: Een topniveau Large Language Model (LLM) genaamd ChatGPT Codex 5.2 (de robotchef).
    3. De Strategie van de AI: De onderzoekers vroegen de AI om 20 verschillende "recepten" (scripts) te schrijven om hetzelfde probleem op te lossen, puur om te zien of hij consistent kon zijn.

Wat Ze Vonden: De "Catastrofale Verbranding"

De resultaten waren schokkend. Ho'ewel de AI soms een degelijk maaltijd bereidde, faalde hij op manieren waarop mensen dat nooit zouden doen.

1. Het "Verbrand tot de Korst"-probleem (Grootte van de fouten)
In een normale test, als je een vraag fout hebt, verlies je een paar punten. In deze wedstrijd verloor de AI niet alleen punten; soms zette hij de hele keuken in brand.

  • De Analogie: Stel je een menselijke chef voor die per ongeluk een beetje te veel zout in de soep doet. Dat is een kleine fout. De AI voegde echter soms zoveel zout toe dat het de hele oceaan zou kunnen vullen, of erger nog, het verwijderde de volledige database aan ingrediënten.
  • De Realiteit: Sommige scripts van de AI produceerden fouten die zo enorm waren dat ze miljarden keren groter waren dan de fouten gemaakt door mensen. Het paper merkt op dat in één instantie de fout van de AI gelijk stond aan "100 miljard standaarddeviaties". Om dat in perspectief te plaatsen: een verschil van 0,8 wordt in de wetenschap beschouwd als een "groot" effect. De AI zat er miljarden malen naast.

2. Het "Achtbaan"-probleem (Variantie)
Als je een menselijke expert vraagt om hetzelfde probleem 20 keer op te lossen, zullen hun antwoorden erg vergelijkbaar zijn. Zij zijn betrouwbaar.

  • De Analogie: Als je een menselijke chef vraagt om 20 keer een taart te maken, maakt hij misschien 20 licht verschillende taarten, maar ze zullen allemaal eetbaar zijn. Als je de AI-chef vraagt om dezelfde taart 20 keer te maken, krijg je misschien:
    • 10 perfecte taarten.
    • 5 taarten die slechts uit rauwe bloem bestaan.
    • 3 taarten die in brand staan.
    • 2 taarten die eigenlijk een afbeelding van een taart zijn.
  • De Realiteit: De prestaties van de AI waren ongelooflijk instabiel. Het ene script werkte misschien goed, en het volgende (seconden later gegenereerde) script zou volledig falen. Deze "stochastiek" (willekeur) betekent dat je de AI niet twee keer achter elkaar hetzelfde werk kunt laten doen.

3. Het "Valsspelen"-probleem (Contaminatie van Benchmarks)
Het paper betoogt dat de meeste AI-tests gemanipuleerd zijn.

  • De Analogie: Het is alsoverst een wiskundetoets afnemen aan een student met een toets die op hetzelfde papier is geprint als het papier dat de student gebruikte tijdens het studeren. De student haalt een A, maar hij heeft geen wiskunde geleerd; hij heeft gewoon de toets uit zijn hoofd geleerd.
  • De Realiteit: Veel populaire AI-benchmarks gebruiken vragen die de AI al heeft gezien tijdens zijn training. Wanneer de onderzoekers een "schone" test gebruikten (de 2016 competitiedata) die de AI waarschijnlijk nog niet had gezien, daalde de prestatie van de AI aanzienlijk vergeleken met de mensen.

Het Verdict: Geen Vervanging, Maar een Riskant Instrument

Het paper concludeert dat het narratief dat beweert dat "AI net zo goed is als een menselijke expert" gebrekkig is, omdat het twee cruciale zaken negeert:

  1. Hoe slecht de fouten zijn: Mensen maken kleine, beheersbare fouten. AI maakt zeldzame maar "apocalyptische" fouten die systemen kunnen vernietigen.
  2. Hoe inconsistent de AI is: Mensen zijn betrouwbaar. De AI is een gok.

De Belangrijkste Les:
De onderzoekers ontdekten dat hoewel de AI soms een menselijke expert kon imiteren (vooral wanneer het gebruik maakte van door mensen vooraf ontwikkelde tools), het niet in staat was om consistent zelfstandig werk te verrichten. Het vertrouwen op AI voor taken met een hoge inzet is als het inhuren van een chauffeur die geweldig kan rijden op zonnige dagen, maar af en toe zonder reden besluit van een klif af te rijden.

Het paper zegt niet dat AI nutteloos is. Het zegt dat de huidige hype negeert dat AI onbetrouwbaar is en vatbaar is voor enorme, onvoorspelbare fouten, wat het een gevaarlijke vervanging maakt voor menselijke experts in kritieke velden zoals financiën, recht en geneeskunde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →