← Nieuwste papers
💬 NLP

Large Language Models are Algorithmically Blind

Deze studie concludeert dat grote taalmodellen lijden aan 'algoritmische blindheid' doordat ze, ondanks hun uitgebreide kennis, systematisch falen in het redeneren over computationele processen en het voorspellen van algoritme-uitkomsten, wat wijst op een fundamenteel gat tussen declaratieve kennis en procedurele voorspelling.

Oorspronkelijke auteurs: Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote

Gepubliceerd 2026-03-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🕵️‍♂️ De "Rekenkundige Blindheid" van AI: Waarom slimme chatbots slechte voorspellers zijn

Stel je voor dat je een grote, zeer geleerde bibliotheek hebt (zoals een Large Language Model of LLM). Deze bibliotheek heeft miljoenen boeken gelezen over wiskunde, computers en hoe algoritmes werken. Als je vraagt: "Wat is een algoritme?", geeft deze bibliotheek een perfect antwoord.

Maar wat gebeurt er als je vraagt: "Als ik dit specifieke algoritme gebruik op dit specifieke probleem, hoeveel procent kans is het dat het werkt?"

Volgens dit nieuwe onderzoek is het antwoord: De bibliotheek is dan blind.

De onderzoekers noemen dit "Algorithmic Blindness" (Rekenkundige Blindheid). Het betekent dat deze AI-modellen wel weten hoe een algoritme in theorie werkt, maar er totaal geen flauw idee van hebben hoe het zich in de praktijk gaat gedragen. Ze kunnen geen betrouwbare voorspelling doen.

🎯 De Grote Test: Een Voorspellingsspel

Om dit te bewijzen, hebben de onderzoekers een grote test opgezet. Ze hebben 8 van de slimste AI-modellen ter wereld (zoals GPT-5, Claude, Gemini) een spel laten spelen:

  1. Het Scenario: Ze gaven de AI een beschrijving van een dataset (bijvoorbeeld medische gegevens of een stroomnetwerk) en een algoritme (een rekenmethode).
  2. De Vraag: "Geef ons een bereik. Bijvoorbeeld: 'De nauwkeurigheid ligt ergens tussen 60% en 90%'."
  3. De Realiteit: De onderzoekers draaiden die algoritmes 100 keer op een computer om de echte uitkomst te weten. Dit is de "grondwaarheid".

📉 De Schokkende Resultaten

Het resultaat was verpletterend voor de AI:

  • De AI is vaak fout: In 84% van de gevallen zat het echte antwoord niet in het bereik dat de AI voorspelde.
  • Slechter dan gokken: Zeven van de acht AI-modellen deden het slechter dan een willekeurige gok. Als je een dobbelsteen had gegooid om een bereik te kiezen, was dat waarschijnlijk nauwkeuriger geweest dan de slimme AI.
  • De "Veilige" leugen: De AI's gaven wel bereiken, maar ze waren absurd breed. Ze zeiden bijvoorbeeld: "De nauwkeurigheid ligt tussen 0% en 100%." Dat is technisch gezien een bereik, maar het is net zo nuttig als een weersvoorspelling die zegt: "Het kan regenen of het kan zonnig zijn." Het zegt je niets.

🧠 Waarom gebeurt dit? (De Analogie van de Reiziger)

Stel je een toerist voor die een reisgids heeft gelezen over Parijs.

  • De Toerist (De AI): Kan perfect vertellen dat het Eiffeltoren hoog is, dat de Eiffeltoren in Parijs staat en dat je er een ticket voor moet kopen. Hij heeft de feitelijke kennis.
  • De Realiteit: Als je vraagt: "Hoe lang duurt het om de Eiffeltoren te beklimmen als het regent en er 5000 mensen zijn?", raakt de toerist in paniek. Hij heeft de gids gelezen, maar hij heeft nooit zelf de trap opgelopen. Hij heeft geen gevoel voor de echte ervaring.

De AI's hebben de "gids" (de boeken over algoritmes) gelezen, maar ze hebben nooit zelf de "trap opgelopen" (de algoritmes duizenden keren laten draaien op echte data). Ze herinneren zich alleen wat er in de boeken staat, in plaats van het begrijpen.

🔍 Het Bewijs: Herhaling vs. Begrip

De onderzoekers vonden drie sterke bewijzen dat de AI's gewoon dingen uit hun geheugen halen in plaats van na te denken:

  1. Het "Bekende vs. Onbekende" effect: De AI's deden het iets beter op bekende datasets (die ze uit hun training hadden) en faalden volledig op nieuwe, synthetische datasets. Het is alsof de toerist de Eiffeltoren kent, maar als je vraagt naar een onbekend kerkje in een dorp, hij totaal verdwaalt.
  2. De "Grootte"-valstrik: Hoe groter en complexer het probleem werd, hoe slechter de AI werd. Bij simpele problemen gisten ze nog, maar bij complexe netwerken (met 60 punten) werden hun voorspellingen volledig willekeurig. Een echt slimme denker zou zeggen: "Dit is complex, dus ik ben minder zeker." De AI's gaven juist heel specifieke, maar foute antwoorden.
  3. De "Groepsdruk" test: Als je 8 verschillende AI's vraagt om een antwoord op een bekend probleem, geven ze allemaal ongeveer hetzelfde antwoord (ze "lezen" uit dezelfde boeken). Maar als je ze een nieuw probleem geeft, geven ze allemaal totaal verschillende, willekeurige antwoorden. Dit bewijst dat ze geen onderliggende logica hebben, maar alleen feiten uit hun geheugen halen.

💡 Wat betekent dit voor ons?

Dit onderzoek is een grote waarschuwing voor iedereen die hoopt dat AI ons helpt bij het kiezen van de beste computerprogramma's.

  • Geen "Zwarte Doos" voorspellers: Je kunt AI niet vertrouwen om te zeggen: "Gebruik algoritme X, dat werkt vast goed."
  • Testen is nog steeds nodig: Omdat AI's "blind" zijn voor de echte prestaties van algoritmes, moeten mensen (of computers) de algoritmes nog steeds zelf uitproberen. AI kan helpen met het uitleggen van de theorie, maar niet met het voorspellen van de uitkomst.

Kortom: Deze AI-modellen zijn als een uitstekende theorie-docent die nooit een examen heeft gehaald. Ze kunnen perfect uitleggen hoe een examen eruit moet zien, maar als ze zelf moeten rekenen, zakken ze. Ze zijn niet dom, ze zijn gewoon blind voor de praktijk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →