← Nieuwste papers
🤖 AI

Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances

Het artikel introduceert het LAPITHS-kader om de theoretische geldigheid van beweringen dat AI-modellen zoals CENTAUR menselijke cognitie bezitten, aan te vechten en betoogt daarentegen dat hun prestaties voortkomen uit behavioristische patronen in plaats van echte cognitieve plausibiliteit.

Oorspronkelijke auteurs: Matteo Da Pelo, Alessio Donvito, Claudio Frongia, Pietro Salis, Antonio Lieto

Gepubliceerd 2026-05-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Matteo Da Pelo, Alessio Donvito, Claudio Frongia, Pietro Salis, Antonio Lieto

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Centaur" versus de "Lapithen"

Stel je een nieuwe, superintelligente AI voor met de naam Centaur. De makers beweren dat het een "Geïntegreerd Model van Cognitie" is. In gewone taal zeggen ze: "We hebben deze AI zo perfect geleerd menselijk gedrag na te bootsen, dat het wel als een mens moet denken. Het is niet zomaar een rekenmachine; het is een digitaal brein."

De auteurs van dit artikel, een team onderzoekers uit Italië, zeggen: "Even wachten."

Zij introduceren een raamwerk genaamd LAPITHS (vernoemd naar de oude Griekse krijgers die tegen de Centauriën vochten). Hun taak is om de hype rondom Centaur te temmen. Zij betogen dat het feit dat een AI zich gedraagt als een mens, niet betekent dat het ook denkt als een mens. Zij willen handelen (prestatie) scheiden van denken (cognitie).


Het Kernprobleem: De "Toeschrijvingsdwaling"

Het artikel identificeert een logische valkuil genaamd de Toeschrijvingsdwaling.

De Analogie:
Stel je een robot voor die perfect kan meespelen in een schaakpartij met een mens. Het verplaatst de stukken, pauzeert om na te "denken", en maakt zelfs dezelfde fouten die een mens zou maken als het moe is.

  • De Dwaling: Je kijkt naar de robot en zegt: "Wow, het moet een brein hebben zoals een mens! Het begrijpt strategie en voelt de druk van het spel."
  • De Realiteit: De robot is misschien gewoon een supersnelle rekenmachine die miljoenen schaakpartijen heeft onthouden. Het "begrijpt" niets; het voorspelt gewoon de volgende zet op basis van patronen.

De auteurs betogen dat Centaur deze schaakrobot is. Het is getraind op een enorm dataset van menselijke beslissingen (genaamd Psych-101). Omdat het is getraind om te voorspellen wat mensen zouden doen, doet het dat zeer goed. Maar de auteurs beweren dat dit slechts gedragsmimicry is, geen cognitieve uitlijning.

Het Hulpmiddel: Het "Minimale Cognitieve Raster" (MCG)

Om hun punt te bewijzen, hebben de auteurs een scorebord gebouwd genaamd het Minimale Cognitieve Raster (MCG). Denk hierbij aan een "Cognitieve Waarheidsdetector" die AI beoordeelt op drie dingen, niet alleen op hoe goed het vragen beantwoordt.

  1. Structuur versus Functie (Het "Hoe"):

    • De Vraag: Gebruikt de AI dezelfde interne "tandwielen" als een menselijk brein?
    • De Bevinding: Mensen leren stapsgewijs (proberen en fouten maken in real-time) en hebben een beperkt werkgeheugen (we kunnen maar een paar dingen tegelijk in ons hoofd houden). Centaur daarentegen is getraind in batches (alsof je een heel boek in één keer leest) en heeft een enorm "contextvenster" (het kan alles in een gesprek onthouden).
    • Het Oordeel: Centaur slaagt niet voor deze test. Het gedraagt zich als een mens, maar zijn interne motor is totaal anders. Het is als een vliegtuig dat vliegt als een vogel, maar straalmotoren gebruikt in plaats van vleugels die slaan.
  2. Generaliteit (Het "Bereik"):

    • De Vraag: Kan het veel verschillende soorten denken doen?
    • De Bevinding: Centaur is goed in wiskunde, redeneren en taal. Maar het is unimodaal, wat betekent dat het alleen tekst verwerkt. Het heeft geen ogen om te zien, geen handen om aan te raken, en geen lichaam om te bewegen.
    • Het Oordeel: Het krijgt gedeeltelijke punten. Het is slim, maar het mist de "geïncorporeerde" ervaring van een mens.
  3. Prestatie-overeenkomst (Het "Resultaat"):

    • De Vraag: Krijgt het het juiste antwoord, maakt het dezelfde fouten en duurt het even lang?
    • De Bevinding: Centaur is hier uitstekend in. Het voorspelt menselijke keuzes bijna perfect en bootst zelfs menselijke foutpatronen na.
    • Het Oordeel: Hoog scoren hier. Maar de auteurs waarschuwen: Hoog scoren hier bewijst niet dat het als wij denkt.

De Einduitslag: Als je deze combineert, krijgt Centaur een lage "Cognitieve Plausibiliteit"-score. Het is een geweldige emulator (een perfecte acteur), maar een slecht cognitief model (een echte denker).

Het Experiment: "Kan Iedereen Dit?"

Om te bewijzen dat Centaur niet speciaal is, hebben de onderzoekers een test uitgevoerd. Zij namen vijf andere krachtige AI-modellen (zoals GPT-4, Gemini en anderen) die NIET op menselijke data waren getraind.

Zij gaven deze modellen een simpele instructie: "Hier is de regel van het spel. Hier is de geschiedenis van wat er gebeurd is. Nu, wat zou een mens doen?" (Dit heet RAG of Retrieval-Augmented Generation).

Het Resultaat:

  • Deze "ongetrainde" modellen presteerden bijna even goed als Centaur.
  • In sommige gevallen was het verschil in prestatie zo klein dat het statistisch betekenisloos was.
  • De Metafoor: Het is alsof je een groep acteurs een script geeft. Centaur is de acteur die het script perfect heeft uit het hoofd geleerd. Maar als je hetzelfde script aan andere acteurs geeft, kunnen zij de tekst ook bijna perfect brengen zonder dat ze het hele boek van tevoren hebben uit het hoofd geleerd.

Conclusie: Je hebt geen "speciaal" cognitief model nodig om menselijk gedrag na te bootsen; je hebt alleen een slim taalmodel en de juiste instructies nodig.

De Hersenscan-test (fMRI)

De makers van Centaur beweerden dat na de training de "interne gedachten" van de AI (neuronale representaties) begonnen te lijken op hersenscans van mensen (fMRI-data). Zij zeiden dat dit bewees dat de AI "brein-achtig" werd.

De auteurs testten dit ook. Zij vroegen andere AI-modellen om te raden hoe de hersenactiviteit eruit zou zien voor een specifieke taak, alleen door de taakomschrijving te lezen.

Het Resultaat:

  • De andere modellen produceerden ook schattingen die sterk correleerden met menselijke hersenscans.
  • De Metafoor: Als je een groep mensen vraagt om het gevoel van "angst" te beschrijven, gebruiken ze misschien allemaal vergelijkbare woorden (hartkloppingen, zweten). Dat betekent niet dat ze allemaal exact hetzelfde biologische angstmecanisme hebben; het betekent gewoon dat ze allemaal hetzelfde concept beschrijven.
  • De auteurs betogen dat een hoge correlatie in hersenscans makkelijker te bereiken is dan de makers toegeven. Het bewijst niet dat de AI een brein heeft; het bewijst alleen dat het het concept van de taak begrijpt.

De Eindconclusie

Het artikel concludeert met een waarschuwing voor de AI-wereld:

  • Verwacht de kaart niet met het gebied. Als een AI een perfecte kaart tekent van menselijk gedrag (voorspelt wat we doen), betekent dat niet dat de AI het gebied is (het menselijk brein).
  • Centaur is een geweldige voorspeller, maar een zwakke verklaring. Het is een fantastisch hulpmiddel om te raden wat mensen als volgende zullen doen. Maar we kunnen het niet gebruiken om uit te leggen waarom mensen denken zoals ze doen, omdat zijn interne machine fundamenteel anders is dan de onze.
  • We hebben betere tests nodig. We moeten stoppen met alleen vragen "Kreeg het het juiste antwoord?" en beginnen met vragen "Kreeg het het juiste antwoord met dezelfde mentale tandwielen als een mens?"

Kortom: Centaur is een meesterlijke acteur, maar het is geen mens. De auteurs hebben een raamwerk (LAPITHS) gebouwd om ervoor te zorgen dat we niet in de valkuil van de prestatie trappen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →