← Nieuwste papers
💬 NLP

The Capacity of Thought: Benchmarking Llama 3.2 in Semantic fMRI Neural Language Decoding and Improving the Huth Encoding-Model Baseline

Dit artikel presenteert twee complementaire studies naar op fMRI gebaseerde taaldecodering: één die het traditionele Huth-encodingmodel-baseline verbetert om hogere METEOR- en BLEU-scores te bereiken, en een andere die fMRIFlamingo introduceert, die onthult dat taalmodellen met een hoge capaciteit zoals Llama 3.2 misleidend hoge decoderingsmetrieken kunnen produceren die worden gedreven door hun interne priors in plaats van door het werkelijke neurale signaal wanneer ze worden geëvalueerd zonder strikte blinde controles.

Oorspronkelijke auteurs: Milos Suvakovic, Dom Marhoefer, Glenn Grant-Richards, Aidan Pinero

Gepubliceerd 2026-07-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Milos Suvakovic, Dom Marhoefer, Glenn Grant-Richards, Aidan Pinero

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je brein een bruisende, lawaaierige radiozender is die een geheim verhaal uitzendt. Wetenschappers proberen al een tijdje een "gedachtedecoder" te bouien die op deze zender kan afstemmen, het signaal kan opvangen en het verhaal woord voor woord kan opschrijven. Lange tijd was de beste manier om dit te doen het gebruik van een zeer specifieke, ouderwetse kaart (een model genaamd GPT-1) om te raden wat de radio aan het zeggen was.

Twee teams van onderzoekers aan de UC Santa Cruz besloten twee verschillende manieren om deze decoder te upgraden te testen. Ze wilden zien of ze een superintelligente, moderne AI (Llama-3.2) konden gebruiken om gedachten direct te lezen, of dat ze gewoon de oude kaart beter moesten maken.

De "Betere Kaart" Upgrade

Eerst namen ze de oude, betrouwbare methode en gaven die een serieuze opfrisbeurt. Denk aan de oude methode als het proberen te luisteren naar een radio met slechts 10.000 piepkleine antennes. De onderzoekers voegden 5.000 antennes toe (waardoor het totaal op 15.000 kwam) om meer van het signaal op te vangen. Ze vervingen ook het oude woordenboek door een iets nieuwer woordenboek (GPT-2) om te helpen bij het raden van het volgende woord in het verhaal, en ze gebruikten super-snelle computerchips (GPU's) om de berekeningen 10 keer sneller uit te voeren.

Het Resultaat: Deze upgrade werkte! Door meer antennes en een beter woordenboek toe te voegen, verbeterden ze hun vermogen om de juiste woorden te raden. Ze gingen van ongeveer 13,4% van de "score" goed te krijgen naar 14,9%. Het was geen magische oplossing, maar het was een solide, meetbare verbetering. Het bewees dat als je de oude methode simpelweg meer data en een betere helper geeft, deze beter wordt in het lezen van het verhaal van het brein.

Het "Super-Brein" Experiment

Vervolgens probeerden ze iets wilds. Ze bouwden een nieuwe machine genaamd fMRIFlamingo. In plaats van een kaart te gebruiken om het verhaal te raden, probeerde deze machine het radiosignaal van het brein rechtstreeks in een gigantische, bevroren super-AI (Llama-3.2) te pluggen. Het idee was: "Als we het hersensignaal in deze superintelligente AI voeren, begrijpt de AI misschien wel wat de persoon denkt."

Op het eerste gezicht leek het een enorm succes. Wanneer ze de AI vroegen om het juiste woord te kiezen uit een lijst van 100 opties (een ranking-taak), koos deze het juiste woord in 42,86% van de gevallen. Dat klinkt geweldig, toch? Veel beter dan willekeurig gokken (wat 1% zou zijn).

Maar hier komt de twist: De onderzoekers stopten daar niet. Ze speelden een trucje. Ze zetten het hersensignaal volledig uit — ze gaven de AI een "leeg" signaal in plaats van de echte hersendata. Ze stelden dezelfde ranking-vraag opnieuw.

De Schokkende Ontdekking: De AI selecteerde het juiste antwoord nog steeds in 42,86% van de gevallen.

Het bleek dat de AI helemaal niet het brein aan het lezen was. Het gebruikte simpelweg zijn eigen enorme geheugen van hoe taal werkt om het antwoord te raden. Het was also eigenlijk een student die een toets maakt die niet eens de vraag hoeft te lezen omdat hij het antwoord al uit zijn hoofd heeft geleerd. Het "hersensignaal" stond er eigenlijk zelfs voor dat de AI's gokken iets slechter maakte, in plaats van beter.

De Grote Les

Het paper laat zien dat een superintelligente AI die het juiste woord kan raden, niet betekent dat hij je gedachten leest. Sterker nog, deze grote AI's zijn zo goed in het raden op basis van hun eigen training, dat ze het feit kunnen verbergen dat ze falen in het lezen van het brein.

De onderzoekers ontdekten dat:

  1. De oude methode, wanneer verbeterd, eigenlijk beter werkt bij het decoderen van het verhaal dan de chique nieuwe directe methode wanneer men kijkt naar de volledige reconstructie van het verhaal. Hoewel de nieuwe methode wel een kleine verbetering liet zien in het correct kiezen van enkele woorden binnen een venster (10,3% nauwkeurigheid), behaalde de "Betere Kaart"-methode veel hogere scores bij het proberen te reconstrueren van het werkelijke narratief.
  2. De nieuwe methode (fMRIFlamingo) vertrouwt voornamelijk op zijn eigen "taalprior" (zijn interne kennis van woorden) in plaats van op het hersensignaal. Wanneer ze het testten met een "blind control" (het op nul zetten van de hersendata), daalde de ranking-prestatie niet, wat bewees dat de hersendata niet de held was.
  3. Je kunt een "succes" in hersendecodering niet vertrouwen, tenzij je blind test. Als je niet controleert of de AI alleen gokt op basis van zijn eigen kennis, kun je denken dat je de code van de geest hebt gekraakt terwijl dat niet zo is.

Kortom, de onderzoekers hebben aangetoond dat hoewel we de oude "kaart"-methode iets beter kunnen maken, het simpelweg inpluggen van een brein in een gigantische AI niet automatisch gedachten ontsluit. De AI is te slim voor zijn eigen bestwil en raadt vaak het juiste antwoord om de verkeerde redenen. Om gedachten echt te kunnen decoderen, moeten we veel zorgvuldiger en strenger te werk gaan dan alleen maar naar een hoge score kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →