← Nieuwste papers
🧬 biology

Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli

Deze studie toont aan dat instructie-geoptimaliseerde multimodale grote taalmodellen tijdens het kijken naar natuurlijke films een aanzienlijk sterkere en meer taakspecifieke uitlijning vertonen met menselijke hersenactiviteit in vergelijking met niet-instructie-geoptimaliseerde modellen en modellen met contextueel leren, wat suggereert dat instructie-optimisatie representaties organiseert rond functionele taakeisen in plaats van oppervlakkige semantiek.

Oorspronkelijke auteurs: Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

Gepubliceerd 2026-05-21
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Subba Reddy Oota, Khushbu Pahwa, Prachi Jindal, Satya Sai Srinath Namburi, Maneesh Singh, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Het Grote Idee: Computers Leren "Denken" als Hersenen

Stel je voor dat je een groep zeer slimme AI-assistenten hebt (Multimodale Grootte Taalmodellen, of MLLM's). Deze AI's kunnen films kijken en naar audio luisteren. De onderzoekers wilden weten: Verwerken deze AI's informatie op dezelfde manier als menselijke hersenen?

Om dit uit te vinden, stelden ze de AI's niet alleen vragen; ze keken ook naar de "hersengolven" (fMRI-scans) van echte mensen die dezelfde films bekeken. Vervolgens probeerden ze die hersengolven te voorspellen met behulp van de interne gedachten van de AI. Het doel was om te zien welke AI-"hersenen" het beste overeenkwamen met de menselijke hersenen.

De Hoofdrolspelers: Twee Soorten AI's

De studie vergeleek twee soorten AI-assistenten:

  1. De "Rauwe" AI (In-Context Learning): Denk hierbij aan een briljante student die miljoenen boeken heeft gelezen, maar nooit een specifieke toets heeft gehad. Als je ze een film toont en vraagt: "Wat gebeurt er?", antwoorden ze op basis van hun algemene kennis. Ze zijn slim, maar ze herhalen misschien gewoon wat ze eerder hebben gezien.
  2. De "Getrainde" AI (Instruction-Tuned): Denk hierbij aan dezelfde student, maar die zojuist een strenge trainingskamp heeft doorlopen waar ze specifieke taken hebben geoefend: "Vat dit samen", "Vind de emotie", "Beschrijf het geluid". Ze zijn nu experts in het volgen van specifieke instructies.

Het Experiment: De Filmavond

De onderzoekers organiseerden een "filmavond" met vier menselijke vrijwilligers. Terwijl ze fragmenten van populaire films bekeken (zoals The Wolf of Wall Street), werden hun hersenen gescand.

Vervolgens voerden ze diezelfde filmfragmenten in bij de AI's.

  • De Rauwe AI keek gewoon naar de video.
  • De Getrainde AI kreeg 13 verschillende "instructies" voor dezelfde video, zoals:
    • "Wat zijn de belangrijkste gebeurtenissen?"
    • "Beschrijf de emoties."
    • "Wat is het centrale conflict?"
    • "Identificeer de geluiden."

De onderzoekers stelden toen de vraag: Welke AI's interne "gedachten" konden het beste voorspellen wat de menselijke hersenen op dat exacte moment deden?

De Verassende Resultaten

Hier is wat ze ontdekten, met behulp van enkele eenvoudige metaforen:

1. De "Getrainde" AI is een Beter Match voor de Menselijke Hersenen
De "Getrainde" (Instruction-Tuned) AI's waren aanzienlijk beter in het voorspellen van menselijke hersenactiviteit dan de "Rauwe" AI's.

  • Analogie: Stel je voor dat je probeert te raden wat een vriend denkt. De "Rauwe" AI is als een vriend die zomaar willekeurige feiten over de film opsomt. De "Getrainde" AI is als een vriend die actief probeert het verhaal en de gevoelens te begrijpen, net zoals jouw hersenen dat doen. De gedachten van de Getrainde AI kwamen ongeveer 9% tot 20% beter overeen met de menselijke hersenen dan die van de anderen.

2. De "Rauwe" AI Herhaalt Gewoon Woorden; De "Getrainde" AI Doet het Werk
De onderzoekers vonden een belangrijk verschil in hoe deze AI's denken:

  • De Rauwe AI is zeer gevoelig voor de exacte woorden die je gebruikt. Als je zegt "Beschrijf de video" versus "Vertel me over de video", verandert de interne hersenen van de Rauwe AI veel omdat de woorden verschillend zijn. Het is als een papegaai die geluiden nabootst.
  • De Getrainde AI negeert de specifieke formulering en richt zich op de taak die je wilt laten uitvoeren. Of je nu zegt "Vat samen" of "Vertel het verhaal", haar interne hersenen blijven gefocust op de taak.
  • De Conclusie: Menselijke hersenen lijken ook meer belang te hechten aan de taak (het verhaal begrijpen) dan aan de exacte woorden die worden gebruikt om ernaar te vragen. De Getrainde AI nabootst dit menselijke gedrag beter.

3. Verschillende Taken Zetten Verschillende Delen van de Hersenen (en de AI) Aan
De studie toonde aan dat wanneer je de AI een specifieke baan geeft, het verschillende "afdelingen" in haar hersenen activeert, net zoals bij mensen.

  • Analogie: Denk aan de hersenen als een stad met verschillende wijken.
    • Wanneer de AI wordt gevraagd om geluiden te detecteren, licht haar "Audio-wijk" op, wat overeenkomt met het menselijke auditieve cortex.
    • Wanneer wordt gevraagd om een verhaal te begrijpen, licht haar "Taalwijk" op, wat overeenkomt met de menselijke taalgebieden.
    • Wanneer wordt gevraagd om objecten te herkennen, licht haar "Visuele wijk" op.
  • De "Rauwe" AI schakelde niet zo duidelijk van wijk. De "Getrainde" AI wist precies welk deel van de stad ze moest gebruiken voor de specifieke baan.

4. De "Diepe" Lagen Matchen de "Diepe" Hersenen
AI-modellen hebben lagen, zoals een flatgebouw met meerdere verdiepingen.

  • Benedenverdiepingen (Vlakkere lagen): Deze handelen simpele dingen zoals randen, kleuren en basisgeluiden.
  • Bovenverdiepingen (Diepe lagen): Deze handelen complexe ideeën zoals verhalen, emoties en redenering.
  • De Bevinding: De onderzoekers ontdekten dat de onderste verdiepingen van de AI overeenkwamen met de zintuiglijke gebieden van de menselijke hersenen (ogen/oren), en dat de bovenste verdiepingen van de AI overeenkwamen met de denkende gebieden van de menselijke hersenen. Deze "hiërarchie" was veel duidelijker bij de Getrainde AI.

De "Video versus Audio" Twist

De studie keek ook naar AI's die specifiek zijn ontworpen voor video en AI's die specifiek zijn ontworpen voor audio.

  • Video AI's: Deze waren de sterren van de show. Ze kwamen zeer goed overeen met menselijke hersenactiviteit in het hele brein.
  • Audio AI's: Deze deden het redelijk, maar ze kwamen vooral overeen met de hoorcentra van de menselijke hersenen. Ze kwamen niet zo goed overeen met de rest van de hersenen als de videomodellen deden.
  • Conclusie: Momenteel zijn AI-modellen die samen kunnen "zien" en "horen" (Video) veel dichter bij de werking van de menselijke hersenen dan modellen die alleen kunnen "horen" (Audio).

Samenvatting

Dit artikel bewijst dat wanneer we AI-modellen leren om specifieke instructies te volgen (zoals een menselijke leraar dat zou doen), ze stoppen met het alleen maar "opzeggen" van data en beginnen te "denken" op een manier die opmerkelijk lijkt op hoe onze eigen hersenen werken. Ze organiseren hun gedachten op basis van taak in plaats van op basis van formulering, en ze activeren specifieke hersengebieden afhankelijk van wat er van hen wordt gevraagd. Dit maakt ze krachtige hulpmiddelen voor wetenschappers die proberen te begrijpen hoe de menselijke hersenen de complexe wereld van films en verhalen verwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →