← Nieuwste papers
💬 NLP

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

Dit paper toont aan dat meer dan de helft van de neuronen voor redenering gedeeld wordt tussen taal- en visueel-taalmodellen, en introduceert SNRF, een efficiënt kader dat deze gedeelde neuronen benut om redeneervermogen kosteneffectief over te dragen zonder grote multimodale fine-tuning.

Oorspronkelijke auteurs: Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

Gepubliceerd 2026-02-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee verschillende soorten super-intelligente robots hebt:

  1. De Tekst-Expert (LLM): Een robot die alleen maar tekst leest en schrijft. Hij is een genie in wiskunde, logica en het oplossen van complexe raadsels. Hij kan stap-voor-stap redeneren als een filosoof.
  2. De Visuele Expert (LVLM): Een robot die naar foto's kijkt én tekst leest. Hij kan een plaatje beschrijven, maar als je hem een lastig wiskundig probleem geeft op basis van een tekening, struikelt hij vaak. Hij is goed in zien, maar minder goed in denken.

De onderzoekers van dit papier hebben een fascinerende ontdekking gedaan: Deze twee robots delen eigenlijk dezelfde "hersencellen" voor het denken.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Grote Ontdekking: Het Delen van "Denk-Neuronen"

Stel je voor dat de hersenen van deze robots bestaan uit miljarden kleine lichtjes (neuronen). Als de Tekst-Expert een wiskundeprobleem oplost, gaan er bepaalde lichtjes fel branden.

De onderzoekers keken wat er gebeurde toen de Visuele Expert een soortgelijk probleem oplost (bijvoorbeeld een meetkundevraag met een tekening). Ze ontdekten iets verrassends: Meer dan de helft van die fel brandende lichtjes waren precies dezelfde!

Het is alsof je twee verschillende auto's hebt: een racewagen (Tekst-Expert) en een SUV (Visuele Expert). Je zou denken dat ze totaal verschillende motoren hebben. Maar deze onderzoekers ontdekten dat ze precies hetzelfde type ontstekingssysteem gebruiken om de auto vooruit te laten bewegen. De "denk-motor" is identiek, ook al ziet de ene auto er anders uit dan de andere.

2. Het Bewijs: Het "Aan-uit" Experiment

Om zeker te weten dat deze lichtjes echt belangrijk waren, deden ze een experiment. Ze zetten de "denk-lichtjes" in de Visuele Expert gewoon uit (alsof ze de stekker eruit trokken).

  • Resultaat: De robot werd volledig dom. Hij kon niets meer oplossen.
  • Vergelijking: Als ze willekeurige andere lichtjes uitzetten, werd de robot alleen maar een beetje slomer, maar niet volledig blind.

Dit bewijst dat deze gedeelde lichtjes de essentie zijn van het redeneren. Ze zijn de brug tussen "zien" en "begrijpen".

3. De Oplossing: SNRF (De Slimme Koppeling)

Nu komt het slimme deel. De onderzoekers wilden de Visuele Expert leren denken zoals de Tekst-Expert, maar zonder hem maandenlang opnieuw te laten leren (wat enorm veel tijd en geld kost).

Ze bedachten een methode genaamd SNRF (Shared Neuron Low-Rank Fusion).

De Analogie van de "Geheime Kanaal":
Stel je voor dat de Tekst-Expert een boek heeft met de beste oplossingen voor wiskundeproblemen. De Visuele Expert heeft dit boek niet. In plaats van het hele boek over te typen (wat veel tijd kost), doen ze het volgende:

  1. Ze kijken precies welke pagina's en zinnen (de gedeelde lichtjes) de Tekst-Expert gebruikt.
  2. Ze maken een heel klein, compact "samenvatting" van die kennis.
  3. Ze plakken deze samenvatting alleen maar op die specifieke plekken in de hersenen van de Visuele Expert waar de "denk-lichtjes" zitten.

Het is alsof je een ervaren leraar (Tekst-Expert) vraagt om zijn beste lesmateriaal te kopiëren en dat alleen in de hoofden van zijn leerlingen (Visuele Expert) te plakken, precies op de plekken waar ze het nodig hebben. Je verandert niets aan hun vermogen om te zien (hun ogen blijven hetzelfde), maar hun verstand wordt plotseling veel scherper.

4. Het Resultaat

Na deze ingreep gebeurde er iets moois:

  • De Visuele Expert kon plotseling veel beter wiskunde oplossen en logische raadsels kraken.
  • Hij bleef nog steeds even goed in het beschrijven van plaatjes (hij werd niet dom over zijn ogen).
  • Het kostte bijna geen extra tijd of rekenkracht om dit te doen.

Samenvatting in één zin

De onderzoekers hebben ontdekt dat robots die naar plaatjes kijken en robots die alleen tekst lezen, dezelfde "denk-neuronen" gebruiken, en ze hebben een slimme manier bedacht om die denkkracht van de tekst-robot direct over te hevelen naar de plaatjes-robot, zonder dat deze opnieuw hoeft te studeren.

Het is een beetje alsof je een chef-kok (Tekst-Expert) zijn geheimen over het bakken van een perfecte taart leert aan een bakker die alleen maar bloem ziet (Visuele Expert), zodat die bakker plotseling ook de perfecte taart kan maken, zonder dat hij eerst jaren in de keuken hoeft te staan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →