← Nieuwste papers
🤖 AI

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

Dit onderzoek onthult een gedeelde 'telt circuit' in Large Vision-Language Models en toont aan dat gerichte fine-tuning op het tellen, gebaseerd op synthetische data, niet alleen het telvermogen verbetert maar ook de prestaties op complexe visuele redeneertaken significant verhoogt.

Oorspronkelijke auteurs: Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

Gepubliceerd 2026-03-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Geheim van het Tellende Brein: Hoe AI Leren Tellen haar Slimmer Maakt

Stel je voor dat je een zeer intelligente robot hebt die foto's kan bekijken en vragen kan beantwoorden. Deze robot is geweldig in het herkennen van dingen: "Dat is een hond," "Dat is een auto." Maar als je hem vraagt: "Hoeveel ballen zie je op deze foto?", dan raakt hij in de war. Hij telt niet echt; hij raadt vaak op basis van patronen die hij eerder heeft gezien.

Dit onderzoek van een team van wetenschappers (onder andere van de Rutgers Universiteit) gaat over hoe we deze robots kunnen helpen om écht te leren tellen, en hoe dat hen niet alleen beter maakt in tellen, maar ook slimmer maakt in andere taken.

Hier is hoe ze dat deden, verteld als een verhaal:

1. Het Probleem: De "Gokker" vs. De "Teller"

De onderzoekers ontdekten iets vreemds. Deze AI-modellen kunnen heel goed complexe vragen beantwoorden, maar falen vaak bij iets simpels als het tellen van zwarte stippen op een witte vlak.

  • De analogie: Het is alsof je een chef-kok hebt die prachtige gerechten kan koken, maar als je hem vraagt hoeveel eieren in de koelkast zitten, hij ze niet aftelt maar een gokje waagt.
  • De ontdekking: Net als mensen, zijn deze AI's goed in het direct herkennen van kleine hoeveelheden (1, 2, 3 stippen), maar worden ze onzeker en gaan ze schatten als er veel stippen zijn. Dit gedrag lijkt heel erg op hoe het menselijk brein werkt!

2. De Röntgenfoto: Kijken naar de "Telt-Schakelingen"

Om te begrijpen waarom de AI faalt, keken de onderzoekers niet naar het antwoord, maar naar hoe het brein van de AI werkt van binnen. Ze gebruikten twee nieuwe hulpmiddelen:

  • Visual Activation Patching (De "Gedachten-Transplantatie"): Stel je voor dat je twee foto's hebt: één met 3 stippen en één met 5. De onderzoekers namen een stukje "gedachte" (een signaal) uit de AI die naar de foto met 5 stippen keek, en plachten dat in de AI die naar de foto met 3 stippen keek. Als de AI plotseling "5" zei in plaats van "3", wisten ze: "Ah! Dit stukje van het brein is verantwoordelijk voor het tellen!"
  • HeadLens (De "Oorplakker"): Dit is een bril die je op het brein van de AI zet om te zien waar de verschillende onderdelen (de "oren" van het brein) naar luisteren. Ze ontdekten dat het brein van de AI uit verschillende teams bestaat:
    1. De Waarnemers (Vroeg in het proces): Kijken naar de foto en zeggen: "Ik zie een blauwe vorm, ik zie een rode vorm."
    2. De Vertalers (Midden in het proces): Zeggen: "Die blauwe vorm is een stip, en die rode ook."
    3. De Tellers (Laat in het proces): Zeggen: "Oké, we hebben 1, 2, 3... dus het antwoord is 3."
    4. De Waarschuwingsborden: Zeggen: "Hé, dit is een moeilijke foto, wees voorzichtig."

3. De Oplossing: Een "Telt-Trainer" voor het Brein

Nu ze wisten hoe het brein werkt, wilden ze het verbeteren. In plaats van de hele AI opnieuw te leren (wat duur en langzaam is), besloten ze om alleen de "Teller-teams" te trainen.

  • De methode: Ze gebruikten heel simpele, kunstmatige foto's (zwarte stippen op een witte achtergrond) om de AI te trainen. Dit is als een sporter die alleen maar op een loopband traint om zijn benen sterker te maken.
  • Het resultaat: Ze pasten een paar kleine instellingen aan (zoals het scherper maken van de aandacht van de AI). Het verrassende was: door alleen te trainen op het tellen van simpele stippen, werd de AI niet alleen beter in tellen, maar ook beter in andere taken!

4. Het Grote Geheim: Tellen is de "Superkracht" van Redeneren

Waarom maakt het tellen van stippen de AI slimmer in wiskunde en logische vragen?

  • De Analogie: Stel je voor dat het brein van de AI een groot kantoor is. Het "Tellen" is een specifieke afdeling. De onderzoekers ontdekten dat deze "Telt-Afdeling" dezelfde medewerkers gebruikt als de "Wiskunde-Afdeling" en de "Logica-Afdeling".
  • De conclusie: Door de "Telt-Afdeling" te trainen en sterker te maken, worden diezelfde medewerkers ook beter in hun andere taken. Het tellen is dus geen losstaande vaardigheid, maar een fundamentele bouwsteen van visueel inzicht. Als je het tellen verbetert, verbeter je het hele kantoor.

Samenvatting in één zin:

De onderzoekers ontdekten dat AI's net als mensen tellen, en door ze te trainen op het simpele tellen van stippen, hebben ze een "superkracht" vrijgegeven die hen automatisch slimmer maakt in complexe visuele taken, omdat tellen de motor is die het hele visuele redeneervermogen aandrijft.

Het is alsof je een auto niet alleen sneller maakt door de motor te tunen, maar door de motor te tunen, blijkt dat de wielen, de remmen en de stuurinrichting ook vanzelf beter gaan werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →