← Nieuwste papers
🤖 AI

Thinking with Visual Grounding

Dit artikel introduceert "visueel gegrond denken", een raamwerk waarbij visie-taalmodellen natuurlijke taalredenering afwisselen met expliciete visuele grondingen, wat, wanneer getraind via een schaalbare synthesepipeline en grounding-bewuste reinforcement learning, de prestaties op tel- en ruimtelijke redeneertaken aanzienlijk verbetert, waardoor kleinere modellen die van veel grotere tegenhangers kunnen evenaren.

Oorspronkelijke auteurs: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

Gepubliceerd 2026-06-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een wiskundetoets maakt, maar in plaats van getallen gaan de vragen over plaatjes. Je hebt een slimme assistent (een AI) die probeert deze visuele puzzels op te lossen door hardop tegen zichzelf te praten.

Het Probleem: Het "Ghost" Redeneren
Momenteel zijn deze AI-assistenten goed in praten. Ze kunnen zeggen: "Ik zie een rode auto bij de ingang, dus het antwoord is A." Maar hier zit de crux: ze zeggen alleen dat ze hem zien. Ze wijzen niet daadwerkelijk naar de rode auto in de afbeelding. Het is alsoals een student die een toets maakt die het juiste antwoord opschrijft, maar niet kan laten zien hoe hij daar gekomen is. Als je vraagt: "Hoe weet je dat dat de rode auto is?", kan de AI zeggen: "Ik weet het gewoon," of ze kunnen aan het gokken zijn. Omdat de AI niet wordt gedwongen om naar het bewijs te wijzen, is het moeilijk te zeggen of ze de afbeelding echt bekijken of gewoon dingen verzinnen.

De Oplossing: "Visual Grounding"
De auteurs van dit paper, Junkai Zhang en zijn team, hebben een nieuwe manier bedacht waarop de AI kan denken, genaamd "Visually Grounded Thinking."

Denk er als volgt over na:

  • Oude Manier: De AI zegt: "Er staat een zwarte laptop op de tafel." (Het zijn alleen woorden).
  • Nieuwe Manier: De AI zegt: "Er staat een zwarte laptop op de tafel."

Elke keer dat de AI een object benoemt (zoals een "bruine stoel" of een "blauwe beker"), moet hij een digitale pin (een punt) plaatsen of een kader rond dat specifieke object in de afbeelding tekenen. Het is alsof de AI een laserpointer vasthoudt en zegt: "Ik denk aan dit specifieke ding hier."

Hoe ze de AI dit hebben geleerd
Een AI leren om precies te wijzen is moeilijk, want je kunt niet simpelweg vragen om "precies te zijn": de onderzoekers bouwden een speciale fabriek (een datapijplijn) om trainingsvoorbeelden te maken:

  1. De Detective: Ze gebruikten een zeer slimme AI om plaatjespuzzels op te lossen en de stappen op te schrijven.
  2. De Highlighter: Ze gebruikten een tool genaamd SAM3 (denk aan een superprecieze digitale markeerstift) om automatisch de exacte vormen van de objecten te vinden die de detective noemde.
  3. De Leraar: Ze namen die exacte vormen en veranderden die in "punten" of "kaders" om een perfect antwoordmodel te creëren.
  4. Het Beloningssysteem: Ze trainden de AI met een spelachtig systeem. Als de AI het antwoord goed had én op de juiste plek wees, kreeg het een hoge score. Als de AI het antwoord goed had maar op de verkeerde plek wees (of helemaal niet wees), kreeg het een lagere score. Dit dwong de AI om te leren dat "denken" en "wijzen" samen moeten gaan.

Wat gebeurde er toen ze het testten?
Ze testten deze nieuwe "wijzende" AI op twee soorten taken:

  1. Tellen: "Hoeveel donuts zijn er in deze afbeelding?"
    • Resultaat: De AI werd hier veel beter in. Door elk donut een punt te geven, hielp het de AI om nauwkeurig te tellen zonder in de war te raken door vergelijkbare objecten.
  2. Ruimtelijk Redeneren: "Welk object bevindt zich het meest links van de man?"
    • Resultaat: Dit was de grote verrassing. Een klein AI-model (4 miljard "hersencellen") dat leerde om te wijzen, werd net zo goed, en soms zelfs beter, dan een enorm AI-model (27 miljard "hersencellen") dat niet leerde om te wijzen.

De Kernboodschap
Het paper laat zien dat wanneer AI-modellen worden gedwongen om hun gedachten te koppelen aan de werkelijke afbeelding — zoals een student die moet laten zien hoe hij tot een antwoord komt door de getallen te omcirkelen die hij heeft gebruikt — ze veel slimmer worden.

  • Voor tellen: Alleen een punt op een object zetten is voldoende.
  • Voor complexe ruimtelijke puzzels: Een kader rond een object tekenen helpt de AI om grootte en vorm beter te begrijpen, maar zelfs alleen wijzen werkt verrassend goed.

Kortom, het paper bewijst dat denken beter is wanneer je kunt aanwijzen waar je over nadenkt. Het verandert "magisch gokken" in "verifieerbaar bewijs."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →