← Nieuwste papers
💻 computer science

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

Dit artikel introduceert iVGR, een reinforcement learning-framework dat visuele lokalisatiecapaciteiten internaliseert in tekstuele redenering via een dual-stream trainingsstrategie, waardoor multimodale grote taalmodellen superieure fijnmazige perceptie kunnen bereiken zonder de prestatiedegradatie die wordt veroorzaakt door verplichte expliciete visuele grounding tijdens de inferentie.

Oorspronkelijke auteurs: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

Gepubliceerd 2026-06-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Over-Uitlegger" Valstrik

Stel je voor dat je een briljante detective hebt (de AI) die erg goed is in het oplossen van mysteries (vragen beantwoorden over afbeeldingen). Echter, om te bewijzen dat hij naar de juiste aanwijzing kijkt, voelt hij zich gedwongen om constant met een laserpointer naar de foto te wijzen en te zeggen: "Ik kijk naar de rode auto op coördinaten [100, 200]!" voordat hij je het antwoord kan geven.

De onderzoekers ontdekten iets verrassends: dit constante aanwijzen vertraagt de detective juist en zorgt ervoor dat hij meer fouten maakt.

Wanneer de AI wordt gedwongen om boxen te tekenen of specifieke punten aan te wijzen in zijn denkproces (wat "Visually Grounded CoT" wordt genoemd), raakt hij afgeleid. Hij verspilt zoveel mentale energie aan het perfect krijgen van de coördinaten dat hij vergeet het puzzelstukje daadwerkelijk op te lossen. Als de AI naar de verkeerde plek wijst, gaat het hele antwoord mis.

De Oplossing: De Vaardigheid "Internaliseren"

Het paper stelt een nieuwe methode voor genaamd iVGR. In plaats van de AI te dwingen om hardop aan te wijzen, leren ze de AI om stilzwijgend te kijken terwijl hij nadenkt.

Denk aan het leren van een student om een kaart te lezen:

  • De Oude Manier: De student moet met een stift een lijn op de kaart trekken elke keer als hij aan een locatie denkt. Als de lijn scheef is, geeft de leraar een onvoldoende, zelfs als de student het juiste antwoord wist.
  • De iVGR-Manier: De student mag de kaart in zijn hoofd bekijken. Hij hoeft geen lijn te tekenen. Maar hij wordt nog steeds getest op de vraag of hij daadwerkelijk naar de juiste plek heeft gekeken.

Hoe het werkt: De "Dual-Stream" Trainingsgym

Om de AI deze stille vaardigheid aan te leren, hebben de onderzoekers een speciale trainingsgym gebouwd met twee parallelle banen (streams) die naast elkaar lopen:

  1. De "Aanwijzende" Baan (Grounded Stream): Hier wordt de AI gedwongen om boxen te tekenen en naar objecten te wijzen, net als bij de oude manier. Hij krijgt een beloning als de boxen accuraat zijn en het antwoord klopt.
  2. De "Stille" Baan (Textual Stream): Hier mag de AI geen boxen tekenen. Hij hoeft alleen maar in woorden na te denken en te antwoorden.

De Magische Truc (De Consistentiebeloning):
Dit is de kern van de innovatie. Het systeem werkt als een strenge coach.

  • Het neemt het beste, meest accurate "Aanwijzende" antwoord uit de eerste baan.
  • Het vergelijkt dit met het "Stille" antwoord uit de tweede baan.
  • Als de Stille AI over dezelfde visuele details nadenkt als de Aanwijzende AI (zelfs zonder de box te tekenen), krijgt hij een enorme beloning.
  • Als de Stille AI hallucineert of naar het verkeerde ding kijkt, krijgt hij een straf.

In de loop van de tijd leert de "Stille" AI om de vaarschijnlijkheid van het focussen op de juiste delen van de afbeelding te internaliseren. Hij leert het object duidelijk te "zien" in zijn geest zonder dat hij de coördinaten hoeft te schreeuwen.

Het Resultaat: Een Slimmere, Snellere Detective

Het paper heeft dit getest op diverse moeilijke visuele puzzels (zoals het vinden van kleine details in foto's met een hoge resolutie of het tellen van objecten).

  • Betere Nauwkeurigheid: De AI die getraind is met iVGR behaalde aanzienlijk hogere scores dan AI-modellen die werden gedwongen om boxen te tekenen, of AI-modellen die gewoon gokten zonder visuele focus.
  • Flexibiliteit: Ho ook de AI leerde stilzwijgend na te denken, heeft hij niet het vermogen verloren om aan te wijzen als je dat echt nodig hebt. De onderzoekers lieten zien dat als je de AI tijdens de test een "tool" geeft om de afbeelding uit te snijden (croppen), de AI zijn interne kennis kan gebruiken om de perfecte plek te kiezen, wat de prestaties nog verder verbetert.

Samenvattende Analogie

Stel je een chefkok voor die groenten moet snijden.

  • De Oude Manier: De chef moet een laserpointer vasthouden en zeggen: "Ik snijd de wortel op positie X" voor elke handeling. Als de laser wiebelt, raakt de keuken in de war en is het gerecht verpest.
  • De iVGR-Manier: De chef oefent het snijden terwijl hij de laser vasthoudt (om de vaardigheid te leren), maar legt de laser daarna weg. Hij leert precies te voelen waar de wortel is met zijn handen (geïnternaliseerde visie). Hij snijdt sneller, nauwkeuriger, en het eten smaakt beter, allemaal zonder de afleiding van de laserpointer.

Kortom: iVGR leert AI om diep te "zien" zonder constant te hoeven "wijzen", wat resulteert in slimmere en betrouwbaardere antwoorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →