← Nieuwste papers
💻 computer science

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

Dit artikel introduceert PointVG-R, een door redenering gestuurd multimodaal groot taalmodel dat de staat van de kunst bereikt in pointing-gebaseerde visuele gronding door geometrie-bewuste redenering, een nieuwe visuele Chain-of-Thought dataset (EgoPoint-CoT) en een adaptieve reinforcement learning-strategie te integreren om complexe ruimtelijke relaties beter te interpreteren.

Oorspronkelijke auteurs: Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

Gepubliceerd 2026-06-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je aan een bureau zit en iemand wijst met een vinger naar een specifiek object op je computerscherm en vraagt: "Waar wijs ik naar?"

Voor de meeste huidige AI-modellen is dit alsof je een persoon vraagt die nog nooit een vinger heeft gezien om te raden waar iemand naar wijst, enkel door naar een wazige foto van die hand te kijken. Ze kunnen het verkeerde object raden omdat ze worden afgeleid door het felste object in de kamer of het meest voorkomende object dat ze kennen, in plaats van daadwerkelijk de lijn van de vinger te volgen.

PointVG-R is een nieuw type AI dat is ontworion om dit specifieke probleem op te lossen. Hier is hoe het werkt, eenvoudig uitgelegd:

1. Het Probleen: De "Black Box" Gissing

Traditionele AI-modellen zijn als studenten die antwoorden uit het hoofd leren maar de logica niet begrijpen. Wanneer ze een wijzend gebaar zien, slaan ze vaak het "denkgedeelte" over. Ze kijken misschien naar de hand, zien een scherm in de buurt en raden dan simpelweg "scherm", omdat dat een veelvoorkomend object is, zelfs als de vinger eigenlijk naar een koffiekopje ernaast wijst. Ze missen geometrisch redeneren — het vermogen om de rechte lijn (straal) te begrijpen die de vinger met het doel verbindt.

2. De Oplossing: "Denken met Beelden"

De auteurs hebben een systeem ontwikkeld genaamd PointVG-R dat de AI dwingt om eerst na te denken voordat hij antwoord geeft. In plaats van direct naar het antwoord te springen, wordt de AI geleerd om een stapsgewijze visuele checklist te volgen, vergelijkbaar met hoe een menselijke detective een zaak oplost:

  • Stap 1: Vind de hand. "Oké, ik zie een hand in de afbeelding. Waar precies is deze?"
  • Stap 2: Vind de vingertop. "Waar wijst de punt van de vinger naar?"
  • Stap 3: Teken een onzichtbare lijn. Dit is het coolste deel. De AI gebruikt een digitaal hulpmiddel om letterlijk een straal (een rechte lijn) van de vingertop over de afbeelding te tekenen. Het is alsof hij een laserpointer in zijn geest gebruikt om het pad te traceren.
  • Stap 4: Volg de lijn. "Oké, ik volg deze rode lijn die ik net heb getekend. Welk object raakt deze als eerste?"
  • Stap 5: Identificeer het doel. "Ah, de lijn raakt de monitor. Dat is het antwoord."

3. De Training: Leren van Fouten

Om de AI deze nieuwe manier van denken te leren, hebben de onderzoekers niet alleen afbeeldingen en antwoorden getoond. Ze hebben een speciale trainingsdataset gebouwd genaamd EgoPoint-CoT.

  • De "Cold Start" (SFT): Eerst hebben ze de AI de regels van het spel geleerd met behulp van een methode genaamd "Supervised Fine-Tuning". Het is als een leraar die een student stap voor stap de juiste stappen laat zien om een wiskundig probleem op te lossen, zodat de student het proces leert, en niet alleen het eindgetal.
  • De "Oefeningen" (Reinforcement Learning): Daarna lieten ze de AI zelfstandig oefenen. Maar hier is de truc: ze gebruikten een speciaal scoresysteem.
    • Als de AI de lijn correct tekende en het juiste object vond, kreeg het een hoge score.
    • Als de AI de weg kwijtraakte of een foutief antwoord gaf, kreeg het een lagere score.
    • Het "Group Variance" Geheime Ingrediënt: De onderzoekers merkten op dat de oefenpogingen van de AI soms heel erg op elkaar leken (saai) en soms heel erg verschilden (spannend). Ze creëerden een slim weegsysteem dat extra aandacht besteedt aan de "spannende" pogingen waarbij de AI echt probeerde uit te vogelen hoe het zat, wat helpt om sneller en stabieler te leren.

4. Het Resultaat: Een Betere Detective

Het artikel beweert dat door de AI te dwingen om "de lijn te trekken" en deze logisch te volgen, PointVG-R veel beter wordt in het vinden van exact waar iemand naar wijst.

  • Oude AI: Wordt vaak afgeleid door felle kleuren of veelvoorkomende objecten (Saliency Bias).
  • PointVG-R: Volgt de geometrie van de vinger. Het negeert de afleidingen en vindt het werkelijke doel.

In de tests presteerde deze nieuwe methode aanzienlijk beter dan alle andere topmodellen (ongeveer 15,86 punten beter in nauwkeurigheid). Het heeft een "black box" gisser essentieel veranderd in een logische denker die de onzichtbare lijn kan "zien" die een vinger met een object verbindt.

Kortom: PointVG-R leert AI om te stoppen met gissen en te beginnen met traceren, door een digitale "laserpointer" te gebruiken om de menselijke vinger naar het juiste object te volgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →