← Nieuwste papers
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

Dit artikel introduceert POINTS-GUI-G-8B, een state-of-the-art GUI-groundingmodel dat is getraind vanuit een basis met minimale ruimtelijke bewustwording door gebruik te maken van verfijnde data-engineering, verbeterde trainingsstrategieën en reinforcement learning met verifieerbare beloningen om superieure prestaties te behalen over meerdere benchmarks.

Oorspronkelijke auteurs: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Gepubliceerd 2026-02-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robotassistent hebt die tekst kan lezen en naar plaatjes kan kijken. Je wilt de robot leren om jouw computer of telefoon te gebruiken, precies zoals jij dat doet. Maar er is een probleem: de robot kan de instructies lezen ("Klik op de rode knop"), maar hij weet niet waar de rode knop zich op het scherm bevindt. Het is alsoat je iemand een kaart van een stad geeft, maar niet vertelt op welke straat diegene zich momenteel bevindt.

Dit artikel introduceert POINTS-GUI-G, een nieuwe versie van die robotassistent die eindelijk heeft geleerd om naar een scherm te kijken en te zeggen: "Ah, ik zie de knop! Hij zit daar precies op deze coördinaten."

Hier is hoe de onderzoekers deze robot hebben geleerd een meester van het scherm te worden, uitgelegd aan de hand van eenvoudige analogieën:

1. Het Startpunt: Een Onbeschreven Blad

De meeste andere onderzoekers namen een robot die al goed was in het vinden van dingen (zoals een ervaren detective) en gaven hem simpelweg een paar extra aanwijzingen. De auteurs van dit artikel besloten te beginnen met een robot die slecht was in het vinden van dingen. Ze wilden de vaardigheid vanaf de basis opbouwen, zoals een kind leren lezen in plaats van alleen de spelling van een tiener te corrigeren. Ze begonnen met een basismodel genaamd "POINTS-1.5" dat bijna geen enkel vermogen had om op dingen op een scherm te wijzen.

2. De Drie Zuilen van Succes

Om deze "blinde" robot in een "ziende" robot te veranderen, gebruikten ze drie belangrijke strategieën:

A. Het Opschonen en Organiseren van de Leerboeken (Verfijnde Data Engineering)

Stel je voor dat je een student probeert te onderwijzen met een stapel leerboeken. Sommige boeken gebruiken inches, andere centimeters, sommige zijn geschreven in het Engels en andere in het Frans. Sommige pagina's zijn gescheurd en andere zitten vol krabbels. Het zou een nachtmerrie zijn om daarvan te leren.

De onderzoekers deden drie dingen om dit te repareren:

  • Standaardisatie: Ze namen alle rommelige, verschillende datasets en dwongen ze in één enkel formaat. Nu wordt elke "coördinaat" (locatie) op dezelfde manier gemeten, alsof alles met een standaard liniaal wordt gemeten.
  • Ruisreductie: Ze traden op als strenge redacteuren. Ze gebruikten een speciale tool (genaamd OmniParser-v2) om de leerboeken te controleren. Als een leerboek zei "De knop is hier", maar de afbeelding liet duidelijk zien dat de knop ergens anders zat, gooiden ze die pagina eruit. Ze hielden alleen de perfecte voorbeelden over.
  • Het Moeilijker Maken: Zodra de robot goed werd in het vinden van grote, duidelijke knoppen, begonnen de onderzoekers hem "hard mode"-puzzels te voeren. Ze creëerden schermen met piekleine, drukke knoppen en verwarrende lay-outs (zoals een rommelig bureau met overal papieren) om de robot scherper en nauwkeuriger te dwingen.

B. De Ogen Afstemmen (Verbeterde Trainingsstrategieën)

Normaal gesproken, wanneer deze AI-modellen worden getraind, zijn de "ogen" (het deel van de computer dat afbeeldingen verwerkt) bevroren op hun plaats. De onderzoekers realiseerden zich dat voor het vinden van knoppen op een scherm, de ogen flexibel moesten zijn.

  • De Visie Ontdooien: Ze lieten de "ogen" leren en zich aanpassen terwijl de rest van de hersenen leerde. Dit stelde de robot in staat om beter in staat te zijn om minuscule details op te merken.
  • Consistentie in Resolutie: Stel je voor dat je traint voor een basketbalwedstrijd door basketballen te gooien vanaf 1,5 meter afstand, maar dat je vervolgens op komt dagen bij de echte wedstrijd waar de basket op 3 meter afstand hangt. Je zou missen. De onderzoekers merkten dat hun robot oefende op kleine, lage-resolutie afbeeldingen, maar werd getest op enorme, hoog-definitie schermen. Ze losten dit op door de robot te trainen op grotere, duidelijkere afbeeldingen, zodat zijn "zicht" klaar was voor het echte werk.

C. Het Videospel Beloningssysteem (Reinforcement Learning)

Dit is het meest unieke deel. Normaal gesproken wordt Reinforcement Learning (RL) gebruikt om robots te leren hoe ze moeten denken of logische puzzels moeten oplossen. Hier gebruikten ze het om de robot te leren hoe hij moet zien.

Denk hierbij aan een videogame:

  • De robot raadt waar een knop zit.
  • De computer controleert: "Heb je de knop geraakt?"
  • Ja? +100 punten.
  • Nee? 0 punten.

Omdat het antwoord ofwel goed ofwel fout is (er is geen "misschien"), krijgt de robot zeer duidelijke feedback. De onderzoekers ontdekten dat deze "probeer het, krijg een score, probeer het opnieuw"-lus de robot veel nauwkeuriger maakte dan alleen het tonen van voorbeelden en zeggen "dit is goed".

Het Resultaat

Door deze drie methoden te combineren, werd het POINTS-GUI-G model een kampioen in het vinden van dingen op schermen.

  • Het versloeg veel andere modellen die veel groter en duurder waren.
  • Het scoorde ongelooflijk hoog op tests die meten hoe goed een robot knoppen, tekst en iconen op telefoons, computers en websites kan vinden.

Kortom: Het artikel laat zien dat als je je trainingsdata opschoont, je model zijn "ogen" vrij laat leren en een strikt "goed-of-fout"-beloningssysteem gebruikt, je een kleine, efficiënte robot kunt bouwen die beter is in het navigeren door je computerscherm dan veel gigantische, dure alternatieven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →