← Nieuwste papers
🤖 AI

VISTA: View-Consistent Self-Verified Training for GUI Grounding

VISTA is een op GRPO gebaseerd trainingsframework voor GUI-grounding dat de prestaties en robuustheid van modellen verbetert door vergelijkingsgroepen te construeren uit meerdere doelbehoudende weergaven van dezelfde instantie en een zelfverifieerbare cross-view anker te integreren om coördinatengeneratie te stabiliseren.

Oorspronkelijke auteurs: Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert hoe hij op knoppen op een computerscherm moet klikken. De taak van de robot is om een commando te beluisteren zoals "Klik op de Export-knop" en met zijn muis naar de exacte juiste plek te bewegen.

Dit artikel introduceert een nieuwe trainingsmethode genaamd VISTA om robots hier veel beter in te laten worden. Om te begrijpen waarom VISTA bijzonder is, moeten we eerst kijken naar het probleem dat het oplost.

Het Probleem: De "Hetzelfde Zicht"-valstrik

Voorheen leerden onderzoekers deze robots met een methode genaamd GRPO. Denk aan GRPO als een leraar die een student steeds weer dezelfde foto van een computerscherm laat zien, waarbij de student steeds de knop moet vinden.

  • De Makkelijke Casus: Als de knop groot en duidelijk is, krijgt de student het elke keer goed. De leraar denkt: "Geweldig!", maar er wordt niets nieuws geleerd omdat er geen verschil is tussen de pogingen.
  • De Moeilijke Casus: Als de knop klein of verborgen is, mist de student het elke keer. De leraar denkt: "O jee," maar er wordt ook hier niets nieuws geleerd, omdat elke poging op exact dezelfde manier mislukt.

In beide gevallen kan de leraar de student niet vertellen hoe hij moet verbeteren, omdat er geen variatie in de feedback is. Het is alsof je probeert te leren tennissen door 100 keer achter elkaar precies dezelfde bal op dezelfde plek te slaan; je leert nooit hoe je moet aanpassen aan een bewegende bal.

De Oplossing: VISTA (De "Inzoomen en Bijsnijden"-leraar)

VISTA verandert de regels door te beseffen dat een knop dezelfde knop blijft, ongeacht hoe je ernaar kijkt. In plaats van de robot telkens hetzelfde volledige scherm te tonen, creëert VISTA meerdere verschillende "crops" (ingezoomde of verschoven weergaven) van hetzelfde scherm, waarbij ervoor wordt gezorgd dat de doelknop altijd zichtbaar is.

Hier is hoe VISTA werkt, met behulp van een eenvoudige analogie:

1. De "Groepsfoto"-analogie (View-Consistent Groepen)

Stel je voor dat je een vriend probeert te leren hoe hij een specifieke rode auto op een parkeerplaats moet vinden.

  • De Oude Manier: Je laat hem 8 keer een brede foto van de hele parkeerplaats zien. Als hij de auto mist, mist hij hem 8 keer. Als hij hem vindt, vindt hij hem elke keer weer. Er vindt geen leren plaats.
  • De VISTA-manier: Je laat hem 8 verschillende foto's van dezelfde parkeerplaats zien. In sommige is de camera ingezoomd; in andere is de camera naar links of rechts verschoven. De rode auto zit in al deze foto's, maar de positie in de foto verandert.
    • In de ene foto is de auto makkelijk te spotten.
    • In een andere is hij gedeeltelijk verborgen door een boom.
    • In een derde zit hij helemaal in de hoek.

Nu moet de robot ontdekken: "Oké, de auto is hetzelfde, maar waar is hij in dit specifieke plaatje?" Dit dwingt de robot om het concept van de knop te leren, in plaats van alleen een enkele coördinaat uit het hoofd te leren. Dit creëert een "groep" van antwoorden waarbij sommige goed zijn en andere fout, wat de leraar nuttige gegevens geeft om de robot te verbeteren.

2. Het "Veiligheidsnet" (Self-Verified Anchor)

Er is een risico bij deze nieuwe methode: als de robot in de war raakt door de vreemde hoeken van de ingezoomde foto's, kan hij beginnen met wild gokken en vaker falen.

Om dit op te lossen, voegt VISTA een Self-Verified Anchor toe. Zie dit als een veiligheidsnet dat pas wordt uitgeklapt wanneer de robot er klaar voor is.

  • De leraar (de computer) houdt de pogingen van de robot in de gaten.
  • Als de robot de knop in geen enkele van de 8 foto's weet te vinden, doet de leraar niets. Hij dwingt het antwoord niet af, want de robot is er nog niet klaar voor.
  • Echter, als de robot erin slaagt om de knop in ten minste één van de foto's correct te vinden, zegt de leraar: "Aha! Je hebt bewezen dat je het kunt!"
  • Pas dan laat de leraar de robot het "perfecte antwoord" zien (het exacte midden van de knop) als een stabiliserende gids om dat succes vast te leggen.

Dit voorkomt dat de robot wordt gedwongen antwoorden te kopiëren die hij nog niet begrijpt, terwijl het hem wel een boost geeft wanneer hij laat zien dat hij in staat is tot de taak.

De Resultaten

De paper testte deze methode op verschillende benchmarks (zoals ScreenSpot-Pro, een moeilijke test voor het vinden van kleine knoppen).

  • Vóór VISTA: De robots (specifiek de Qwen3-VL modellen) kregen ongeveer 55% van de moeilijke klikken goed.
  • Na VISTA: Ze sprongen naar 63% tot 67% (afhankelijk van de modelgrootte).

De paper merkt ook op dat de robots "robuuster" zijn geworden. Zelfs als het scherm werd bijgesneden of vanuit een vreemde hoek werd bekeken tijdens de test, was de robot minder snel in de war of geneigd om zijn antwoord te "flippen".

Samenvatting

VISTA is een slimmere manier om AI te trainen om op knoppen te klikken. In plaats van de AI telkens op dezelfde statische afbeelding te laten oefenen, oefent de AI op veel verschillende "weergaven" van diezelfde afbeelding. Het geeft de AI pas het "spiekbriefje" (het perfecte antwoord) wanneer de AI al heeft bewezen dat hij het puzzelstukje zelfstandig kan oplossen. Dit maakt de AI slimmer, aanpasbaarder en beter in het vinden van knoppen op rommelige, echte computerschermen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →