← Nieuwste papers
💻 computer science

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

Het artikel introduceert ScreenParse, een groot dataset met dichte annotaties van 21 miljoen UI-elementen over 771.000 screenshots, en ScreenVLM, een compact model dat op deze data is getraind en aanzienlijk beter presteert dan grotere foundation-modellen bij het parseren van schermen, terwijl het bovendien de grondingscapaciteiten verbetert via overdraagbare structurele prioren.

Oorspronkelijke auteurs: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Schijnwerper" versus de "Hele Kamer"

Stel je voor dat je probeert een robot te leren navigeren door een drukke woonkamer.

  • De Oude Manier (Sparse Grounding): De meeste huidige AI-training is als het schijnen van een schijnwerper op slechts één object tegelijk. Als de instructie is "pakt de afstandsbediening op", leert de robot alleen hoe de afstandsbediening eruitziet. Het negeert de salontafel, de lamp, het tapijt en de tv. Als je het vervolgens vraagt om "op de bank te gaan zitten", raakt het misschien in de war omdat het nooit heeft geleerd waar de bank staat of hoe die eruitziet. Het kent alleen de specifieke dingen waarvoor het is gevraagd om te zoeken.
  • De Nieuwe Manier (ScreenParse): Dit paper stelt dat we, om een echt slim computeragent te maken, de plafondverlichting moeten aanzetten en de robot de hele kamer tegelijk moeten laten zien. We moeten het elk enkel object leren, waar het staat, hoe het heet en wat erop staat, allemaal tegelijkertijd.

De Oplossing: ScreenParse (De "Super-kaart")

De auteurs hebben een enorm nieuwe dataset gemaakt die ScreenParse heet. Denk hierbij aan een gigantische, ultra-gedetailleerde kaart van het internet.

  • Wat zit erin? Het bevat 771.000 screenshots van websites.
  • Hoe gedetailleerd is het? In tegenstelling tot eerdere kaarten die alleen de "belangrijke" knoppen markeerden, markeert deze kaart alles. Het identificeert 21 miljoen individuele elementen (zoals knoppen, tekstvakken, afbeeldingen, logo's) en labelt ze met een van de 55 verschillende typen.
  • De Schaal: Het is alsof je een kaart hebt die niet alleen de hoofdwegen toont, maar ook elk enkel huis, brievenbus, boom en straatbord in een hele stad.

Hoe Ze Het Maken: De "Webshot" Fabriek

Je zou kunnen vragen: "Hoe hebben ze 21 miljoen items gelabeld? Hebben ze een miljoen mensen in dienst genomen?"
Nee. Ze bouwden een geautomatiseerde fabriek genaamd Webshot.

  1. De Crawler: Het bezocht 1 miljoen verschillende websites (zoals een toerist die foto's maakt van elke straat).
  2. De Scanner: Het gebruikte een computerprogramma om automatisch elk zichtbaar element op de pagina te vinden (zoals een robotstofzuiger die elke stofbollen ziet).
  3. De Editor (De "Rechter"): Omdat computers fouten kunnen maken (zoals het labelen van een schaduw als een knop), gebruikten ze een slimme AI (een Vision Language Model) om te fungeren als een "kwaliteitsrechter". Het keek naar het werk van de computer, corrigeerde de labels en gooide screenshots weg die rommelig of verwarrend waren.

De Sterke Speler: ScreenVLM (De "Compacte Expert")

Met deze nieuwe "Super-kaart" trainden ze een nieuw AI-model genaamd ScreenVLM.

  • De Analogie: Stel je een bibliotheek voor. De grote foundation-modellen (zoals Qwen of InternVL) zijn als gigantische, zware encyclopedieën. Ze weten veel, maar ze zijn traag om te dragen en duur om te gebruiken.
  • ScreenVLM is als een pocketgroot, hooggespecialiseerd veldgids. Het is veel kleiner (slechts 316 miljoen parameters), maar omdat het is getraind op de "Super-kaart", is het ongelooflijk goed in het begrijpen van de indeling van een scherm.
  • Het Geheime Ingrediënt: Ze leerden ScreenVLM extra aandacht te besteden aan de "structuur" van de pagina (waar dingen zijn en wat ze zijn) in plaats van alleen de tekst te lezen. Het is alsof je een student leert om de plattegrond van een gebouw te onthouden, niet alleen de woorden op de borden.

De Resultaten: Waarom Het Belangrijke Is

Het paper testte deze nieuwe aanpak op drie manieren:

  1. De Test: Ze vroegen de modellen om het hele scherm te beschrijven. ScreenVLM was veel beter in het vinden van alles (60% nauwkeurigheid) vergeleken met de grote, zware modellen (die slechts ongeveer 30% nauwkeurigheid haalden).
  2. De Transfer: Ze namen andere grote modellen en gaven ze een "crashcursus" met behulp van de ScreenParse-kaart. Plotseling werden die grote modellen ook veel beter in het begrijpen van schermen. Dit bewijst dat het leren van de "hele kamer" een vaardigheid is die elke robot helpt, niet alleen de ene die ze bouwden.
  3. Snelheid: Omdat ScreenVLM klein is, draait het 4 keer sneller dan de grote modellen. Dit betekent dat het potentieel op een gewone laptop of telefoon kan draaien, niet alleen in een enorm datacenter.

De Conclusie

Het paper beweert dat we, om betere computer-gebruikende agenten te bouwen, moeten stoppen met ze te leren om slechts één ding tegelijk te zoeken. In plaats daarvan moeten we ze leren om het hele plaatje tegelijk te zien. Door een enorme dataset te maken die elk enkel pixel en element op een scherm labelt, bouwden ze een kleine, snelle en ongelooflijk slimme AI die computer schermen beter begrijpt dan de huidige reuzen.

Wat het paper NIET beweert:

  • Het beweert niet dat dit perfect werkt op mobiele apps of desktopsoftware (het richtte zich voornamelijk op websites).
  • Het beweert niet dat dit alle robotproblemen oplost, alleen dat het verbetert hoe robots een scherm "zien" en "begrijpen" voordat ze handelen.
  • Het vermeldt geen medische of klinische toepassingen; de focus ligt strikt op computerinterfaces (GUI's) en webpagina's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →