← Nieuwste papers
🤖 AI

DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

Het artikel introduceert DragOn, een uitgebreide benchmark en dataset bestaande uit 286K screenshots en 3,5M taken over vier domeinen om het tekort aan drag-gebaseerde GUI-interactiedata aan te pakken, waarbij wordt aangetoond dat het finetunen op deze dataset de prestaties van state-of-the-art vision-language modellen op complexe computergebruikstaken aanzienlijk verbetert.

Oorspronkelijke auteurs: Nathan Bout, Maxime Langevin, Ronan Riochet

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nathan Bout, Maxime Langevin, Ronan Riochet

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een computer te gebruiken. Tot nu toe zijn we erg goed geweest in het leren aan robots hoe ze op een knop moeten klikken. Het is alsof je een kind leert naar een plaatje te wijzen en te zeggen: "Raak dat aan!" We hebben hiervan miljoenen voorbeelden, en de robots worden er steeds beter in.

Maar er is een veel moeilijkere vaardigheid: slepen (dragging).

Denk bij slepen aan het optillen van een zware doos en deze naar een nieuwe plek verplaatsen, of het swipen met je vinger om naar beneden te scrollen op een pagina, of het vastpakken van de hoek van een foto om deze groter te maken. Deze acties vereuren dat de robot niet alleen begrijpt waar hij moet raken, maar ook hoe hij van punt A naar punt B moet bewegen. Momenteel zijn robots hier erg slecht in. Ze zijn als peuters die wel naar een speeltje kunnen wijzen, maar niet begrijpen hoe ze het moeten oppakken en door de kamer moeten dragen.

Het paper introduceert een nieuwe tool genaamd DragOn om dit probleem op te lossen. Zo werkt het, eenvoudig uitgelegd:

1. Het Probleem: Een gebrek aan "Sleeppraktijk"

De auteurs merkten op dat terwijl we enorme bibliotheken aan data hebben om robots te leren klikken, de data om hen te leren slepen minuscuul is—ongeveer 10 tot 100 keer kleiner. Hierdoor hebben zelfs de slimste AI-modellen (zoals die van OpenAI of Anthropic) moeite met taken zoals het selecteren van tekst, het veranderen van de grootte van vensters of het bedienen van schuifregelaars. Ze raken in de war en falen vaak.

2. De Oplossing: "Rendering-als-Supervisie"

Om een enorme bibliotheek aan sleep-voorbeelden op te bouwen zonder duizenden mensen handmatig te laten klikken en slepen, hebben de auteurs een slimme truc bedacht die ze "Rendering-as-Supervision" noemen.

  • De Oude Manier: Stel je een mens voor die naar een scherm kijkt, een kader rond een woord tekent en de coördinaten opschrijft. Dit is traag en duur.
  • De DragOn-Manier: Stel je voor dat je een magische blauwdruk hebt van een document (zoals een PDF of een spreadsheet). De computer weet precies waar elke letter en cel zich bevindt omdat hij het document zelf heeft opgebouwd. In plaats van naar de afbeelding te kijken en te gokken, vraagt de computer simpelweg aan de blauwdruk: "Waar is het woord 'Hallo'?" De blauwdruk zegt: "Het is op deze exacte coördinaten."

De computer "rendert" (tekent) vervolgens de afbeelding en labelt automatisch de begin- en eindpunten van de sleepactie op basis van die blauwdruk. Het is also kind van een GPS die de exacte locatie van elk verkeersbord kent voordat je de weg überhaupt hebt ingereden. Hierdoor konden ze zeer snel en goedkoop 3,5 miljoen trainingsopdrachten creëren.

3. De Dataset: Vier Nieuwe Speeltuinen

Ze hebben niet slechts één type sleep-taak gemaakt; ze bouwden vier verschillende "speeltuinen" waarop de robots kunnen oefenen:

  • Tekst Markeren: Over een zin slepen om deze te selecteren (zoals een woord markeren in een tekstboek).
  • Cel Selecteren: Over een raster in een spreadsheet slepen om een blok getallen te selecteren.
  • Elementen Resizen: De hoek van een foto of venster vastpakken en eraan trekken om deze groter of kleiner te maken.
  • Schuifregelaar Bediening: Een schuifbalk vastpakken (zoals een volumeregeling) en deze naar links of rechts schuiven.

In totaal hebben ze 286.000 screenshots gemaakt voor de robots om van te leren.

4. De Resultaten: Oefening Baart Perfectie

De auteurs hebben deze nieuwe dataset getest op de slimste AI-modellen ter wereld.

  • De Baseline: De beste "off-the-shelf" AI-modellen (zoals GPT en Claude) scoorden onder de 30% op deze taken. Ze faalden in feite vaker dan dat ze slaagden.
  • De Doorbraak: De auteurs namen een open-source AI-model en trainden dit specif으로 op de nieuwe DragOn-dataset.
  • De Uitkomst: Dit getrainde model sprong naar een nauwkeurigheid van 35,3%. Hoewel dat misschien niet als een enorm getal klinkt, was het een enorme verbetering ten opzichte van het basismodel (dat slechts op 2,3% zat) en het versloeg zelfs de duurste, propriëtaire modellen op drie van de vier taken.

De Kernboodschap

Het paper stelt dat door AI-modellen een enorme, hoogwaardige bibliotheek van "sleep"-voorbeelden te geven—gecreëerd via een slimme, geautomatiseerde blauwdruk-methode—we hen veel beter complexe computertaken kunnen leren. Het bewijst dat data de sleutel is: zelfs een standaard open-source model kan de meest dure commerciële modellen verslaan als het getraind wordt op het juiste soort oefenmateriaal.

De auteurs hopen dat deze nieuwe benchmark en dataset toekomstige robots zullen helpen om betrouwbare "computergebruikers" te worden die meer kunnen dan alleen klikken; ze kunnen eindelijk leren om te slepen, los te laten, te resizen en te swipen, net zoals een mens dat doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →