← Nieuwste papers
💻 computer science

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

Dit artikel introduceert ScreenAnnotator, een open-source on-policy data-annotatietool die de kloof tussen bounding boxes en visuele redenering overbrugt door ruimtelijke, semantische en structurele primitieven te verenigen in één enkel schema, waardoor uiterst efficiënte datasynthese mogelijk wordt en de prestaties van vision-language modellen op complexe redeneertaken aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar momenteel onhandige robot probeert te leren om complexe afbeeldingen zoals stroomdiagrammen of mobiele app-schermen te begrijpen. Je wilt dat de robot niet alleen zegt "er is hier een vakje", maar ook uitlegt wat dat vakje is, waarom het daar staat en hoe het verbonden is met andere vakjes.

Het probleem is dat de tools die we momenteel gebruiken om robots te "leren" (annotatietools) lijken op ouderwetse klemborden. Ze zijn geweldig in het tekenen van een simpel kader rond een kat en het opschrijven "kat", maar ze zijn verschrikkelijk in de complexe, gelaagde instructies die moderne robots nodig hebben. Ze zijn rigide, traag, en zodra je de robot één ding hebt geleerd, moet je weer helemaal bij nul beginnen om het hem iets anders te leren.

De auteurs van dit artikel hebben een nieuwe tool gebouwd genaamd ScreenAnnotator om dit op te lossen. Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Alles-in-één" Lego-steen (Unified Annotation Atom)

Oude tools behandelen de locatie, de naam en de beschrijving van een afbeelding als drie aparte stukjes papier. Als je er één kwijtraakt, is de data corrupt.

ScreenAnnotator creëert één enkele "supersteen" (een Annotation Atom). Stel je een Lego-steentje voor dat het volgende heeft:

  • Een GPS-coördinaat (waar het is).
  • Een naamkaartje (wat het is).
  • Een gedetailleerd verhaal dat erop geschreven staat (een vrije beschrijving).
  • Een lijst met specifieke kenmerken (zoals "zittend", "bruin" of "dringend").

Door al deze informatie in één enkele eenheid samen te voegen, krijgt de robot een veel rijker en completer beeld van de wereld.

2. De "Co-piloot" Trainingslus (On-Policy Annotation)

Normaal gesproken is het leren van een robot een eenrichtingsverkeer: mensen tekenen kaders, dan leert de robot, en dan tekenen mensen meer kaders. De robot helpt de mens nooit.

ScreenAnnotator verandert dit in een dans.

  • Stap 1: De robot (de "Co-piloot") kijkt naar een nieuwe afbeelding en probeert te raden waar de vakjes staan en wat er staat.
  • Stap 2: Een mens kijkt naar de gok van de robot. Als de robot het goed heeft, zegt de mens alleen maar "Goed zo!" (wat tijd bespaart). Als de robot het fout heeft, corrigeert de mens dit.
  • Stap 3: De robot leert onmiddellijk van die correctie en wordt beter voordat hij naar de volgende afbeelding kijkt.

Het resultaat: In het begin is de robot onhandig en heeft hij veel hulp nodig. Maar naarmale hij leert, wordt hij zo goed dat de mens nauwelijks nog het scherm hoeft aan te raken. De mens heeft gekeken naar de afbeeldingen en zag dat voor stroomdiagrammen de robot uiteindelijk bijna 100% van de tijd uit zichzelf het goed heeft, en voor app-schermen doet hij het in 77% van de gevallen correct. De taak van de mens verschuift van "het werk doen" naar "het werk controleren".

3. De "Leugendetector" (Bayesian Annotation Verifier)

Zelfs met een Co-piloot worden er fouten gemaakt. Hoe weet je of de robot met veel zelfvertrouwen iets fout heeft?

De tool bevat een speciale Leugendetector (de Bayesian Annotation Verifier). Dit is geen mens, maar een slim algoritme dat fungeert als een kwaliteitscontroleur.

  • Het bekijkt elk vakje dat de robot tekent en vraagt: "Hoe zeker weten we dat dit correct is?"
  • Als de robot zelfverzekerd is, maar de wiskunde zegt dat het wankel is, markeert de Leugendetector dit.
  • Deze "verdachte" items worden teruggestuurd naar de mens voor een tweede blik.

Dit zorgt ervoor dat de robot niet leert van zijn eigen fouten. De paper toont aan dat deze tool ongelooflijk goed is in het opsporen van fouten; het vindt 2 tot 3 keer meer fouten in de top 1% van de gemarkeerde items dan wanneer je willekeurige plaatjes zou controleren.

4. Het "Receptenboek" (Template-Driven Synthesis)

Hier zit de grootste tijdbesparing. Normaal gesproken, als je een robot een nieuwe taak wilt leren (zoals "tel de vakjes" of "vind het pad van A naar B"), moet je mensen inhuren om duizenden afbeeldingen opnieuw te labelen.

ScreenAnnotator gebruikt een Receptenboek-aanpak.

  • Zodra de mens de afbeelding heeft gelabeld met de "Super-stenen" (Stap 1), kan het systeem automatisch duizenden verschillende vragen en antwoorden genereren vanuit diezelfde enkele afbeelding.
  • Het is alsof je één hoogwaardig ingrediment hebt (de gelabelde afbeelding) en je gebruikt een sjabloon om tegelijkertijd een taart, een pastei en koekjes te bakken.
  • Je hoeft de afbeelding niet opnieuw te labelen; je past alleen het "recept" (het sjabloon) aan om andere vragen te stellen.

De Grote Winst

De auteurs hebben dit getest op twee zaken: Stroomdiagrammen (diagrammen die processen laten zien) en Mobiele App-screenshots.

  • Efficiëntie: De tijd die nodig was om een afbeelding te labelen, daalde aanzienlijk naarmate de robot slimmer werd.
  • Slimmere Robots: Wanneer ze de data van ScreenAnnotator gebruikten om een robot te trainen, sprong het vermogen van de robot om stroomdiagrammen te begrijpen van 41% nauwkeurigheid naar 76,1%. Dat is een enorme sprong, wat bewijst dat betere datatools zorgen voor intelligentere robots.

Kortom: ScreenAnnotator is een tool die robots in staat stelt om mensen te helpen bij het labelen van data, de fouten van de robot automatisch op te sporen, en vervolgens één gelabelde afbeelding te veranderen in honderden verschillende trainingsoefeningen, waardoor het hele proces sneller, goedkoper en veel effectiever wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →