← Nieuwste papers
💻 computer science

VISUALSKILL: Multimodal Skills for Computer-Use Agents

Het artikel introduceert VISUALSKILL, een multimodale skill-framework dat de prestaties van computergebruikende agenten op langdurige taken verbetert door visuele figuren in skill-artefacten te behouden in plaats van ze om te zetten naar tekst, wat resulteert in significante verbeteringen in nauwkeurigheid ten opzichte van zowel baseline als tekstgebaseerde skill-benaderingen.

Oorspronkelijke auteurs: Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij complexe software moet gebruiken, zoals een fotobewerkingsprogramma of een spreadsheetprogramma. De robot kan het scherm zien en de muis bewegen, maar hij "kent" de software niet. Het is alsof je een toerist een kaart van een stad geeft, maar de kaart is volledig geschreven in een vreemde taal en bevat geen plaatjes. Ze kunnen misschien raden waar ze heen moeten, maar ze zullen waarschijnlijk verdwalen, vooral als de straten veranderen of als ze een specifieke, verborgen steegjes moeten vinden.

Dit is het probleem dat het artikel VISUALSKILL probeert op te lossen.

Het Probleem: Tekstuele Kaarten versus Visuele Realiteit

Huidige "computer-gebruik agents" (robots die software gebruiken) worden behoorlijk goed, maar ze hebben nog steeds moeite met lange, ingewikkelde taken of software die ze nog nooit eerder hebben gezien.

Om hen te helpen, hebben onderzoekers "skill libraries" gebouwd—eigenlijk instructiehandleidingen voor de robot. Maar hier is het probleem: deze handleidingen zijn alleen in tekst geschreven.

Het artikel stelt dat dit om twee redenen een slecht idee is:

  1. Beelden beschrijven met woorden is moeilijk: Stel je voor dat je een robot probeert te vertellen op welke knop hij moet klikken door alleen te zeggen: "het blauwe penseelgereedschap." Als er vijf blauwe gereedschappen in de buurt zijn, klikt de robot misschien op de verkeerde. Een plaatje laat de exacte vorm en locatie direct zien.
  2. Controleren of je werk goed is, is moeilijk: In een taak met meerdere stappen moet de robot controleren: "Heb ik echt het juiste menu geopend?" Als de handleiding zegt: "Je zou een klein venster moeten zien verschijnen," moet de robot raden hoe dat eruitziet. Als de handleiding een screenshot laat zien van dat exacte venster, kan de robot het scherm simpelweg vergelijken met de foto en zeker weten of het klopt.

De Oplossing: VISUALSKILL

De auteurs creëerden VISUALSKILL, een nieuwe manier om deze instructiehandleidingen te bouwen. In plaats van alleen tekst, bewaart VISUALSKILL de originele afbeeldingen en screenshots direct naast de instructies.

Denk er zo over na:

  • De oude manier (alleen tekst): Een recept dat zegt: "Voeg de rode saus toe." (De robot moet raden welke fles rood is).
  • VISUALSKILL: Een recept dat zegt: "Voeg de rode saus toe," en direct daaronder staat een foto van exact die rode sausfles in de kast.

Hoe het is opgebouwd (De Twee-fasen Pipeline)

Het team heeft deze handleidingen niet met de hand geschreven; ze hebben een systeem gebouwd om ze automatisch te creëren in twee stappen:

  1. Fase 1: De Official Manual Miner.
    Ze nemen de officiële gebruikershandleiding van de software (de PDF of website die het bedrijf heeft gemaakt) en zetten deze om in een gestructureerde 'skill'. Ze behouden alle originele diagrammen en screenshots uit de gids. Dit geeft de robot een solide basis.

  2. Fase 2: De Live Explorer.
    Officiële handleidingen zijn vaak verouderd of missen de vreemde, kleine pop-upvensters die alleen verschijnen wanneer je de software daadwerkelijk gebruikt. Daarom stuurt het systeem een "robot-explorer" om de software daadwerkelijk te gebruiken.

    • Vrije Exploratie: De explorer dwaalt rond op het rustende scherm, klikt op knoppen om te zien wat er gebeurt, en maakt foto's van elk nieuw venster dat verschijnt.
    • Gerichte Exploratie: Het systeem kijkt naar taken waarbij de robot eerder vastliep. Het stelt vast: "Ah, de robot kwam vast te zitten op dit specifieke menu," en stuurt de explorer specifiek naar die plek om een foto te maken en een aantekening te schrijven.

Deze nieuwe foto's en aantekeningen worden vervolgens weer in de handleiding geplaatst, waardoor het een "levende" gids wordt die perfect overeenkomt met de echte software.

Hoe de Robot het Gebruikt

De robot leest niet de hele 100 pagina's handleiding in één keer (dat zou te veel informatie zijn). In plaats daarvan heeft hij een speciaal hulpmiddel genaamd load_topic.

  • De robot kijkt naar zijn huidige taak.
  • Hij controleert een korte index (zoals een inhoudsopgave) om te zien welk onderwerp relevant is.
  • Hij vraat aan het hulpmiddel: "Laat me de instructies voor dit onderwerp zien."
  • Het hulpmiddel haalt direct de tekst en de specische screenshots op die voor dat exacte moment nodig zijn.

De Resultaten

De onderzoekers hebben dit getest op twee belangrijke benchmarks (sets van moeilijke computertaken) met behulp van een krachtige AI-agent.

  • Geen Skill: De robot had geen hulp. Hij slaagde ongeveer 30% van de tijd.
  • Tekst-alleen Skill: Ze gaven de robot een tekstuele handleiding gemaakt uit dezelfde bron. Het succes steeg naar 37%.
  • VISUALSKILL (Multimodaal): Ze gaven de robot de handleiding met afbeeldingen. Het succes sprong naar 45%.

De belangrijkste bevinding: De afbeeldingen maakten een groot verschil. De robot was veel beter in:

  1. De juiste knop vinden: Hij kon het icoon zien in plaats van te moeten gissen op basis van een beschrijving.
  2. Zijn voortgang controleren: Hij kon het scherm vergelijken met de referentiefoto om te zien of hij op de goede weg was.

Waarom dit ertoe doet

Het artikel concludeert dat voor robots die computers gebruiken, visuele elementen niet alleen "leuk om te hebben" zijn—ze zijn essentieel. Proberen een grafische interface te beschrijven met alleen woorden is also als een schilderij proberen te beschrijven aan iemand die nog nooit een schilderij heeft gezien. Door de afbeeldingen in de instructiehandleiding te houden, kan de robot daadwerkelijk "zien" wat hij moet doen, net zoals een mens dat zou doen.

De auteurs ontdekten ook dat de manier waarop de robot de informatie krijgt belangrijk is. Als ze de robot gewoon bestanden lieten lezen zoals een mens een boek leest, sloeg hij de afbeeldingen vaak over. Door echter een speciaal hulpmiddel (load_topic) te gebruiken dat de tekst en afbeeldingen in één keer levert, gebruikte de robot de visuele aanwijzingen effectief.

Kortom: Vertel de robot niet alleen wat hij moet doen; laat het hem zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →