Qwen-CUA: Native Computer Use for (almost) Everything
Het artikel introduceert Qwen-CUA, een native computer-use agent gebouwd op een 397B mixture-of-experts backbone die uitsluitend opereert via screenshots en input-events zonder afhankelijk te zijn van DOM-trees, waarmee het de state-of-the-art prestaties bereikt op computer-use benchmarks door middel van grootschalige cloud rollout training, verifiable reward optimization en een schaalbare architectuur.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je computer niet alleen op je wacht om op knoppen te klikken, maar ook echt kijkt naar wat je doet en leert om dit voor je over te nemen. Dit is de opwindende grens van "AI-agenten", een tak van de wetenschap waarbij computers worden geleerd om zich in de digitale wereld als mensen te gedragen. Een lange tijd waren deze agenten als briljante studenten die alleen tekstboeken (code) konden lezen of strikte instructiehandleidingen (API's) konden volgen. Ze waren geweldig in wiskunde en logica, maar als je hen vroeg een rommelig, ouderwets programma te gebruiken of een website die elke keer verandert wanneer je de pagina ververst, raakten ze de weg kwijt. Ze konden het scherm niet "zien" zoals een mens dat doet; ze hadden speciale blauwdrukken van de websitestructuur nodig om te weten waar de knoppen zaten. Maar een groot deel van ons digitale leven speelt zich af op schermen die geen dergelijke blauwdrukken hebben. Dit artikel pakt de uitdaging aan om een AI te leren een echte digitale leerling te zijn: één die naar een scherm kijkt, uitzoekt wat hij moet doen, en klikt of typt precies zoals een mens dat zou doen, zonder dat er speciale afkortingen of verborgen kaarten nodig zijn.
Het team achter dit onderzoek introduceert Qwen-CUA, een nieuw soort AI-agent die is ontworpen om een "native" computergebruiker te zijn. Denk erbij als het leren aan een robot om een auto te besturen. In plaats van de robot een perfecte digitale kaart van elke weg en elk verkeerslicht te geven (wat voor veel oude of complexe softwareprogramma's niet bestaat), hebben ze de robot geleerd om uit het raam te kijken, de weg te zien en het stuur te draaien op basis van wat hij ziet. Qwen-CUA "ziet" alleen screenshots van het computerscherm en "handelt" alleen door toetsenbord- en muiscommando's te sturen. Het kijkt niet onder de motorkap naar de code of vraagt de software om hulp; het kijkt gewoon toe en leert.
Om deze robot slim genoeg te maken om echte taken aan te kunnen, moesten de onderzoekers een enorme trainingsgym bouwen. Ze creëerden een cloudgebaseerde vloot met bijna 100.000 virtuele CPU's (stel je een stad voor van duizenden computers die tegelijkertijd werken) en zetten ongeveer 40.000 verschillende taken op voor de AI om te oefenen. Deze taken varieerden van eenvoudige zaken zoals het organiseren van bestanden tot complexe, meerstaps workflows in professionele software. De AI kreeg niet alleen een "goed gedaan" of "probeer het opnieuw" aan het einde; het systeem was zo ontworpen dat het controleerde of de taak daadwerkelijk correct was uitgevoerd, waardoor de AI steeds opnieuw van zijn fouten kon leren.
De resultaten zijn indrukwekkend. In tests over acht verschillende benchmarks presteerde Qwen-CUA consequent beter dan zijn vorige versie, Qwen3.7, en hield het zelfs stand tegen enkele van de krachtigste, duurste AI-systemen die vandaag de dag beschikbaar zijn. Zo scoorde Qwen-CUA op een test genaamd OSWorld-Verified, die meet hoe goed een AI alledaagse desktoptaken kan afhandelen, een 86,2, terwijl het vorige model een 73,3 haalde. Wanneer ze dit opschaalden naar een nog groter model genaamd Qwen-CUA-Max (met meer dan één biljoen parameters), steeg de score naar 87,6.
Een van de coolste aspecten van dit artikel is hoe het omgaat met lange, ingewikkelde taken. Stel je voor dat je probeert te onthouden wat er in een verhaal stond dat je een week geleden hebt gelezen, terwijl je een nieuw hoofdstuk schrijft. De AI moest zich herinneren hoe het scherm er vele stappen geleden uitzag om te weten waar hij zich in zijn taak bevond. De onderzoekers losten dit op door de AI een "visueel geheugen" te geven dat de laatste 20 screenshots vasthoudt en oudere screenshots slim "vouwdt" tot een samenvatting, zodat hij niet overweldigd raakt. Dit stelde de AI in staat om de controle te behouden tijdens lange workflows zonder het begin van het verhaal te vergeten.
Het artikel keek ook naar veiligheid. Ze testten de AI tegen "RedTeamCUA", een uitdaging waarbij de AI wordt misleid door valse instructies die verborgen zitten in het scherm. Het nieuwe model was veel beter in het negeren van deze trucs, waarbij het succespercentage van aanvallen daalde van 36,6% naar 16,4%, terwijl het zijn eigen taken nog steeds uitvoerde.
Ten slotte verkenden de onderzoekers een "hybride" aanpak. Ze ontdekten dat als ze de AI een command-line tool (zoals een tekstgebaseerde toverstaf voor bestandsoperaties) lieten gebruiken naast zijn muis- en toetsenbordvaardigheden, hij taken sneller kon voltooien. De AI wisselde echter soms op het verkeerde moment van gereedschap, dus hoewel het sneller was, was het nog niet altijd perfect. De auteurs suggereren dat met meer training, deze mix van visueel kijken en tekstgebaseerde commando's de sleutel kan zijn om AI-agenten echt efficiënt te maken.
Kortom, dit artikel laat zien dat we geen speciale bruggen nodig hebben om AI met onze computers te verbinden. Door de AI simpelweg te leren naar het scherm te kijken en te handelen als een mens, kunnen we agenten bouwen die klaar zijn om bijna elke software aan te pakken, van de nieuwste apps tot de oudste programma's, terwijl ze leren van enorme hoeveelheden praktijkervaring uit de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.