Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Qwen-UI-Agent is een op de echte wereld gerichte fundamentele GUI-agent die mobiele, computer-, web- en DeepSearch-omgevingen verenigt met een hybride actieruimte en een AutoResearch-stijl data-vliegwiel om state-of-the-art prestaties te behalen op mobiele benchmarks, terwijl het competitieve resultaten levert over bredere digitale taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een super-slimme robotvriend hebt die jouw digitale context kan verwerken en alles kan doen wat je vraagt. Maar op dit moment is deze robot als een student die alleen ooit heeft gestudeerd in een perfecte, stille klas zonder afleidingen. Het weet hoe het wiskundige problemen op papier moet oplossen, maar als je het in een echte, rommelige keuken zet met een plakkerig fornuis, een blaffende hond en een deur die klemt, kan het in de war raken en de toast laten vallen. Dit is de huidige staat van "GUI-agenten"—computerprogramma's die ontworpen zijn om naar schermen te kijken en op knoppen te klikken net zoals mensen dat doen. Ze zijn geweldig in het volgen van instructies in veilige, gesimuleerde videogames, maar ze struikelen vaak wanneer ze geconfronteerd worden met de chaotische, onvoorspelbare realiteit van echte telefoons en computers.
De grote vraag waar wetenschappers zich mee bezighouden is: Hoe leren we deze digitale helpers om te stoppen als klasstudenten en echte experts in de echte wereld te worden? We moeten ze niet alleen leren om op knoppen te klikken, maar ook om te begrijpen wanneer een pop-up advertentie hun zicht blokkeert, om te schakelen tussen hun telefoon en hun laptop zonder hun draad van gedachten te verliezen, en zelfs om op te merken wanneer er iets misgaat (zoals een geannuleerde vlucht) en een oplossing aan te bieden nog voordat je erom vraagt. Als we deze code kunnen kraken, kunnen deze agenten de ultieme assistenten worden, die alles regelen van het boeken van reizen tot het organiseren van je digitale leven, waardoor technologie minder voelt als een hulpmiddel waar je tegen moet vechten en meer als een partner die je gewoon begrijpt.
Maak kennis met Qwen-UI-Agent: De robot die leerde leven in de echte wereld
Maak kennis met Qwen-UI-Agent, een nieuw soort digitale helper ontwikkeld door het MAI-UI Team van Alibaba. Denk aan het verschil tussen een robot die oefent op een trainingspop en een robot die daadwerkelijk in de ring heeft gestreden. Terwijl andere agenten druk waren met het behalen van perfecte scores in videogame-simulaties, werd Qwen-UI-Agent de wildernis in gestuurd, waar het leerde navigeren over meer dan 100 fysieke telefoons met echte apps, echte internetverbindingen en echte levensverstoringen.
Het team realiseerde zich dat om een echt nuttige agent te maken, ze niet alleen de hersenen slimmer moesten maken; ze moesten het hele lichaam en de omgeving waarin de agent leeft veranderen. Hier is hoe ze het deden, met behulp van enkele leuke analogieën om de magie uit te leggen:
1. De "Real-World Gym" versus de "Videogame"
De meeste AI-agenten trainen in "sandboxes"—digitale kamers waar alles na elke poging perfect wordt gereset. Het is alsoals basketbal oefenen in een sportschool waar de basket nooit beweegt en de bal nooit fout stuiteren. Maar het echte leven is rommelig. Telefoons hebben pop-up advertenties, apps crashen, en je krijgt misschien een toestemmingsverzoek dat je niet had verwacht.
Qwen-UI-Agent werd getraind in een Real-Device Mobile Runtime. Stel je een enorme magazijn voor met meer dan 100 echte fysieke telefoons, die allemaal echte apps draaien zoals jij en ik die gebruiken. Het systeem is zo slim dat het een "zieke" telefoon kan herkennen (een telefoon die niet goed werkt) en de taak direct kan overzetten naar een gezonde telefoon, net zoals een coach een speler vervangt tijdens een wedstrijd. Dit stelde de agent in staat om te leren hoe hij de chaos van de echte wereld moet afhanden, van vreemde pop-ups tot netwerkstoringen, in plaats van alleen perfecte paden in een videogame te onthouden.
2. De "Zwitsers zakmes" Actieruimte
Voorheen waren agenten als mensen die alleen hun handen konden gebruiken (klikken en tikken). Als ze een bestand moesten verplaatsen of een complexe berekening moesten uitvoen, moesten ze urenlang door menu's klikken. Qwen-UI-Agent kreeg een Zwitsers zakmes.
Het leerde om GUI-acties (klikken, typen, scrollen) te mengen met CLI-acties (opdrachten typen in een terminal, zoals een computerwizard).
- De Analogie: Stel je voor dat je 100 foto's moet organiseren. Een normale agent zou "openen", "selecteren", "verplaatsen", "herhalen" 100 keer klikken. Qwen-UI-Agent kan zeggen: "Hé, ik typ gewoon een opdracht om al deze bestanden in één keer te verplaatsen!" Het kan ook acties batchen, wat betekent dat het een hele reeks bewegingen in één keer kan plannen, zoals een schaker die drie stappen vooruit denkt in plaats van telkens één stuk tegelijk te bewegen. Dit maakte het ongelooflijk snel en efficiënt.
3. De "Auto-Coach" Data Flywheel
Normaal gesproken vereist het onderwijzen van een robot veel menselijke leraren die testvragen bedenken en de antwoorden nakijken. Dat is traag en saai. Qwen-UI-Agent gebruikt een AutoResearch-stijl Data Flywheel.
Beschouw dit als een robotcoach die naar de robot kijkt terwijl deze speelt, ziet waar de robot een fout heeft gemaakt, en onmiddellijk een nieuwe, moeilijkere oefening ontwerpt die specifiek gericht is op het oplossen van die fout. De agent helpt zelf de taken te ontwerpen, vindt zijn eigen fouten en plant de volgende ronde van training. Het is een zelfverbeterende lus waarbij de robot beter wordt door zichzelf te onderwijzen, waarbij mensen alleen ingrijpen om hoogwaardige begeleiding te geven.
4. De "Proactieve Butler"
De meeste robots wachten tot je zegt: "Hé, doe dit." Maar Qwen-UI-Agent heeft een Harness Layer die het mogelijk maakt om proactief te zijn.
- De Analogie: Stel je voor dat je een melding krijgt dat je vlucht is geannuleerd. Een normale robot wacht tot jij hem vertelt dat hij naar een nieuwe vlucht moet zoeken. Qwen-UI-Agent detecteert de melding, concludeert de actiegerichte gebeurtenis, controleert je agenda, kijkt naar treinschema's, vergelijkt prijzen en presenteert je een volledig herstelplan voordat je überhaupt wakker bent geworden. Het wacht niet alleen op bevelen; het identificeert actiegerichte momenten uit je digitale signalen en stelt passende vervolgstappen voor.
De Resultaten: Heeft het gewerkt?
Het team heeft Qwen-UI-Agent getest in enkele zeer uitdagende arena's, en de resultaten waren indrukwekkend.
- Op echte telefoons: In een benchmark genaamd MobileWorld-Real, die echte telefoons met echte apps gebruikt, slaagde Qwen-UI-Agent 92,2% van de tijd. Het versloeg de beste closed-source modellen (zoals Opus 4.8 en GPT-5.6 Sol) met een aanzienlijke marge. In een andere test genaamd AndroidDaily behaalde het een bijna perfecte score van 97,5%.
- Op computers: Wanneer het werd getest op complexe computertaken (OSWorld-Verified), behaalde het 79,5%, waarmee het tweede werd in de algemene ranglijst en vele andere topmodellen versloeg. Het liet ook zien dat het langdurige, complexe taken kon afhanden, met een score van 40,0% voor gedeeltelijke voortgang op de moeilijkere OSWorld-v2 benchmark, wat betekent dat het het grootste deel van moeilijke klussen kon voltooien, zelfs als het niet elke stap perfect afmaakte.
- Op het web: Het scoorde 73,6% op WebArena, een test voor het navigeren door complexe websites, en 81.5% op ScreenSpot-Pro, wat bewijst dat het de juiste knop op een scherm kan vinden, zelfs als deze minuscuul of moeilijk te zien is.
Wat dit betekent
Het artikel suggereert dat om echt nuttige AI-agenten te bouwen, we niet alleen de hersenen groter kunnen maken; we moeten ook veranderen hoe ze leren en waar ze oefenen. Door te trainen op echte apparaten, verschillende manieren van handelen te mengen (klikken en coderen) en de agent te laten helpen bij het ontwerpen van zijn eigen training, heeft Qwen-UI-Agent aangetoond dat het mogelijk is om de kloof te overbruggen tussen "robot in een videogame" en "robot die je echt in het echte leven kan helpen".
Het is nog geen perfecte oplossing — de auteurs geven toe dat er nog steeds uitdagingen zijn met veiligheid en het volledig automatiseren van het hele proces — maar het is een enorme stap voorwaarts. Het laat zien dat met de juiste mix van praktijk in de echte wereld en slimme trainingslussen, onze digitale helpers eindelijk klaar zijn om de klas te verlaten en ons in de echte wereld bij te staan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.