← Nieuwste papers
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

Dit artikel introduceert UI-MOPD, een nieuw framework dat multi-teacher on-policy distillatie en de nieuw geconstrueerde Uni-GUI dataset benut om een unificerende cross-platform GUI-agent te trainen, waarbij gespecialiseerde desktop- en mobiele expertise effectief wordt geïntegreerd terwijl uitdagingen met betrekking tot schaarse data en uiteenlopende interactieconventies worden overwonnen.

Oorspronkelijke auteurs: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je digitale assistent een meesterkok is. Maar hier komt de twist: deze chef moet tegelijkertijd in twee totaal verschillende keukens koken. De ene keuken is een high-tech desktopcomputer met een gigantisch scherm, een muis en een toetsenbord. De andere keuken is een gestroomlijnde, zakformaat mobiele telefoon met een touchscreen en geen fysieke knoppen. In de computerkeuken kan "teruggaan" betekenen dat je een venster sluit. Op de telefoonkeuken betekent het het tikken op een klein "terug"-pijltje. Als je probeert de chef in beide keukens te leren koken door simpelweg alle recepten door elkaar te mengen en op het beste te hopen, wordt het resultaat een ramp: de chef raakt in de war, vergeet hoe hij de muis moet gebruiken en probeert per ongeluk over een toetsenbord te swipen. Dit is precies het probleem waar wetenschappers geconfronteerd worden met "GUI-agents": slimme computerprogramma's die ontworpen zijn om te klikken, te typen en te swipen door ons digitale leven om taken voor ons uit te voeren.

Lange tijd waren deze agents als specialisten: de een was geweldig in computers, een ander in telefoons, maar ze konden niet beide aan. Onderzoekers probeerden dit op te lossen door de twee specialisten simpelweg bij elkaar te smijten, in de hoop dat hun gecombineerde kennis een super-agent zou creëren. Maar zoals dit nieuwe onderzoek suggereert, vervaagt die "mix-en-match"-aanpak vaak de lijnen, waardoor de agent slechter wordt in beide taken. De vraag die iedereen bezighoudt is: Hoe bouwen we een enkele, verenigde agent die naadloos kan schakelen tussen een desktop en een mobiele telefoon zonder zijn verstand of vaardigheden te verliezen?

Maak kennis met UI-MOPD, een slimme nieuwe methode voorgesteld door onderzoekers van Tsinghua University, Xiaomi en andere topinstellingen. Zie UI-MOPD niet als een blender, maar als een briljante coach met een unieke trainingsstrategie. In plaats van de student (de nieuwe verenigde agent) te dwingen een modderige mix van instructies te memoriseren, zet de coach een dynamisch trainingskamp op met twee expertmentoren: een "Desktop Guru" en een "Mobile Guru".

Zo werkt de magie. De student-agent gaat naar buiten en probeert zelfstandig taken op te lossen door zijn eigen "rollouts" (pogingen om een taak te voltooien) te genereren. Wanneer de student aan een computertaak werkt, roept de coach onmiddellijk de Desktop Guru erbij om specifiek, hoogwaardig advies te geven. Wanneer de student overschakelt naar een telefoontaak, wisselt de coach de Mobile Guru in. Dit wordt Multi-Platform On-Policy Distillation genoemd. Het cruciale aspect is dat de student leert van de juiste expert op het juiste moment, in plaats van te proberen hun verschillen uit te middelen. De Desktop Guru probeert de student niet te leren hoe hij moet swipen; de Mobile Guru probeert hen niet te leren hoe ze een muis moeten gebruiken. Ze fungeren als "gedragsankers", die de acties van de student trouw houden aan de specifieke regels van de omgeving waarin zij zich op dat moment bevinden.

De onderzoekers bouwden een enorme, hoogwaardige dataset genaamd Uni-GUI om dit mogelijk te maken. Ze creëerden een speciale tool om bijna 10.000 hoogwaardige, werkende voorbeelden te verzamelen van taken die op zowel computers als telefoons worden uitgevoerd. Ze filterden de slechte pogingen eruit en behielden alleen de exemplaren die daadwerkelijk werkten, om ervoor te zorgen dat de docenten perfecte voorbeelden hadden om aan de student te tonen.

Toen ze deze nieuwe aanpak testten, waren de resultaten veelbelovend. Op een uitdagende computerbenchmark genaamd OSWorld slaagde de nieuwe agent 38,2% van de tijd. Op een mobiele benchmark genaamd MobileWorld slaagde hij 12,0% van de tijd. Deze cijfers suggereren dat UI-MOPD aanzienlijk beter is dan eerdere methoden die probeerden data simpelweg te mengen of modellen samen te voegen. Zo terwijl andere methoden misschien één platform verbeteren maar het andere verpesten, slaagde UI-MOPD erin om de prestaties aan beide kanten gelijktijdig te verhogen. De studie geeft aan dat deze "specialistische coach"-methode de agent helpt zijn algemene intelligentie te behouden terwijl hij leert navigeren door de specifieke eigenaardigheden van verschillende apparaten, waardoor de "gemiddelde"-valstrik wordt vermeden die eerdere modellen in de war bracht.

Kortom, het artikel suggereert dat als je een slimme agent wilt die zowel je laptop als je telefoon kan bedienen, je ze niet gewoon bij elkaar moet stampen. In plaats daarvan geef je het een slim systeem dat precies weet naar welke expert het moet luisteren, afhankelijk van welk scherm het bekijkt. Het is een stap naar een toekomst waarin je digitale assistent echt een meester is in alle digitale domeinen, en niet slechts in één.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →