OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
OpenMobile is een open-source framework dat hoogwaardige instructies en agenttrajecten synthetiseert via een schaalbaar taakgeneratieproces en een beleidswisselstrategie, waardoor getrainde agents aanzienlijk betere prestaties behalen op mobiele taken dan bestaande open-data-benaderingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een slimme robot wilt bouwen die je smartphone voor je kan bedienen. Hij moet kunnen tikken, swipen, apps openen en taken uitvoeren, zoals "stuur een berichtje naar mijn moeder" of "zet een herinnering voor morgen".
Deze robots worden "mobiele agenten" genoemd. De beste robots die we nu hebben, zijn heel goed in dit werk, maar ze zijn als geheime recepten van een sterrenchef. Ze weten precies hoe ze het moeten doen, maar ze vertellen niemand hoe ze die kennis hebben opgedaan. Ze gebruiken een enorme, gesloten database met oefeningen die niemand anders kan zien.
Aan de andere kant hebben de open-source ontwikkelaars (die alles gratis en openbaar maken) maar een klein, oud kookboekje met weinig recepten. Daardoor zijn hun robots veel minder goed: ze struikelen vaak over simpele taken.
OpenMobile is het nieuwe project dat deze kloof overbrugt. Het is als een open keuken waar we een nieuwe manier hebben bedacht om robots te trainen, zonder dat we een geheim recept hoeven te stelen.
Hier is hoe het werkt, in drie simpele stappen:
1. Het Bouwen van een "Groot Geheugen" (In plaats van blind ronddwalen)
Stel je voor dat je een nieuwe stad moet leren kennen om een opdracht te krijgen.
- De oude manier: Je loopt willekeurig een straat in, ziet een bakkerij, en probeert direct een opdracht te bedenken zoals "koop brood". Je ziet alleen wat er direct voor je neus staat.
- De OpenMobile-methode: Je loopt eerst een hele dag door de stad. Je maakt een kaart van alle winkels, parken en gebouwen. Je weet nu dat er een bakkerij is, maar ook een supermarkt, een bibliotheek en een postkantoor.
- Het resultaat: Omdat je het hele plaatje ziet, kun je complexe opdrachten bedenken die je eerder niet zag, zoals: "Ga naar de bibliotheek, zoek een boek over koken, en neem dat mee naar de supermarkt om de ingrediënten te kopen."
In de paper noemen ze dit het bouwen van een "globale omgevingsscherm" (global environment memory). Ze laten de robot eerst alles verkennen en dan pas opdrachten bedenken die gebaseerd zijn op dat grote overzicht.
2. De "Meester en de Leerling" (Leren van fouten)
Nu de robot de opdrachten heeft, moet hij ze oefenen.
- De oude manier: Je laat een meester (een super-slimme AI) de taak perfect doen. De robot kijkt toe en probeert het na te doen. Maar wat gebeurt er als de robot een fout maakt? De meester corrigeert het niet; de robot ziet alleen het perfecte resultaat. Als de robot later in het echt een fout maakt, weet hij niet hoe hij zich moet redden.
- De OpenMobile-methode: Ze gebruiken een slimme truc: wisselend beleid.
- De robot (de leerling) begint de taak.
- Als de robot een fout maakt of vastloopt, grijpt de meester direct in en corrigeert de situatie.
- Daarna laat ze de robot weer verder gaan.
- De analogie: Het is alsof je fietsen leert. Als je bijna omvalt, grijpt je vader (de meester) in om je recht te houden, in plaats van alleen maar te laten zien hoe hij zelf perfect fietst. Zo leert de robot niet alleen hoe het moet, maar ook hoe hij zich moet redden als hij een fout maakt. Dit is cruciaal, want in het echte leven maken we allemaal fouten.
3. De Resultaten: Van "Beginner" naar "Pro"
Door deze twee methoden te combineren, hebben ze een enorme hoeveelheid oefenmateriaal gemaakt (2.800 opdrachten en 34.000 stappen) voor 20 verschillende Android-apps.
Toen ze hun robot (gebaseerd op een model genaamd Qwen) met dit materiaal trainden, gebeurde er iets magisch:
- De robot sprong van een score van ongeveer 25% naar 65% op de moeilijkste toetsen.
- Ze deden het nu bijna even goed als die dure, gesloten systemen van grote tech-bedrijven.
- Ze hebben bewezen dat hun robot niet gewoon de antwoorden heeft geleerd uit de toetsvragen (geen "crammen"), maar echt begrijpt hoe de apps werken en hoe hij fouten moet herstellen.
Waarom is dit belangrijk?
Voorheen was het alsof alleen rijke bedrijven met een geheime bibliotheek de slimste robots konden bouwen. OpenMobile geeft iedereen de sleutel tot die bibliotheek. Ze zeggen: "Kijk, dit is hoe je een robot traint die echt slim wordt: geef hem een groot overzicht van de wereld en leer hem hoe hij van zijn fouten moet herstellen."
Dit maakt de weg vrij voor een toekomst waarin iedereen, niet alleen grote bedrijven, slimme mobiele helpers kan bouwen die onze telefoons voor ons kunnen bedienen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.