← Nieuwste papers
🤖 AI

Darwin Mobile Agent: A Roadmap for Self-Evolution

Dit artikel introduceert Darwin Mobile Agent, een open-source infrastructuur die gebruikmaakt van parallelle cloud-telefooninteracties om databottlenecks te overwinnen en een routekaart vast te stellen voor het verwijderen van menselijke priors uit takencurricula, verificatie en geheugen, waardoor autonome, zelf evoluerende agenten algemene gedragingen kunnen leren door interactie met complexe mobiele GUI-omgevingen.

Oorspronkelijke auteurs: Daniel Beechey, Derek Yuen, Jianheng Liu, Dezhao Luo, Tiantian He, Weilin Luo, Jun Wang, Kun Shao

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniel Beechey, Derek Yuen, Jianheng Liu, Dezhao Luo, Tiantian He, Weilin Luo, Jun Wang, Kun Shao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren hoe hij een smartphone moet gebruiken. Je zou een gigantische handleiding kunnen schrijven voor elke app, knop en scherm die hij ooit zou kunnen zien. Maar de echte wereld is te chaotisch en verandert te snel. In plaats daarvan stellen de auteurs van dit paper een andere aanpak voor: laat de robot leren door te doen, net zoals een menselijke baby leert lopen door te vallen en weer op te staan.

Ze noemen hun project Darwin Mobile Agent. Hier is een eenvoudige uitsplitsing van wat ze hebben gebouwd en waarom het ertoe doet, met behulp van alledaagse analogieën.

1. De "Grote Wereld" Speeltuin

De meeste AI-tests vinden plaats in een gecontroleerde, statische videogame (zoals Atari) waar de regels nooit veranderen. De auteurs stellen dat om een echt slimme agent te bouwen, deze moet oefenen in een "Grote Wereld" — een plek die enorm, complex en constant veranderend is.

  • De Analogie: Denk aan een level in een videogame dat nooit eindigt en waarbij er nieuwe kamers en meubels worden toegevoegd terwijl je speelt.
  • De Oplossing: Ze hebben mobiele telefoonschermen gekozen als deze "Grote Wereld". Waarom? Er zijn miljoenen apps, ze worden constant bijgewerkt en ze zitten vol met de complexiteit van de echte wereld. Het is een digitale zandbak die ordes van grootte complexer is dan de agent zelf.

2. De "Cloud Phone Farm" (De Sportschool)

Om te leren, moet de agent miljoenen keren oefenen. Als je dit op één fysieke telefoon zou proberen, zou het eeuwig duren. Als je een standaard computeremulator zou gebruiken, zou deze onstabiel zijn en vaak crashen.

  • De Analogie: Stel je een sportschool voor met 1.000 parallelle universums. In één universum probeert de robot een app te openen; in een ander probeert hij een sms te sturen. Ze gebeuren allemaal tegelijkertijd.
  • De Oplossing: Ze hebben een systeem gebouwd met behulp van cloud-gebaseerde telefoons. In plaats van te wachten tot één telefoon een taak heeft voltooid voordat de volgende begint, draait hun systeem honderden telefoons parallel.
  • De "Asynchrone" Truc: In een normale wachtrij wacht iedereen op de langzaamste persoon. In hun systeem, als één telefoon traag is (misschien is het internet traag), blijven de anderen doorwerken. De "snelle" telefoons staan niet stil te wachten op de "langzame" telefoons. Dit houdt het leerproces met hoge snelheid in gang.

3. De "Zelf-Evoluerende" Routekaart

De auteurs geloven dat voor een agent om echt te evolueren, we moeten stoppen met optreden als zijn leraar en hem zichzelf moeten laten onderwijzen. Ze stellen een driestapsroutekaart voor om menselijke hulp te elimineren, gericht op drie pijlers:

A. Het Curriculum (Wat om hierna te leren)

  • Huidige staat: Mensen kiezen de taken (bijv. "Open de weer-app").
  • Het Doel: De agent moet uiteindelijk zelf ontdekken waar hij slecht in is en om moeilijkere taken vragen om te oefenen, net zoals een student die beseft dat hij meer wiskunde-oefening nodig heeft.
  • De Stap in het Paper: Op dit moment kiezen mensen nog steeds de taken, maar ze kiezen taken die "precies goed" zijn — niet te makkelijk, niet onmogelijk — zodat de agent kan leren.

B. De Rechter (Heb ik gewonnen?)

  • Huidige staat: Mensen (of eenvoudige code) controleren of de robot geslaagd is.
  • Het Doel: De agent moet in staat zijn om naar wat hij heeft gedaan te kijken en te zeggen: "Ja, ik heb mijn doel bereikt", zonder dat er een mens over zijn schouder mee hoeft te kijken.
  • De Stap in het Paper: Ze gebruiken een slimme AI "Rechter" (een Large Language Model) om naar de acties van de robot te kijken en te beslissen of hij geslaagd is. Dit is een tussenstap tussen menselijke rechters en de robot die zichzelf beoordeelt.

C. Het Geheugen (Wat heb ik geleerd?)

  • Huidige staat: Mensen ontwerpen hoe de robot dingen onthoudt (bijv. "Houd de laatste 5 schermen in gedachten").
  • Het Doel: De agent moet leren hoe hij zijn eigen geheugen organiseert, door te beslissen wat belangrijk is om te onthouden en wat hij moet vergeten.
  • De Stap in het Paper: Op dit moment gebruikt het systeem een simpel "sliding window" (het onthoudt de laatste paar acties). Het doel is dat de agent uiteindelijk leert hoe hij zijn eigen geschiedenis kan samenvatten.

4. De Resultaten: Werkt het?

Het team heeft hun systeem getest met een specifiek AI-model (UI-TARS) dat probeerde 8 verschillende telefoon-taken op te lossen.

  • Het Leerde: De agent werd beter in zijn taken naarmate de tijd verstreek, wat bewijst dat het systeem werkt.
  • Het Schaalt: Ze lieten zien dat het toevoegen van meer cloud-telefoons de training versnelt, tot aan een punt waarop het AI-model zelf de flessenhals wordt (zoals 1.000 studenten hebben maar slechts één leraar).
  • Het is Robuust: Zelfs wanneer telefoons verbinding verloren of het internet vertraagde, bleef het systeem leren zonder te crashen.
  • De "Criticus" Les: Ze ontdekten dat als de "innerlijke stem" van de AI (die voorspelt hoe goed een zet is) begint met een willekeurige gok, de robot paniekt en stopt met leren. Maar als ze die innerlijke stem een zinvol startpunt geven, leert de robot soepel.

Samenvatting

De Darwin Mobile Agent is een nieuwe, open-source speeltuin die is ontworpen om AI te trainen om zelfstandig smartphones te gebruiken. In plaats van regels hard te coderen, hebben ze een enorme, parallelle "cloud-sportschool" gebouwd waar een AI miljoenen keren kan oefenen.

Hun uiteindelijke visie is een zelf-evoluerende agent: een agent die geen mensen nodig heeft om zijn huiswerk te kiezen, zijn toetsen af te nemen of zijn aantekeningen te ordenen. Hij leert, past zich aan en wordt slimmer door enkel zijn interacties met de complexe, chaotische wereld van mobiele apps. Dit paper bewijst dat de eerste stap van die visie stabiel is en klaar voor de volgende fase.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →