iOSWorld: A Benchmark for Personally Intelligent Phone Agents
Dit artikel introduceert iOSWorld, de eerste interactieve native iOS-simulator benchmark met 26 onderling verbonden apps en een persistente gebruikersidentiteit om persoonlijk intelligente telefoonagenten te evalueren, wat onthult dat hoewel bevoorrechte toegang tot visie+XML de prestaties van frontiermodellen aanzienlijk verbetert, huidige agenten nog steeds moeite hebben met complexe multi-app en personalisatietaken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een digitale assistent hebt die in je telefoon leeft. Op dit moment zijn de meeste van deze assistenten als amnesische toeristen. Ze kunnen één instructie perfect opvolgen — zoals "doe zaklamp aan" — maar als je hen vraagt om "mijn week te plannen op basis van mijn gebruikelijke gewoonten, mijn banksaldo en mijn sms-berichten," raken ze de weg kwijt. Ze weten niet wie je bent, ze herinneren zich je geschiedenis niet en ze kunnen de verbanden tussen je verschillende apps niet leggen.
Het paper "iOSWorld" introduceert een nieuwe manier om te testen of een telefoonassistent daadwerkelijk slim genoeg is om jouw persoonlijke hulpje te zijn. Hier is de uitsplitsing in eenvoudige termen:
1. Het Probleem: Het "Lege Blad" versus het "Echte Leven"
Huidige tests voor telefoonassistenten zijn als iemand een leeg schrift geven en vragen om een verhaal te schrijven. Ze kunnen een zin schrijven, maar ze hebben geen achtergrondverhaal.
- De Realiteit: Je telefoon zit vol met een leven aan data: je banktransacties, je reisplannen, de namen van je vrienden en je favoriete restaurants. Een echt nuttige assistent moet dit allemaal weten.
- De Kloof: Niemand had een manier om te testen of een AI daadwerkelijk door dit chaotische, verbonden echte leven kon navigeren. De meeste tests keken alleen naar geïsoleerde taken op Android-telefoons, waarbij de unieke manier waarop iPhones (iOS) werken werden genegeerd.
2. De Oplossing: Het Bouwen van "iOSWorld"
De onderzoekers hebben een gigantisch, interactief computerspel gebouwd dat een echte iPhone nabootst.
- Het Personage: Ze hebben een fictief persoon gecreëerd genaamd Jordan Avery, een 31-jarige die in San Francisco woont.
- De Wereld: Ze hebben 26 aangepaste apps gebouwd voor Jordan (zoals een nep Uber, een nep bank, een nep e-mail en een nep maaltijdbezorg-app).
- De Magie: Deze apps zijn allemaal met elkaar verbonden. Als Jordan een burrito bestelt via de "QuickBite"-app, toont de "MyBank"-app automatisch een afschrijving, en krijgt de "Mail"-app een bonnetje. Als Jordan een vlucht boekt op "SkyTrip," staat er een herinnering voor in de "Notes"-app.
- Het Doel: Ze gaven de AI 133 verschillende missies. Sommige waren simpel (bestel een koffie), maar veel waren complex (controleer je banksaldo, zoek het bonnetje van die koffie op en laat je baas weten dat je te laat komt op basis van je agenda).
3. De Test: Twee Manieren om naar de Telefoon te Kijken
Om te zien hoe slim de AI echt is, testten ze de AI in twee verschillende "modi", alsof je een mens een test geeft met of zonder spiekbriefje:
Modus A: Alleen Visueel (De "Blinde" Test)
De AI ziet alleen screenshots van het scherm, precies zoals een mens dat doet. De AI moet raden waar knoppen zitten en begrijpen wat er gebeurt door naar de plaatjes te kijken.- Analogie: Als proberen een puzzel op te lossen door alleen naar een wazige foto ervan te kijken.
Modus B: Visueel + XML (De "Superzicht"-Test)
De AI ziet de screenshots plus een verborgen tekstlijst (een zogenaamde toegankelijkheidsboom of "accessibility tree") die precies vertelt wat elke knop is en waar deze zich bevindt.- Analogie: Als kijken naar de puzzel met een gloeiende highlighter die naar elk stukje wijst en zegt: "Dit is het stukje lucht, dit is het stukje boom."
4. De Resultaten: Wie Haalde de Test?
Ze testten de slimste AI-modellen die beschikbaar zijn (de "frontier" modellen) en één open-source model.
- Het Goede Nieuws: Wanneer de AI "Superzicht" had (Visueel + XML), werden de slimste modellen veel beter. Ze konden de apps eindelijk correct navigeren. Eén model (Opus) sprong van het succesvol afronden van 26% van de taken naar 52% succesvolle taken.
- Het Slechte Nieuws: Zelfs met de beste opstelling worstelden de AI's nog steeds met de moeilijkste taken.
- Taken met één app: Ze deden het goed (82% succes).
- Taken met meerdere apps: Ze hadden moeite (37% succes). Het leggen van de verbanden tussen 3 of 4 verschillende apps was te moeilijk.
- Geheugentaken: Ze waren oké (54% succes), maar vergaten vaak de details.
- Het "Klein Model"-Probleem: Kleinere, goedkopere AI-modellen werden zelfs slechter wanneer ze de "Superzicht"-data kregen. Het was alsocht het geven van te veel informatie aan een student; ze raakten overweldigd en in de war.
5. Waarom Faalden Ze?
De onderzoekers vonden drie hoofdoorzaken waarom de AI vastliep:
- Tijd tekortkomen: De AI kreeg 50 stappen om een taak te voltooien. Bij complexe klussen gebruikte de AI al 50 stappen alleen maar om uit te zoeken waar hij moest klikken, waardoor er geen tijd overbleef om de klus te klaren.
- Verdwalen: De AI opende de verkeerde app of kwam vast te zitten in een loop, waarbij hij steeds weer op dezelfde knop klikte.
- Het "Coördinaat"-Probleem: In de "Alleen Visueel"-modus gokte de AI vaak de verkeerde plek op het scherm om te tikken, alsof hij probeerde een bal te vangen in het donker.
De Kernboodschap
iOSWorld is de eerste keer dat we telefoonassistenten hebben getest in een realistische, verbonden omgeving die het digitale leven van een echt mens nabootst.
Het paper concludeert dat hoewel AI beter wordt in het bekijken van een scherm en het klikken op knoppen, het nog niet slim genoeg is om een echt "persoonlijk intelligente" assistent te zijn die jouw geschiedenis, je geld en je relaties over verschillende apps heen begrijpt. Het moet beter worden in plannen, onthouden en het leggen van verbanden voordat het echt een menselijke assistent kan vervangen.
Het goede nieuws? De onderzoekers hebben al hun code en het "spel" gratis vrijgegeven, zodat andere wetenschappers betere assistenten kunnen bouwen met behulp van deze nieuwe speeltuin.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.