← Derniers articles
💬 NLP

iOSWorld: A Benchmark for Personally Intelligent Phone Agents

Ce document introduit iOSWorld, le premier benchmark de simulateur iOS natif interactif comprenant 26 applications interconnectées et une identité utilisateur persistante pour évaluer les agents téléphoniques personnellement intelligents, révélant que bien que l'accès privilégié à la vision et au XML améliore considérablement les performances des modèles de pointe, les agents actuels éprouvent encore des difficultés avec les tâches complexes multi-applications et de personnalisation.

Auteurs originaux : Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Publié 2026-06-09
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant numérique qui vit à l'intérieur de votre téléphone. Actuellement, la plupart de ces assistants sont comme des touristes amnésiques. Ils peuvent suivre une instruction unique parfaitement — comme « allume la lampe torche » — mais si vous leur demandez de « planifier ma semaine en fonction de mes habitudes habituelles, de mon solde bancaire et de mes messages », ils se perdent. Ils ne savent pas qui vous êtes, ils ne se souviennent pas de votre historique et ils ne peuvent pas faire le lien entre vos différentes applications.

Le document « iOSWorld » introduit une nouvelle façon de tester si un assistant de téléphone est réellement assez intelligent pour être votre aide personnel. Voici la décomposition en termes simples :

1. Le Problème : La « Page Blanche » vs la « Vie Réelle »

Les tests actuels pour les assistants de téléphone sont comme donner un carnet de notes vierge à quelqu'un et lui demander d'écrire une histoire. La personne peut écrire une phrase, mais elle n'a pas d'antécédents.

  • La Réalité : Votre téléphone est rempli de données représentant toute une vie : vos transactions bancaires, vos projets de voyage, les noms de vos amis et vos restaurants préférés. Un assistant vraiment utile doit connaître tout cela.
  • L'Écart : Personne n'avait de moyen de tester si une IA pouvait réellement naviguer dans cette vie réelle, désordonnée et connectée. La plupart des tests ne regardaient que des tâches isolées sur des téléphones Android, ignorant la manière unique dont les iPhone (iOS) fonctionnent.

2. La Solution : Construire « iOSWorld »

Les chercheurs ont construit un jeu vidéo interactif géant qui imite un véritable iPhone.

  • Le Personnage : Ils ont créé une personne fictive nommée Jordan Avery, un habitant de San Francisco de 31 ans.
  • Le Monde : Ils ont construit 26 applications personnalisées pour Jordan (comme un faux Uber, une fausse banque, un faux e-mail et une fausse application de livraison de nourriture).
  • La Magie : Ces applications sont toutes connectées. Si Jordan commande un burrito sur l'application « QuickBite », l'application « MyBank » affiche automatiquement un débit, et l'application « Mail » reçoit un reçu. Si Jordan réserve un vol sur « SkyTrip », l'application « Notes » contient un rappel pour cela.
  • Le But : Ils ont donné à l'IA 133 missions différentes. Certaines étaient simples (commander un café), mais beaucoup étaient complexes (vérifier votre solde bancaire, trouver le reçu de ce café et dire à votre patron que vous êtes en retard en fonction de votre calendrier).

3. Le Test : Deux Façons de Regarder le Téléphone

Pour voir à quel point l'IA est intelligente, ils l'ont testée dans deux « modes » différents, comme si l'on donnait à un humain un test avec ou sans antisèche :

  • Mode A : Vision Seule (Le Test « Aveugle »)
    L'IA voit uniquement des captures d'écran de l'écran, tout comme un humain le fait. Elle doit deviner où se trouvent les boutons et comprendre ce qui se passe en regardant les images.

    • Analogie : Comme essayer de résoudre un puzzle en regardant seulement une photo floue de celui-ci.
  • Mode B : Vision + XML (Le Test « Super-Vue »)
    L'IA voit les captures d'écran plus une liste de texte cachée (appelée arbre d'accessibilité) qui lui indique exactement ce que chaque bouton est censé être et où il se trouve.

    • Analogie : Comme regarder le puzzle avec un surligneur brillant qui pointe chaque pièce et dit : « Ceci est la pièce du ciel, ceci est la pièce de l'arbre ».

4. Les Résultats : Qui a Réussi le Test ?

Ils ont testé les modèles d'IA les plus intelligents disponibles (les modèles « frontières ») ainsi qu'un modèle open-source.

  • La Bonne Nouvelle : Lorsque l'IA avait la « Super-Vue » (Vision + XML), les modèles les plus intelligents devenaient bien meilleurs. Ils pouvaient enfin naviguer correctement dans les applications. Un modèle (Opus) est passé de 26 % de tâches réussies à 52 % de réussite.
  • La Mauvaise Nouvelle : Même avec la meilleure configuration, l'IA luttait encore avec les tâches les plus difficiles.
    • Tâches d'une seule application : Elles ont très bien réussi (82 % de succès).
    • Tâches multi-applications : Elles ont eu du mal (37 % de succès). Faire le lien entre 3 ou 4 applications différentes était trop difficile.
    • Tâches de mémoire : Elles étaient correctes (54 % de succès), mais oubliaient souvent les détails.
  • Le Problème des « Petits Modèles » : Les modèles d'IA plus petits et moins coûteux devenaient en fait moins performants lorsqu'ils recevaient les données « Super-Vue ». C'était comme donner trop d'informations à un étudiant ; ils étaient submergés et confus.

5. Pourquoi Ont-ils Échoué ?

Les chercheurs ont trouvé trois raisons principales pour lesquelles l'IA restait bloquée :

  1. Manquer de Temps : L'IA disposait de 50 étapes pour terminer une tâche. Sur des travaux complexes, elle utilisait toutes les 50 étapes juste pour essayer de comprendre où cliquer, ne laissant plus de temps pour finir le travail.
  2. Se Perdre : L'IA ouvrait la mauvaise application ou restait coincée dans une boucle, cliquant sur le même bouton de manière répétée.
  3. Le Problème des « Coordonnées » : En mode « Vision Seule », l'IA devinait souvent le mauvais endroit sur l'écran pour appuyer, comme essayer d'attraper une balle dans le noir.

Le Mot de la Fin

iOSWorld est la première fois que nous testons des assistants de téléphone dans un environnement réaliste et connecté qui imite la vie numérique réelle d'un humain.

Le document conclut que, bien que l'IA s'améliore pour regarder un écran et cliquer sur des boutons, elle n'est pas encore assez intelligente pour être un véritable assistant « personnellement intelligent » qui comprend votre historique, votre argent et vos relations à travers différentes applications. Elle doit s'améliorer en matière de planification, de mémoire et de connexion des points avant de pouvoir véritablement remplacer un assistant humain.

La bonne nouvelle ? Les chercheurs ont publié tout leur code et le « jeu » gratuitement, afin que d'autres scientifiques puissent essayer de construire de meilleurs assistants en utilisant ce nouveau terrain de jeu.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →