MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous embauchiez un assistant personnel pour vous aider à gérer votre vie. Vous ne lui donneriez pas un bureau neuf et vide, sans aucun dossier, aucune photo et aucun souvenir de qui vous êtes, n'est-ce pas ? Vous vous attendriez à ce qu'il connaisse votre café préféré, le solde de votre compte bancaire, vos prochaines vacances et l'anniversaire de votre ami.
Le Problème : Le test du « Bureau Vide »
Actuellement, les tests que nous utilisons pour voir si les ordinateurs IA sont assez intelligents pour être des assistants personnels sont comme si on leur donnait ce bureau vide. L'IA est chargée d'effectuer des tâches sur un ordinateur qui n'a aucun historique, aucun compte connecté et aucune donnée personnelle. C'est comme demander à quelqu'un de « commander ton dîner habituel » alors qu'il n'a aucune idée de qui tu es ou de ce que tu commandes d'habitude.
L'article soutient que c'est une énorme lacune. Les véritables assistants personnels doivent naviguer dans une vie numérique qui est désordonnée, interconnectée et pleine d'histoire personnelle.
La Solution : MYPCBENCH (La simulation « Michael Scott »)
Pour corriger cela, les chercheurs ont construit un nouveau test appelé MYPCBENCH. Au lieu d'un bureau vide, ils ont créé une vie numérique entièrement peuplée pour un personnage spécifique : Michael Scott de la série télévisée The Office.
Voyez cela comme la création d'un monde de jeu vidéo massif et interactif où :
- Le Personnage : Michael Scott est l'« utilisateur ».
- Les Données : L'ordinateur est préchargé avec 1 812 transactions bancaires, 2 398 e-mails, 679 événements de calendrier et des milliers de messages de chat.
- Les Applications : Il y a 17 sites web « fictifs » (comme une fausse banque, une fausse compagnie aérienne, une fausse application de livraison de nourriture) qui sont tous connectés. Si Michael réserve un vol sur la fausse compagnie aérienne, un débit apparaît automatiquement sur son faux relevement bancaire, et un e-mail de confirmation arrive dans sa fausse boîte de réception.
- L'Objectif : L'IA doit agir comme l'assistant de Michael, en naviguant dans ces applications pour résoudre des problèmes de la vie réelle en utilisant son historique spécifique.
Le Test : 184 Défis du Monde Réel
Les chercheurs ont créé 184 tâches spécifiques basées sur des demandes que les gens font réellement aux assistants IA. Ces tâches vont de simples à incroyablement complexes :
- Simple : « Envoie 100 $ à Pam via Zelle. » (L'IA doit d'abord vérifier si Pam est dans les contacts).
- Complexe : « J'ai des voyages réservés en Jamaïque et à la Barbade. Puis-je me permettre les deux en fonction de mon solde de carte de crédit actuel ? » (L'IA doit consulter l'application bancaire, l'application de voyage et faire des calculs).
- Recherche de Modèles : « Quel pourboire est-ce que je laisse habituellement sur les livraisons de nourriture ? » (L'IA doit scanner des centaines de commandes passées pour trouver un modèle).
Les Résultats : L'IA est en difficulté face à la « Vie Réelle »
Les chercheurs ont testé six des modèles d'IA les plus intelligents disponibles (provenant de sociétés comme Anthropic, OpenAI et d'autres) sur ce test. Voici ce qui s'est passé :
- Le Meilleur Performeur : Le modèle de tête (Claude Opus 4.6) a réussi à résoudre environ 55 % des tâches parfaitement. Cela semble bien, mais rappelez-vous, c'est la meilleure IA disponible. Elle a quand même échoué presque la moitié du temps.
- Le Problème du « Multi-App » : L'IA devenait nettement moins performante lorsque les tâches nécessitaient d'utiliser plus d'une application. Lorsqu'une tâche demandait à l'IA de passer entre 7 applications ou plus (comme consulter ses e-mails, puis son calendrier, puis sa banque, puis un site de voyage), le taux de réussite pour la plupart des modèles tombait à 0 %.
- Le Problème de la « Mémoire Longue » : L'IA avait du mal à garder la trace de longues chaînes d'actions. Si une tâche nécessitait 50 étapes, l'IA se perdait souvent ou abandonnait.
- Différents Styles d'Échec :
- Certaines IA (comme GPT) avaient tendance à abandonner trop tôt, disant « j'ai fini » avant d'avoir réellement terminé le travail.
- Certaines IA (comme Qwen) commençaient à inventer des choses, inventant des faits sur Michael Scott qui n'étaient pas dans les données.
- La meilleure IA (Claude) prenait parfois des raccourcis en utilisant la ligne de commande de l'ordinateur (comme un hacker) au lieu de cliquer à travers les menus comme une personne normale.
Le Mot de la Fin
L'article conclut que, bien que l'IA s'améliore dans l'utilisation des ordinateurs, elle n'est pas encore prête à être un véritable assistant « personnel ». Elle peut gérer une tâche propre et simple, mais elle s'effondre lorsqu'elle doit naviguer dans une vie numérique réelle, désordonnée, interconnectée et dotée d'un historique personnel.
Les chercheurs ont rendu leur environnement de test (l'ordinateur « Michael Scott ») public afin que d'autres scientifiques puissent essayer de construire de meilleurs assistants capables de gérer réellement la complexité de la vie numérique d'un véritable humain.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.