← Derniers articles
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

Ce papier présente OSWorld-Human, un benchmark annoté manuellement révélant que les agents d'utilisation d'ordinateur actuels souffrent d'une latence et d'une inefficacité prohibitives, principalement en raison d'appels excessifs au modèle pour la planification et la réflexion, ce qui les amène à effectuer 2,7 à 4,3 fois plus d'étapes que les humains pour accomplir des tâches.

Auteurs originaux : Reyna Abhyankar, Qi Qi, Yiying Zhang

Publié 2026-05-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Reyna Abhyankar, Qi Qi, Yiying Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagez un assistant personnel très intelligent, mais incroyablement lent, pour effectuer une tâche simple sur votre ordinateur, comme modifier la taille de la police dans un document. Vous vous attendez à ce que cela prenne 30 secondes. Au lieu de cela, votre assistant met 12 minutes. Pourquoi ?

Ce papier, OSWorld-Human, enquête précisément sur ce problème. Il examine les « Agents d'Utilisation d'Ordinateur » (programmes d'IA qui contrôlent votre souris et votre clavier) et se demande : « Pourquoi sont-ils si lents, et comment pouvons-nous les rendre plus rapides ? »

Voici la décomposition de leurs découvertes à l'aide d'analogies simples.

1. Le Problème : L'assistant « Trop-Réfléchi »

Les chercheurs ont découvert que, bien que ces agents d'IA s'améliorent pour accomplir la tâche (précision), ils sont terribles pour la rapidité avec laquelle ils le font (efficacité).

  • L'Humain vs Le Robot : Un expert humain peut modifier l'interligne dans un document en moins de 30 secondes. L'agent d'IA prend 12 minutes.
  • Le Goulot d'Étranglement : Le retard ne vient pas du fait que l'IA clique lentement sur la souris. C'est parce que l'IA s'arrête pour réfléchir constamment.
    • L'Analogie : Imaginez que vous conduisez vers l'épicerie. Un conducteur humain conduit simplement. Ce conducteur IA s'arrête à chaque intersection pour appeler un consultant sur-intelligent au téléphone et demander : « Est-ce le bon virage ? Devrais-je tourner à gauche ? Ai-je bien tourné à gauche ? Et pour le prochain virage ? »
    • La Réalité : L'IA appelle un immense « cerveau » (un Modèle de Langage à Grande Échelle) pour planifier le prochain mouvement, juger si le mouvement a fonctionné, et réfléchir à ce qui s'est passé. Ces appels téléphoniques prennent le plus de temps. En fait, les étapes de « planification » et de « jugement » seules consomment environ 75 % à 96 % du temps total !

2. L'Enquête : Décomposition des Étapes

Les chercheurs ont observé deux agents d'IA populaires (Agent S2 et GTA1) tentant de résoudre 39 tâches informatiques différentes. Ils ont décomposé chaque seconde du processus.

  • La « Taxe de Pensée » : Chaque fois que l'IA effectue une étape, elle doit envoyer un énorme message à son cerveau. À mesure que la tâche s'allonge, le message grossit car il doit inclure l'historique de tout ce qu'elle a fait auparavant.
    • Analogie : C'est comme écrire une entrée de journal. Le jour 1, vous écrivez une phrase. Le jour 50, vous devez réécrire tout le livre depuis le jour 1 juste pour ajouter une nouvelle phrase. Cela fait que les étapes ultérieures prennent 3 fois plus de temps que les étapes initiales.
  • La Boucle du « Mauvais Virage » : Parfois, l'IA sait quoi faire (par exemple, « Cliquez sur le bouton Ouvrir »), mais elle ne peut pas trouver cliquer sur l'écran. Elle clique au mauvais endroit, réalise son erreur, et réessaie.
    • Le Coût : Ce « blocage » se produit souvent. Dans un cas, une IA a tenté d'ouvrir un dossier et s'est retrouvée bloquée dans une boucle pendant 27 minutes, gaspillant 8,47 $ de coûts informatiques, simplement parce qu'elle ne pouvait pas trouver le bon endroit sur l'écran.

3. La Solution : Le « Référentiel Humain » (OSWorld-Human)

Pour prouver à quel point ces robots sont inefficaces, les chercheurs ont créé un nouveau référentiel appelé OSWorld-Human.

  • Qu'est-ce que c'est ? Ils ont parcouru manuellement les 369 tâches et ont noté le chemin le plus court et le plus logique qu'un humain emprunterait pour les terminer.
  • L'Astuce du « Regroupement » : Ils ont remarqué que les humains font souvent plusieurs choses d'un coup sans s'arrêter pour réfléchir.
    • Analogie : Un humain voit une zone de texte, tape un nom et appuie sur « Entrée » d'un seul mouvement fluide. L'IA, en revanche, s'arrête après avoir vu la zone, appelle son cerveau pour planifier la frappe, s'arrête à nouveau pour planifier l'appui sur « Entrée », et appelle à nouveau son cerveau.
    • La Découverte : Les chercheurs ont constaté que de nombreuses actions pouvaient être « regroupées ». Si l'IA pouvait effectuer trois clics en une seule « pensée », elle économiserait des quantités massives de temps.

4. Le Verdict : Les Robots Gaspillent des Étapes

Les chercheurs ont testé 16 agents d'IA différents contre leur nouveau « Référentiel Humain ».

  • Le Résultat : Même les agents d'IA les meilleurs ont pris 2,7 à 4,3 fois plus d'étapes qu'un humain n'en avait besoin pour terminer la même tâche.
  • Le Score : Ils ont créé un nouveau score appelé le Score d'Efficacité Pondéré (WES).
    • Si une IA accomplit la tâche mais prend 4 fois plus de temps que nécessaire, son score chute drastiquement.
    • L'IA en tête du classement, qui semblait excellente sur les anciens tests, n'a obtenu que 15,6 % sur ce nouveau test d'efficacité. Cela signifie qu'elle effectue beaucoup de travail inutile.

Résumé

Le papier conclut que les agents informatiques d'IA actuels sont comme des élèves brillants mais maladroits. Ils connaissent la réponse, mais ils passent tellement de temps à lever la main, à attendre le professeur et à relire leurs notes qu'ils ne terminent jamais le test à temps.

Pour résoudre ce problème, le papier suggère trois choses principales :

  1. Arrêter de trop réfléchir : Réduire le nombre de fois où l'IA appelle son « cerveau » pour planifier et juger.
  2. Regrouper les actions : Permettre à l'IA d'effectuer plusieurs étapes (comme taper et appuyer sur Entrée) en une seule pensée.
  3. Devenir meilleur pour trouver les choses : Améliorer la capacité de l'IA à voir exactement où cliquer afin qu'elle ne se retrouve pas bloquée dans des boucles.

L'objectif n'est pas seulement de rendre l'IA plus intelligente, mais de la rendre plus rapide et plus pratique pour une utilisation dans le monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →