← Derniers articles
🤖 machine learning

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

Cet article introduit PPT-Eval, un benchmark de 120 tâches PowerPoint conçu pour évaluer les agents d'utilisation de l'ordinateur, présentant un nouveau cadre basé sur des rubriques qui capture les progrès partiels et présente une forte corrélation avec le jugement humain pour révéler que les modèles de pointe actuels éprouvent encore des difficultés avec l'édition de présentations complexes.

Auteurs originaux : Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

Publié 2026-07-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment utiliser Microsoft PowerPoint. Vous voulez voir si le robot est capable de regarder une diapositive, de comprendre une requête comme « ajoute un cercle bleu ici », puis de cliquer sur les bons boutons pour que cela se produise.

Le document « PPT-EVAL » est essentiellement un test géant et complexe conçu pour voir à quel point ces robots de « l'utilisation de l'ordinateur » sont doués pour effectuer du travail de présentation réel.

Voici la décomposition du document en utilisant des analogies simples :

1. Le Problème : Le Robot face au Monde Réel

La plupart des tests précédents pour les robots étaient comme donner une manette de jeu vidéo avec un ensemble limité de boutons. Le robot ne pouvait faire que ce que le jeu permettait (comme « ajouter du texte » ou « changer la couleur » via une commande de code).

Mais dans le monde réel, les humains n'utilisent pas de code ; ils utilisent une souris, un clavier et un écran. Ils cliquent sur des menus, font glisser des formes et utilisent des outils de conception qui n'ont pas de boutons de code simples.

  • La revendication du document : Les tests existants ne vérifiaient pas si les robots pouvaient réellement utiliser la souris dans PowerPoint. Ils vérifiaient seulement si les robots pouvaient utiliser un « code de triche » (API). PPT-EVAL est le premier test qui force le robot à utiliser la véritable interface de PowerPoint (le GUI) tout comme un humain le ferait.

2. Le Test : La « Salle de Sport PowerPoint »

Les chercheurs ont construit une salle de sport avec 120 exercices différents (tâches) répartis sur 12 fichiers PowerPoint différents.

  • Les Fichiers : Ils sont comme des présentations réelles que vous pourriez trouver dans une bibliothèque — certaines portent sur la médecine, d'autres sur l'histoire, d'autres sur la comptabilité. Ils contiennent des graphiques, des mises en page étranges et des animations.
  • La Difficulté : Les exercices sont notés comme dans un jeu vidéo :
    • Facile : « Change la couleur d'arrière-plan en bleu. » (Simple)
    • Moyen : « Ajoute un nouveau membre de l'équipe à la liste et change sa police. » (Quelques étapes)
    • Difficile : « Réorganise ce diagramme complexe, ajoute une nouvelle section et assure-toi que l'animation se joue correctement. » (Nécessite de la réflexion et de nombreuses étapes).

3. La Notation : La « Grille d'Évaluation » (La partie la plus importante)

C'est la plus grande innovation de ce document. Auparavant, les tests étaient comme des examens de type Réussite/Échec. Si le robot réussissait l'exercice à 90 % mais manquait un minuscule détail, il obtenait un zéro. C'est injuste car le robot a essayé et a accompli la majeure partie du travail.

Les chercheurs ont créé une Grille d'Évaluation (une feuille de notation détaillée), qui est comme un juge de talent plutôt qu'un professeur strict.

  • Crédit Partiel : Si le robot ajoute le cercle mais le place au mauvais endroit, le juge lui donne des points pour l'ajout du cercle, mais lui en retire pour le placement.
  • Pénalités : Si le robot supprime accidentellement une diapositive ou ajoute une animation bizarre qui n'était pas demandée, le juge retire des points.
  • La « Touche Humaine » : Le système de notation utilise l'IA pour rédiger une explication en langage naturel, du type : « Vous avez réussi le cercle, mais il bloque le texte. Bon travail sur la couleur, mais la position nécessite des améliorations. »

Le Résultat : Ce système de « Juge de Talent » était aligné à 77 % avec la façon dont les humains noteraient réellement le travail. Cela signifie que le test est juste et précis.

4. Les Résultats : Les Robots sont encore en plein apprentissage

Les chercheurs ont soumis les robots IA les plus intelligents au monde (comme Claude-4.5 et les modèles d'OpenAI) à ce test.

  • Le Score : Même les meilleurs robots n'ont réussi que 45 % des tâches de manière « parfaite ».
  • La Moyenne : En moyenne, ils ont obtenu environ 57 % des points lorsqu'on compte leurs progrès partiels.
  • La Comparaison : Un expert humain, soumis au même test, obtiendrait environ 80 %.
  • L'écart API vs GUI : Curieusement, lorsque les robots étaient autorisés à utiliser des « codes de triche » (API) au lieu de la souris, ils réussissaient bien mieux (62 % de succès). Cela prouve que, bien que les robots soient intelligents, ils sont encore maladroits avec une souris et un clavier par rapport à la façon dont ils gèrent le code.

Résumé

Considérez PPT-EVAL comme un examen du permis de conduire pour les robots.

  • Anciens Tests : Demandaient au robot : « Peux-tu calculer la vitesse de la voiture ? » (Code/API).
  • PPT-EVAL : Met le robot au volant, lui donne le volant et lui dit : « Conduis jusqu'au magasin, gare-toi dans l'emplacement et ne touche pas le trottoir. » (GUI/Souris).

Le document conclut que, bien que nos robots actuels s'améliorent, ils ont encore du mal avec la motricité fine et le raisonnement visuel requis pour utiliser PowerPoint comme un humain. Il reste encore un long chemin à parcourir avant qu'ils ne puissent pleinement prendre en charge nos tâches de présentation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →