← Derniers articles
💬 NLP

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms

Cet article introduit LivingScreen, le premier benchmark pour les agents GUI « Living-Screen-Native » opérant sur des plateformes de vidéos courtes dynamiques, révélant que les modèles de pointe actuels ne parviennent pas à égaler les performances humaines en raison d'une incapacité à contrôler efficacement le moment de l'observation au milieu d'un contenu en changement continu.

Auteurs originaux : Jiashu Yao, Heyan Huang, Daiqing Wu, Wangke Chen, Huaxi Ai, Haoyu Wen, Zeming Liu, Yuhang Guo

Publié 2026-06-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jiashu Yao, Heyan Huang, Daiqing Wu, Wangke Chen, Huaxi Ai, Haoyu Wen, Zeming Liu, Yuhang Guo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment utiliser un smartphone. La plupart des tests actuels pour ces robots sont comme si vous leur donniez une photographie figée d'un écran. Le robot regarde l'image, décide sur quoi cliquer, puis l'image change. C'est un peu comme jouer à un jeu de « Simon dit » où le plateau ne bouge jamais, sauf si vous le touchez.

Mais la vraie vie n'est pas figée. Pensez à TikTok, Instagram Reels ou YouTube Shorts. Les vidéos se lancent automatiquement, les commentaires défilent et de nouveaux contenus se chargent pendant que vous regardez. L'écran est « vivant ».

Ce document présente une nouvelle façon de tester les robots (appelés agents GUI). Voici l'explication en termes simples :

1. Le Problème : L'« Écran Figé » contre l'« Écran Vivant »

Les modèles d'IA actuels sont excellents pour analyser une image statique ou un fichier vidéo préenregistré. Mais ils ont du mal lorsque l'écran change constamment de lui-même.

  • L'ancienne méthode : L'IA reçoit un instantané, réfléchit, clique, puis reçoit un nouvel instantané.
  • La nouvelle méthode (Native de l'Écran Vivant) : L'écran continue de jouer. L'IA doit décider : « Dois-je regarder toute cette vidéo ? Dois-je juste jeter un coup d'œil aux 3 premières secondes ? Dois-je passer mon chemin complètement ? »

Les auteurs appellent cela le « Living-Screen-Native » car l'agent doit naviguer sur un écran qui évolue en temps réel, tout comme un humain le fait.

2. La Solution : « LIVINGSCREEN » (Le nouveau test)

Pour tester cela, les chercheurs ont construit un terrain de jeu spécial appelé LIVINGSCREEN.

  • L'environnement : C'est une version factice et réaliste d'une application de vidéos courtes à l'intérieur d'un navigateur web. Elle diffuse de vraies vidéos, affiche des commentaires et possède des boutons pour « aimer », « partager » et « suivre ».
  • Les règles : L'IA ne peut pas simplement « télécharger » le fichier vidéo. Elle doit interagir avec l'écran exactement comme un humain : balayer vers le haut (swiper), cliquer sur des boutons et décider combien de temps elle regarde un clip.
  • Les tâches : Le test comporte trois niveaux de difficulté :
    • Niveau 1 (Basique) : Pouvez-vous cliquer sur le bouton « j'aime » ou faire défiler vers le bas ?
    • Niveau 2 (Compréhension) : Pouvez-vous regarder quelques vidéos, lire les commentaires et déterminer si deux vidéos racontent la même histoire ?
    • Niveau 3 (Le combat de boss) : Pouvez-vous agir comme un utilisateur humain ? Par exemple, « Trouvez des vidéos qui enfreignent les règles et signalez-les », ou « Trouvez des vidéos sur la cuisine et enregistrez les meilleures ».

3. Les Résultats : Les Robots sont Maladroits

Les chercheurs ont testé les modèles d'IA les plus intelligents disponibles aujourd'hui sur ce nouveau test. Les résultats sont surprenants :

  • Les Humains gagnent : Les humains sont bien meilleurs pour équilibrer la vitesse et la précision. Nous savons exactement combien de temps regarder une vidéo pour obtenir la réponse.
  • L'IA peine : Même les meilleurs modèles d'IA n'ont pas réussi à égaler la performance humaine. Ils étaient soit trop lents (regardaient trop de choses), soit trop précipités (manquaient des détails importants).

4. La Grande Découverte : « Sur-observation » et « Sous-observation »

Les chercheurs ont découvert que la raison principale de l'échec de l'IA n'est pas qu'elle ne peut pas voir ou cliquer ; c'est qu'elle ne sait pas comment regarder. Les auteurs appellent cela la « Sur-observation et la Sous-observation ».

Pensez à un élève passant un examen :

  • Sous-observation : L'élève jette un coup d'œil à une question, devine la réponse immédiatement et passe à la suite, manquant ainsi le détail crucial au milieu du paragraphe.
  • Sur-observation : L'élève lit le même paragraphe cinq fois, même après l'avoir déjà compris, gaspillant ainsi du temps et de l'énergie.

Le problème de l'IA :

  • Certaines IA regardent trop peu. Elles passent à côté de vidéos qu'elles auraient dû regarder, ce qui conduit à de mauches réponses.
  • Certaines IA regardent trop. Elles fixent des vidéos non pertinentes pendant des minutes, perdant du temps, sans devenir plus intelligentes dans leur tâche.
  • La différence humaine : Les humains sont des « scanners intelligents ». Nous jetons un coup d'œil rapide de 2 secondes pour voir si une vidéo est pertinente. Si elle l'est, nous regardons plus longtemps. Si non, nous passons à la suivante. Les modèles d'IA manquent principalement de ce filtre de « coup d'œil rapide ». Ils ont tendance soit à ignorer complètement une vidéo, soit à la regarder en boucle.

5. Peut-on simplement leur dire de faire mieux ?

Les chercheurs ont essayé de donner des instructions simples aux modèles d'IA, comme « Regarde moins » ou « Regarde plus », ou même de leur dire de « Copier la façon dont les humains regardent ».

  • Le résultat : Cela n'a pas bien fonctionné. Dire à l'IA de « regarder moins » l'a poussée à sauter trop de vidéos importantes. Lui dire de « regarder plus » l'a fait perdre trop de temps.
  • La conclusion : Il ne s'agit pas seulement de donner de meilleures instructions. Les modèles d'IA manquent réellement de la capacité à contrôler leur propre attention. Ils ne savent pas décider quand regarder et quand arrêter de regarder.

Résumé

Ce document affirme que pour construire des assistants IA véritablement utiles pour des applications comme TikTok ou YouTube, nous devons arrêter de les tester sur des écrans figés. Nous devons leur apprendre à gérer leur attention dans un monde qui ne s'arrête jamais de bouger. Actuellement, les meilleurs modèles d'IA sont comme une personne qui soit ne regarde jamais le menu, soit le lit mot à mot pendant une heure — ils n'ont tout simplement pas encore appris à « jeter un coup d'œil » efficacement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →