← Derniers articles
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

L'article présente Video2GUI, un cadre automatisé qui synthétise un jeu de données à grande échelle de 12 millions de trajectoires d'interaction avec des interfaces graphiques à partir de vidéos internet non étiquetées, afin de surmonter la pénurie de données et d'améliorer considérablement les performances de généralisation des agents multimodaux dédiés aux interfaces graphiques.

Auteurs originaux : Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Publié 2026-05-15
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous vouliez enseigner à un robot comment utiliser un ordinateur, un téléphone ou un site web. Pour ce faire, vous devez lui montrer des millions d'exemples de personnes cliquant sur des boutons, tapant du texte et faisant défiler des pages.

Le problème est que trouver ces exemples est incroyablement difficile. Habituellement, les chercheurs doivent engager des personnes pour enregistrer et étiqueter manuellement chaque clic, ce qui est lent, coûteux et les limite à quelques types d'applications seulement. C'est comme essayer d'apprendre une langue en ne lisant que quelques pages d'un dictionnaire.

Video2GUI est un nouveau système qui résout ce problème en transformant l'ensemble d'Internet en une immense salle de classe gratuite. Voici comment cela fonctionne, en utilisant quelques métaphores simples :

1. Le Grand Filtre (Trouver les bonnes vidéos)

Internet regorge de vidéos, mais la plupart sont inutiles pour enseigner à un robot (comme des émissions de cuisine ou des vidéos de chats). Les chercheurs ont commencé avec 500 millions de vidéos YouTube.

  • Le Tamisage grossier : D'abord, ils ont utilisé une IA intelligente pour scanner les titres et les descriptions. C'est comme un bibliothécaire vérifiant rapidement les dos des livres pour voir s'ils traitent d'« ordinateurs » avant même de les ouvrir. Cela a réduit le tas à 20 millions.
  • Le Tamisage fin : Ensuite, ils ont utilisé une IA plus avancée pour réellement « regarder » la première minute de ces vidéos. Elle a vérifié : l'écran est-il clair ? La voix explique-t-elle bien les étapes ? Montre-t-elle réellement comment utiliser un logiciel ? C'est comme un enseignant strict notant les vidéos pour s'assurer qu'il s'agit de tutoriels de haute qualité.
  • Le Résultat : Ils se sont retrouvés avec 4,2 millions de vidéos tutorielles de haute qualité.

2. Le Traducteur (Transformer la vidéo en instructions)

Maintenant qu'ils avaient les vidéos, un robot ne peut pas simplement « regarder » une vidéo et la comprendre comme un humain. La vidéo doit être traduite en une liste structurée d'instructions.

  • Le Processus : Ils ont utilisé une IA puissante (comme un traducteur surdoué) pour regarder les vidéos et les décomposer. Elle a identifié l'objectif (par exemple, « Acheter des chaussures »), les étapes suivies et le moment exact où chaque clic a eu lieu.
  • La Magie : L'IA n'a pas seulement deviné ; elle a examiné les images de la vidéo pour trouver les coordonnées exactes des boutons sur lesquels on cliquait. Elle a transformé une vidéo de 10 minutes montrant quelqu'un faire des achats en ligne en une carte précise, étape par étape : « À 0:05, cliquez sur la barre de recherche. À 0:10, tapez « baskets ». »

3. La Bibliothèque (WildGUI)

Toutes ces instructions traduites ont été rassemblées dans une nouvelle bibliothèque massive appelée WildGUI.

  • L'Échelle : Cette bibliothèque contient 12 millions de trajectoires d'interaction couvrant plus de 1 500 applications et sites web différents.
  • La Variété : Elle inclut tout, des bureaux Windows aux téléphones Android et aux ordinateurs Mac. C'est comme avoir une bibliothèque contenant chaque façon possible dont un humain ait jamais utilisé un ordinateur, le tout organisé et prêt à être étudié par un robot.

4. L'Entraînement (Enseigner au robot)

Les chercheurs ont pris deux modèles d'IA existants (Qwen2.5-VL et Mimo-VL) et les ont « nourris » avec cette nouvelle bibliothèque.

  • Le Résultat : Après avoir étudié cet immense ensemble de données, les robots se sont nettement améliorés. Ils ont progressé de 5 % à 20 % sur divers tests.
  • La Preuve : Ils pouvaient désormais trouver des boutons, cliquer sur les bons éléments et naviguer sur des sites web complexes bien mieux qu'auparavant, égalant ou surpassant les meilleurs robots actuellement existants.

La Conclusion

L'article affirme qu'en automatisant le processus de transformation des vidéos d'Internet en données d'entraînement, ils ont créé un ensemble de données massif et diversifié qui rend les agents IA beaucoup plus intelligents dans l'utilisation des ordinateurs. Ils n'ont pas inventé un nouveau type de robot ; ils ont simplement donné aux existants un manuel d'étude bien meilleur, plus vaste et plus diversifié.

Ils ont publié cet ensemble de données et les outils utilisés pour le construire afin que d'autres chercheurs puissent les utiliser pour créer des agents IA encore meilleurs à l'avenir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →