← Derniers articles
🤖 AI

DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

L'article introduit DragOn, un benchmark et un ensemble de données complet comprenant 286 000 captures d'écran et 3,5 millions de tâches à travers quatre domaines pour remédier à la rareté des données d'interaction GUI basées sur le glisser-déposer, démontrant qu'un ajustement fin sur cet ensemble de données améliore considérablement les performances des modèles de langage-vision de pointe sur des tâches complexes d'utilisation d'ordinateur.

Auteurs originaux : Nathan Bout, Maxime Langevin, Ronan Riochet

Publié 2026-06-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nathan Bout, Maxime Langevin, Ronan Riochet

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à utiliser un ordinateur. Jusqu'à présent, nous avons été très doués pour apprendre aux robots à cliquer sur un bouton. C'est comme apprendre à un enfant à pointer une image du doigt en disant : « Touche ça ! ». Nous avons des millions d'exemples de ce type, et les robots deviennent plutôt bons pour le faire.

Mais il existe une compétence beaucoup plus difficile : le glisser-déposer (drag).

Pensez au glisser-déposer comme au fait de soulever une boîte lourde pour la déplacer à un nouvel endroit, ou de faire glisser votre doigt pour faire défiler une page, ou de saisir le coin d'une photo pour l'agrandir. Ces actions exigent que le robot comprenne non seulement toucher, mais aussi comment se déplacer du point A au point B. Actuellement, les robots sont terribles à cela. Ils sont comme des tout-petits qui peuvent pointer un jouet du doigt, mais qui ne savent pas comment le ramasser et le transporter à travers la pièce.

Le document présente un nouvel outil appelé DragOn pour résoudre ce problème. Voici comment il fonctionne, expliqué simplement :

1. Le problème : Un manque de pratique du "glisser"

Les auteurs ont remarqué que, bien que nous ayons de gigantesques bibliothèques de données pour apprendre aux robots à cliquer, les données pour leur apprendre à glisser sont minuscules — environ 10 à 100 fois plus petites. À cause de cela, même les modèles d'IA les plus intelligents (comme ceux d'OpenAI ou d'Anthropic) ont du mal avec des tâches comme surligner du texte, redimensionner des fenêtres ou déplacer des curseurs. Ils s'embrouillent et échouent souvent.

2. La solution : Le "Rendu comme Supervision" (Rendering-as-Supervision)

Pour construire une immense bibliothèque d'exemples de glissement sans embaucher des milliers d'humains pour cliquer et glisser manuellement, les auteurs ont inventé une astuce ingénieuse qu'ils appellent le « Rendu comme Supervision ».

  • L'ancienne méthode : Imaginez un humain regardant un écran, dessinant un cadre autour d'un mot et écrivant ses coordonnées. C'est lent et coûteux.
  • La méthode DragOn : Imaginez que vous avez le plan magique d'un document (comme un PDF ou un tableur). L'ordinateur sait exactement où se trouve chaque lettre et chaque cellule parce qu'il a construit le document. Au lieu de regarder l'image et de deviner, l'ordinateur demande simplement au plan : « Où se trouve le mot "Bonjour" ? ». Le plan répond : « Il est à ces coordonnées exactes ».

L'ordinateur « rend » (dessine) ensuite l'image et étiquette automatiquement les points de départ et d'arrivée de l'action de glissement basés sur ce plan. C'est comme avoir un GPS qui connaît l'emplacement exact de chaque panneau de signalisation avant même de prendre la route. Cela leur a permis de créer 3,5 millions de tâches d'entraînement très rapidement et à moindre coût.

3. Le jeu de données : Quatre nouveaux terrains de jeux

Ils n'ont pas seulement créé un type de tâche de glissement ; ils ont construit quatre différents « terrains de jeux » pour que les robots puissent s'exercer :

  • Surlignage de texte : Faire glisser le curseur sur une phrase pour la sélectionner (comme surligner un mot dans un manuel).
  • Sélection de cellules : Faire glisser le curseur sur une grille dans un tableur pour sélectionner un bloc de chiffres.
  • Redimensionnement d'éléments : Saisir le coin d'une image ou d'une fenêtre et tirer pour l'agrandir ou la rétrécir.
  • Manipulation de curseur (Slider) : Saisir une barre de réglage (comme un contrôle de volume) et la faire glisser vers la gauche ou la droite.

Au total, ils ont créé 286 000 captures d'écran pour que les robots puissent les étudier.

4. Les résultats : La pratique mène à la perfection

Les auteurs ont testé ce nouveau jeu de données sur les modèles d'IA les plus intelligents du monde.

  • La référence (Baseline) : Les meilleurs modèles d'IA « prêts à l'emploi » (comme GPT et Claude) ont obtenu un score inférieur à 30 % sur ces tâches. Ils échouaient essentiellement plus souvent qu'ils ne réussissaient.
  • La percée : Les auteurs ont pris un modèle d'IA open-source et l'ont entraîné spécifiquement sur leur nouveau jeu de données DragOn.
  • Le résultat : Ce modèle entraîné a bondi à 35,3 % de précision. Bien que cela puisse ne pas sembler être un chiffre énorme, c'est une amélioration massive par rapport au modèle de base (qui n'était qu'à 2,3 %) et cela a même battu les modèles propriétaires les plus coûteux sur trois des quatre tâches.

L'essentiel

Le document affirme qu'en donnant aux modèles d'IA une immense bibliothèque de haute qualité d'exemples de « glissement » — créée grâce à une méthode de plan automatisée et intelligente — nous pouvons apprendre aux robots à gérer des tâches informatiques complexes bien mieux. Cela prouve que les données sont la clé : même un modèle open-source standard peut surpasser les modèles commerciaux les plus coûteux s'il est entraîné sur le bon type de données d'entraînement.

Les auteurs espèrent que ce nouveau benchmark et ce jeu de données aideront les futurs robots à devenir des « utilisateurs d'ordinateur » fiables qui pourront faire plus que simplement cliquer ; ils pourront enfin apprendre à glisser, déposer, redimensionner et balayer, tout comme un humain le fait.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →