Grounding Computer Use Agents on Human Demonstrations
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot très intelligent, mais visuellement maladroit, comment utiliser un ordinateur. Vous pouvez lui donner des instructions verbales comme : « Cliquez sur le bouton vert pour enregistrer le fichier », mais le robot n'a aucune idée de l'endroit où se trouve ce bouton. Il pourrait cliquer sur un mauvais objet vert, ou rater complètement le bouton parce qu'il est trop petit ou ressemble à autre chose. Ce problème s'appelle la « mise en correspondance » (grounding) — connecter vos mots à l'endroit exact de l'écran que le robot doit toucher.
Ce document présente une nouvelle solution pour apprendre aux robots à faire cela mieux, plus vite et avec moins d'efforts inutiles.
Le Problème : Le Robot est Perdu dans une Mer d'Icônes
Les ordinateurs de bureau sont désordonnés. Ils possèdent de grands écrans haute résolution remplis d'icônes, de menus et de boutons minuscules qui se ressemblent presque tous. Les tentatives précédentes pour enseigner aux robots utilisaient des quantités massives de données, mais une grande partie était « bruitée » ou générée par des ordinateurs plutôt que par de vrais humains. C'était comme essayer d'apprendre à quelqu'un à conduire en lui montrant un million de photos floues de voitures générées par ordinateur ; il pourrait apprendre la théorie, mais il finirait par s'écraser dans le monde réel.
La Solution : GROUNDCUA (Le Jeu de Données de l'« Expert Tuteur »)
Les auteurs ont créé un nouveau jeu de données massif appelé GROUNDCUA. Ne voyez pas cela comme un tas de photos aléatoires, mais comme une bibliothèque de démonstrations d'experts.
- Humains Réels, Tâches Réelles : Ils ont engagé des experts formés pour utiliser réellement 87 applications de bureau différentes (comme des outils de dessin, des tableurs et des logiciels de codage) afin d'accomplir de vraies tâches.
- La Vision « Rayons X » : Pendant que ces experts travaillaient, le système prenait des captures d'écran et, surtout, étiquettait chaque élément visible sur l'écran. Si un expert cliquait sur une minuscule icône « enregistrer », le système notait exactement où elle se trouvait, à quoi elle ressemblait et ce que l'expert était en train de faire.
- L'Échelle : Ils ont collecté 56 000 captures d'écran avec plus de 3,5 millions d'éléments étiquetés. C'est comme donner au robot un manuel scolaire où chaque objet de chaque image est nommé et expliqué par un enseignant humain.
Le Nouveau Modèle : GROUNDNEXT (L'« Étudiant Modèle »)
En utilisant ce jeu de données de haute qualité, l'équipe a construit une nouvelle famille de modèles d'IA appelée GROUNDNEXT.
- Entraînement en Deux Étapes :
- Ajustement Supervisé (SFT - Supervised Fine-Tuning) : D'abord, ils ont enseigné au modèle en utilisant 700 000 des meilleurs exemples. Imaginez un étudiant étudiant un manuel parfait écrit par des experts.
- Apprentissage par Renforcement (RL - Reinforcement Learning) : Ensuite, ils ont laissé le modèle s'exercer. Lorsqu'il trouvait la bonne réponse, il recevait une récompense de type « bon travail » ; lorsqu'il se trompait, il recevait un signal de type « réessaie ». Cela a permis d'affiner ses compétences.
Les Résultats : Petite Taille, Grand Cerveau
Voici la partie surprenante : l'équipe a entraîné ses modèles en utilisant moins d'un dixième des données utilisées par les autres modèles de pointe.
- Efficacité : Leur modèle de 3 milliards de paramètres (un « cerveau » relativement petit) a performé aussi bien, voire mieux, que des modèles beaucoup plus grands entraînés sur des millions de données désordonnées.
- La Victoire de l'« Underdog » : Dans des tests où l'IA devait agir comme un utilisateur d'ordinateur (cliquer, taper, faire glisser), leur petit modèle a battu de grands concurrents, y compris certains issus de grandes entreprises technologiques. C'est comme un étudiant qui a étudié quelques livres parfaits et qui surpasse un étudiant qui a lu un million de magazines aléatoires.
- Généralisation : Bien qu'ils aient entraîné le modèle uniquement sur des ordinateurs de bureau, il est devenu étonnamment doué pour comprendre les téléphones mobiles et les sites web également, montrant qu'il a appris les principes de l'utilisation d'un ordinateur, et non pas seulement mémorisé des écrans spécifiques.
Pourquoi Cela Importe
Le document soutient que la qualité l'emporte sur la quantité. Au lieu de jeter de plus en plus de données sur le problème, ils ont montré que si vous disposez de données de haute qualité, vérifiées par des humains, vous pouvez construire des agents utilisant l'ordinateur beaucoup plus fiables avec beaucoup moins de ressources.
Ils rendent publics tant le jeu de données (GROUNDCUA) que les modèles (GROUNDNEXT), dans l'espoir d'aider d'autres chercheurs à construire de meilleurs robots, plus fiables, capables de réellement nous aider à utiliser nos ordinateurs sans se perdre dans les icônes.
En bref : Ils ont appris à un robot à utiliser un ordinateur en lui montrant des milliers d'exemples parfaits démontrés par des humains, prouant qu'un peu d'enseignement de haute qualité permet d'aller très loin.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.