Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
Ce papier traite de la faible fiabilité des agents d'utilisation d'ordinateur lors d'interactions complexes et peu fréquentes en introduisant le benchmark CUActSpot et un pipeline de synthèse de données basé sur un rendu, qui permettent ensemble à un modèle de 4 milliards de paramètres de surpasser des modèles open-source plus volumineux sur diverses modalités d'interface graphique.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un majordome robotisé comment utiliser votre ordinateur. Vous souhaitez qu'il clique sur des boutons, rédige des e-mails et organise des fichiers exactement comme vous le faites. Depuis longtemps, les chercheurs entraînent ces robots principalement sur des tâches de clic simples, comme appuyer sur un bouton « Soumettre » ou cliquer sur un lien. C'est comme enseigner au robot uniquement comment actionner une sonnette.
Mais l'utilisation réelle d'un ordinateur est bien plus complexe. Parfois, vous devez glisser un fichier d'un dossier à un autre, dessiner un cercle autour d'une photo pour la découper, ou sélectionner un paragraphe spécifique de texte pour le supprimer. L'article soutient que les majordomes robotiques actuels échouent sur ces tâches « longue traîne » parce qu'ils ne les ont pas suffisamment pratiquées. Ils sont comme un étudiant qui n'a étudié que pour un test à choix multiples, mais qui se voit soudainement demandé de rédiger une dissertation.
Voici une décomposition de ce que les auteurs ont fait pour résoudre ce problème, en utilisant des analogies simples :
1. Le Problème : Le Piège du « Clic Uniquement »
Les auteurs ont examiné pourquoi les modèles d'IA avancés (comme GPT-5.4) échouent lorsqu'ils tentent d'utiliser un ordinateur. Ils ont constaté que, bien que les robots soient corrects pour les clics simples, ils se perdent lorsqu'on leur demande d'effectuer des actions complexes comme glisser une cellule d'un tableur ou dessiner une forme.
- L'Analogie : Imaginez un examen de conduite où la seule chose que vous avez jamais pratiquée est de tourner la clé dans le contact. Si vous devez soudainement vous garer en bataille ou vous fondre dans la circulation sur une autoroute, vous aurez un accident. Les modèles d'IA actuels sont excellents pour tourner la clé (cliquer), mais terribles pour se garer (glisser et dessiner).
2. La Solution Partie 1 : Un Nouvel « Examen de Conduite » (CUActSpot)
Pour résoudre ce problème, l'équipe a construit un nouveau benchmark appelé CUActSpot. Considérez cela comme un nouvel examen de conduite plus difficile pour les robots.
- Qu'est-ce qui change ? Au lieu de simplement demander au robot de « cliquer sur le bouton rouge », cet examen lui demande de :
- Glisser un fichier vers une corbeille.
- Dessiner une ligne pour relier deux formes.
- Sélectionner un mot spécifique dans un document.
- Découper une personne sur une photo.
- Les Cinq Mondes : L'examen couvre cinq « mondes » différents sur votre écran : applications standard (GUI), documents textuels, tableurs (Tableaux), toiles de dessin et photos naturelles.
- Les Règles : Ils ont établi des règles strictes pour noter les robots. Si le robot tente de glisser un fichier mais clique accidentellement sur une zone « Interdite » (comme une publicité pop-up), il échoue immédiatement. Cela garantit que le robot est précis, et pas seulement chanceux.
3. La Solution Partie 2 : L'« Usine Magique » (Synthèse de Données)
Le plus grand problème était qu'il n'existait pas assez d'exemples de ces actions complexes pour enseigner aux robots. On ne peut pas simplement attendre que des humains enregistrent des millions d'heures de glissements et de dessins ; cela prend trop de temps.
- L'Analogie : Au lieu d'attendre que de vrais conducteurs s'entraînent, l'équipe a construit un simulateur de jeu vidéo.
- Comment ça marche : Ils ont écrit du code pour générer automatiquement des millions de faux écrans d'ordinateur.
- Ils ont créé de faux tableurs avec des nombres aléatoires.
- Ils ont dessiné de faux formes sur une toile.
- Ils ont pris de vraies photos et marqué des parties spécifiques de celles-ci.
- Le « Professeur » (LLM) : Ils ont utilisé une IA intelligente (un LLM) pour examiner ces faux écrans et rédiger des instructions telles que : « Glissez la flèche verte vers le sommet du cercle jaune ». L'IA a également calculé les coordonnées exactes vers lesquelles le robot devait se déplacer.
- Le Résultat : Ils ont généré 50 millions d'échantillons d'entraînement. C'est comme offrir au robot un million d'heures de pratique de conduite dans un simulateur avant qu'il ne touche jamais une vraie voiture.
4. La Découverte : La Variété est Meilleure que le Volume
L'équipe a mené des expériences pour déterminer ce qui rend un robot plus intelligent. Ils ont découvert quelque chose de surprenant :
- L'Ancienne Méthode : Donner simplement au robot plus de la même chose (par exemple, 10 millions d'exemples de clics sur des boutons) n'a pas beaucoup aidé.
- La Nouvelle Méthode (Mise à l'échelle de la Variété) : Donner au robot différents types de tâches (clics, glissements, dessins, tableurs, texte) l'a rendu beaucoup plus intelligent.
- L'Analogie : C'est comme un chef. Si vous ne pratiquez que l'éminçage d'oignons, vous devenez bon pour les oignons. Mais si vous pratiquez l'éminçage d'oignons, la découpe de tomates, la grillade de steaks et la cuisson de pain, vous devenez un maître-chef capable de gérer n'importe quelle recette. Le robot a appris que la compétence de déplacer la souris est plus importante que l'objet spécifique qu'il déplace.
5. Le Résultat : Le Nouvel Robot (Phi-Ground-Any-4B)
En utilisant ce nouvel « examen de conduite » et l'« usine magique » de données, ils ont entraîné un nouveau modèle appelé Phi-Ground-Any-4B.
- La Réalisation : Ce modèle est relativement petit (seulement 4 milliards de paramètres), pourtant il surpasse des modèles open-source beaucoup plus grands (certains dépassant 32 milliards de paramètres) sur ces tâches complexes.
- La Contrainte : Le modèle reste un peu faible sur les tests de l'« ancien style » (qui se concentrent uniquement sur le clic sur des boutons standards), mais il est un champion sur les nouvelles tâches complexes qui comptent réellement pour l'utilisation réelle d'un ordinateur.
Résumé
L'article déclare : « Arrêtez d'enseigner aux robots uniquement comment cliquer. L'utilisation réelle d'un ordinateur implique le glissement, le dessin et l'édition. Nous avons construit un nouvel examen pour mesurer ces compétences, créé une usine pour générer des millions d'exemples d'entraînement, et prouvé qu'enseigner aux robots une grande variété d'actions les rend bien meilleurs dans l'utilisation des ordinateurs que de simplement leur apprendre à cliquer. »
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.