InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction
L'article présente InfantAgent-Next, un agent généraliste multimodal hautement modulaire qui intègre des capacités basées sur les outils et purement visuelles pour permettre une interaction collaborative et étape par étape avec l'ordinateur, atteignant des performances de pointe sur divers benchmarks incluant OSWorld, GAIA et SWE-Bench.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant personnel très intelligent, mais légèrement maladroit, nommé InfantAgent-Next.
Dans le monde de l'automatisation informatique, la plupart des assistants actuels sont soit des spécialistes qui ne savent faire qu'une seule chose très bien, soit des généralistes qui tentent de tout faire mais se perdent souvent.
- Certains assistants sont comme des Bibliothécaires : ils excellent à utiliser une liste spécifique d'outils (comme « rechercher sur le web » ou « ouvrir un fichier »), mais si vous leur demandez de cliquer sur un bouton qu'ils n'ont jamais vu auparavant sur un écran, ils se figent car ils n'ont pas d'outil pour ce bouton spécifique.
- D'autres assistants sont comme des Artistes : ils peuvent regarder un écran et « voir » ce qui s'y trouve, mais ils peinent à faire des mathématiques complexes ou à écrire du code car ils tentent de tout faire uniquement avec leurs yeux, sans calculatrice ni éditeur de texte.
InfantAgent-Next est différent. C'est comme engager une Équipe de Couteaux Suisses plutôt qu'une seule personne.
Comment cela fonctionne : l'équipe « Cerveau et Mains »
Au lieu d'un seul cerveau géant tentant de tout faire, InfantAgent-Next décompose chaque tâche en petites étapes et envoie chaque étape à l'expert le mieux adapté.
- Le Gestionnaire (Le Planificateur) : Lorsque vous demandez « Enregistrez cette page web dans mes favoris », un modèle de « Gestionnaire » de haut niveau lit votre demande. Il ne tente pas de cliquer lui-même avec la souris. Au lieu de cela, il dit : « D'accord, nous devons ouvrir le navigateur, trouver le bouton des favoris et cliquer dessus. »
- Les Spécialistes : Le Gestionnaire fait alors appel à l'expert approprié pour la tâche :
- L'Œil (Ancrage Visuel) : Si la tâche consiste à « cliquer sur le bouton rouge », un modèle de vision spécialisé examine l'écran, trouve les coordonnées exactes en pixels de ce bouton rouge et indique au système où cliquer. C'est comme un observateur aux yeux perçants guidant un archer aveuglé.
- La Calculatrice (Exécution de Code) : Si la tâche est « analysez ce fichier Excel », le Gestionnaire remet le fichier à un expert en code qui écrit un script pour effectuer les calculs instantanément, plutôt que d'essayer de compter les lignes en regardant l'écran.
- L'Oreille (Analyse Audio) : Si vous téléchargez un enregistrement et demandez « quel numéro de page est mentionné ? », un modèle audio spécialisé écoute le fichier et extrait la réponse.
- La Mémoire : Le système maintient un cahier partagé. Chaque fois qu'un spécialiste termine une étape, il l'y note. Le spécialiste suivant prend le cahier, lit ce qui s'est passé et poursuit l'histoire. Cela garantit que l'équipe ne perd pas de vue l'objectif.
Pourquoi cela compte (Les tours de « Magie »)
L'article met en évidence deux problèmes principaux que ce système résout :
- Le problème du « Clic » : De nombreux agents IA sont mauvais pour cliquer au bon endroit sur un écran. Ils pourraient cliquer à 5 pixels à gauche et manquer le bouton. InfantAgent-Next utilise une technique de « Zoom-In ». S'il doit cliquer sur un bouton, il ne se contente pas de deviner. Il prend une photo de l'écran, trouve la zone générale, recadre cette zone pour l'agrandir, retrouve le bouton, le recadre à nouveau, et ensuite clique. C'est comme utiliser une loupe pour trouver une aiguille dans une botte de foin, garantissant que le clic est précis.
- Le problème de « l'Édition » : Lors de l'édition d'un fichier texte, l'IA obtient souvent les numéros de ligne incorrects (par exemple, « Changez la ligne 5 » alors qu'il devrait s'agir de la ligne 6). InfantAgent-Next dispose d'un système de « Double-Vérification ». Il propose une modification, puis examine le texte réel pour vérifier : « La ligne 5 dit-elle vraiment ce que je pense qu'elle dit ? » Si ce n'est pas le cas, il ajuste son plan avant de procéder à l'édition, évitant ainsi des erreurs désordonnées.
Ce qu'il peut faire (La Preuve)
Les chercheurs ont testé cette « Équipe de Spécialistes » contre d'autres agents IA de premier plan sur trois types de défis :
- Tâches de Bureau Réelles (OSWorld) : Ils ont demandé à l'agent d'effectuer des tâches telles que « télécharger un fichier », « éditer un document » et « naviguer sur un site web ». InfantAgent-Next a battu le célèbre agent « Claude Computer Use » de 7,27 %. Il était meilleur pour accomplir réellement le travail sans aide humaine.
- Codage et Correction de Bugs (SWE-Bench) : Ils ont demandé à l'agent de réparer du code cassé dans de vrais projets logiciels. Il a performé aussi bien, voire mieux, que de nombreux agents commerciaux fermés et coûteux.
- Connaissances Générales et Logique (GAIA) : Ils ont posé des questions complexes nécessitant de rechercher sur le web, de lire des fichiers et de raisonner. InfantAgent-Next s'est classé deuxième parmi tous les agents open-source, prouvant qu'il peut gérer une logique complexe et multi-étapes.
La Conclusion
InfantAgent-Next n'est pas simplement un grand modèle d'IA tentant d'être tout. C'est un chef d'orchestre modulaire qui sait exactement quand appeler « l'Œil », « l'Oreille », le « Codeur » ou le « Clic-Souris ». En permettant à chaque spécialiste de faire ce qu'il fait de mieux, l'ensemble du système devient beaucoup plus intelligent, plus précis et capable de gérer les tâches désordonnées et réelles que nous rencontrons sur nos ordinateurs chaque jour.
Les chercheurs ont rendu le code de cette « Équipe de Spécialistes » disponible pour que quiconque puisse l'utiliser et l'étudier, espérant aider à construire de meilleurs assistants informatiques à l'avenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.