TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
L'article présente TerminalWorld, un moteur de données évolutif qui inverse automatiquement 1 530 tâches de terminal haute fidélité à partir de 80 870 enregistrements du monde réel pour évaluer les agents d'IA, révélant que les modèles de pointe actuels peinent à gérer des flux de travail authentiques et obtiennent de piètres résultats par rapport aux benchmarks existants élaborés par des experts.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'enseigner à un robot comment utiliser la « ligne de commande » d'un ordinateur — cet écran noir où les programmeurs tapent des commandes textuelles au lieu de cliquer sur des icônes. Pendant longtemps, la façon dont nous testions ces robots ressemblait à leur faire résoudre un puzzle conçu par un professeur strict. Le professeur disait : « Voici une énigme difficile ; résolvez-la ! » Si le robot résolvait l'énigme, nous pensions qu'il était intelligent.
Mais les auteurs de cet article, TERMINALWORLD, ont réalisé qu'il y avait un problème : La vie réelle n'est pas une énigme. La vie réelle est désordonnée, imprévisible et pleine d'outils spécifiques que les gens utilisent réellement tous les jours. Un robot capable de résoudre une énigme peut encore échouer lorsqu'on lui demande de réparer réellement un serveur ou d'organiser des fichiers dans un vrai bureau.
Voici comment ils ont résolu ce problème, expliqué simplement :
1. L'approche « Mouchard »
Au lieu d'inventer de fausses tâches, les chercheurs se sont rendus sur un site web public appelé asciinema. C'est comme une chaîne YouTube, mais pour des écrans d'ordinateur. Les développeurs téléchargent volontairement des enregistrements de leurs véritables sessions de travail.
- L'analogie : Imaginez que vous voulez enseigner à un élève comment cuisiner. Au lieu d'écrire un livre de recettes à partir de zéro (ce qui pourrait être trop parfait ou étrange), vous allez dans une cuisine, enregistrez 80 000 heures de vrais chefs préparant de vrais repas, puis vous demandez : « Bon, qu'ont-ils fait juste maintenant ? »
- Le résultat : Ils ont collecté 80 870 enregistrements réels de développeurs au travail.
2. Le moteur « Chef Robot »
Les enregistrements bruts sont désordonnés. Ils contiennent des fautes de frappe, des échecs et de longues listes de messages système qui n'ont pas d'importance. Les chercheurs ont construit un « moteur de données » spécial (un système logiciel intelligent) pour nettoyer tout cela.
- Étape 1 : Comprendre l'objectif. Le moteur examine un enregistrement désordonné et demande à une IA super-intelligente : « Qu'est-ce que cette personne essayait réellement d'accomplir ? » Il transforme un journal désordonné en une instruction claire : « Bloquez ces adresses IP malveillantes et enregistrez la liste dans ce fichier. »
- Étape 2 : Construire la cuisine. L'enregistrement ne vous dit pas quels outils le chef avait. Le moteur doit deviner quels logiciels et fichiers étaient nécessaires, créer une copie numérique parfaite de cet environnement informatique (en utilisant quelque chose appelé un « conteneur Docker »), et s'assurer que les commandes originales fonctionneraient réellement là-bas.
- Étape 3 : Le filet de sécurité. Puisqu'il n'y a pas de professeur pour noter le travail, le moteur crée son propre « test ». Il exécute la solution et vérifie : « Le fichier est-il apparu ? La liste est-elle correcte ? » Si le test échoue, il corrige le test jusqu'à ce qu'il soit parfait.
3. Le nouvel examen « Monde réel »
À partir de ces 80 000 enregistrements, ils ont créé une immense nouvelle banque de tests appelée TERMINALWORLD.
- Elle contient 1 530 tâches validées.
- Elle couvre 18 types différents de vrais emplois, de la configuration de serveurs cloud à la correction d'erreurs de base de données.
- Elle utilise 1 280 commandes informatiques différentes, dont 91 % n'avaient jamais été vues dans les tests précédents.
Ils ont également créé une version plus petite et ultra-difficile appelée TERMINALWORLD-VERIFIED (200 tâches) que des humains ont double-vérifiée pour s'assurer qu'elle était exacte à 100 %.
4. Les résultats choquants
Ils ont soumis les modèles d'IA les plus intelligents au monde (comme les dernières versions de Claude, GPT et Gemini) et leurs cadres « agents » (le logiciel qui aide l'IA à utiliser l'ordinateur) à ce nouveau test.
Voici ce qu'ils ont découvert :
- Le « paradoxe de l'efficacité » : Plus l'IA est intelligente, plus elle lutte parfois. La meilleure IA n'a réussi que 62,5 % des tâches. Lorsqu'elles échouaient, elles ne renonçaient pas simplement ; elles continuaient d'essayer, gaspillant d'énormes quantités de temps et d'argent à explorer les mauvais chemins. C'est comme un élève qui relit encore et encore le même paragraphe confus au lieu de demander de l'aide.
- Le fossé « Énigme vs Réalité » : Il y avait presque aucun lien entre la performance d'une IA sur les anciens tests « énigmes » (Terminal-Bench) et sa performance sur ce nouveau test « vie réelle ».
- Analogie : Une IA pourrait être championne pour résoudre des grilles de Sudoku (l'ancien test) mais échouer complètement à conduire réellement une voiture dans le trafic (le nouveau test). Les anciens tests étaient simplement trop différents du vrai travail.
- Agents vs Humains : Lorsque l'IA résolvait une tâche, elle le faisait rarement de la même manière que l'humain dans l'enregistrement. Ils empruntaient des chemins différents pour arriver à la même destination. C'est en fait une bonne chose ! Cela signifie que l'IA ne copie pas simplement ; elle trouve sa propre voie, même si cette voie est plus longue que celle de l'humain.
La conclusion
L'article soutient que nous ne pouvons plus faire confiance aux tests conçus par des experts dans un laboratoire. Pour savoir si une IA est vraiment prête à travailler dans le monde réel, nous devons la tester sur de véritables flux de travail humains qui sont désordonnés, complexes et en constante évolution.
TERMINALWORLD est un outil qui transforme automatiquement le vrai travail humain en test, garantissant que, à mesure que les développeurs changent leur façon de travailler, nos tests pour l'IA évoluent avec eux. C'est un passage du test « Pouvez-vous résoudre une énigme ? » au test « Pouvez-vous faire le travail ? »
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.