← Derniers articles
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

Cet article présente ClawForge, un cadre de référence soutenu par un générateur qui évalue les agents en ligne de commande sur des flux de travail exécutables comportant des conflits d'état persistants, révélant que les modèles de pointe actuels éprouvent des difficultés significatives à inspecter les états existants et à gérer les artefacts préexistants, atteignant au maximum 45,3 % de précision stricte.

Auteurs originaux : Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Publié 2026-05-15
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Vue d'Ensemble : Le Problème du « Bureau Encombré »

Imaginez que vous embauchiez un assistant robot très intelligent pour organiser votre vie. La plupart des tests que nous faisons passer à ces robots consistent à leur donner un bureau neuf et vide et à leur dire : « Veuillez rédiger une liste de tâches ». Le robot écrit la liste, et nous vérifions si les mots sont corrects.

Mais dans le monde réel, votre bureau n'est jamais vide. Il est couvert de projets inachevés, de vieux post-it, d'instructions contradictoires et de fichiers obsolètes. Un véritable test de l'intelligence d'un robot ne consiste pas seulement à se demander « Peut-il écrire une liste ? », mais « Peut-il regarder ce bureau encombré, identifier ce qui ne va pas, réparer les anciens éléments sans supprimer les bons, et terminer le travail ? »

Ce papier présente ClawForge, une nouvelle méthode pour tester les agents IA (robots) qui se concentre entièrement sur ce scénario de « bureau encombré ».


Qu'est-ce que ClawForge ? (L'« Usine à Scénarios »)

Les auteurs ont réalisé que créer manuellement ces tests de « bureau encombré » est trop difficile et trop lent. Si vous voulez tester 100 scénarios encombrés différents, vous devriez construire manuellement 100 désordres différents.

ClawForge est une usine automatisée.
Au lieu que des humains écrivent chaque test, les chercheurs ont construit un système qui génère les tests. Il prend un modèle (comme « Réparer un calendrier de publication cassé ») et remplit automatiquement les détails (différentes villes, différentes dates, différentes erreurs).

  • La Sortie : Il crée une « tâche exécutable » complète. Ce n'est pas seulement une question ; c'est une mini-simulation avec un état initial (le bureau encombré), un ensemble de règles et une méthode pour évaluer le résultat.
  • L'Objectif : Voir si l'IA peut gérer les Conflits d'État. Cela signifie faire face à des éléments déjà présents, dont certains peuvent être erronés, obsolètes ou en double.

Comment le Test Fonctionne (La « Boucle de Jeu »)

Imaginez le test comme un niveau de jeu vidéo où l'IA est le joueur :

  1. La Configuration : Le jeu charge un « fichier de sauvegarde » qui contient déjà certains éléments sur le plateau. Peut-être y a-t-il une tâche appelée « Réparer le serveur » qui est déjà là mais marquée comme « Priorité basse » (ce qui est faux).
  2. L'Instruction : L'IA reçoit un ordre : « La réparation du serveur est erronée. Corrigez-la, mais ne supprimez pas les autres tâches valides. »
  3. L'Action : L'IA tape des commandes une par une (comme un humain utilisant une ligne de commande).
  4. L'Évaluation : C'est la partie la plus importante. Le système ne vérifie pas si l'IA a tapé exactement les mêmes mots qu'un humain aurait tapés. Au lieu de cela, il vérifie l'état final du bureau.
    • L'ancienne tâche erronée a-t-elle été supprimée ?
    • La nouvelle tâche correcte est-elle présente ?
    • L'IA a-t-elle accidentellement créé un double de la tâche ?
    • A-t-elle laissé les éléments valides intacts ?

Si le bureau final est parfait, l'IA réussit. S'il est encombré, elle échoue.

Les Résultats : Les Robots Apprennent Encore

Les auteurs ont testé sept des modèles d'IA les plus intelligents disponibles (de sociétés comme OpenAI, Anthropic et Kimi) sur ce nouveau référentiel. Les résultats ont été surprenants et humbles :

  • Le « Score Parfait » est Rare : Même le meilleur modèle d'IA n'a obtenu environ 45 % des tâches parfaitement correctes. Cela signifie que le référentiel est difficile et n'a pas encore été « résolu ».
  • Le Problème de la « Mauvaise Réparation » : Un type spécifique d'échec était très courant. Lorsqu'on leur demandait de remplacer un élément erroné, les modèles restaient souvent bloqués. Ils pouvaient supprimer l'élément erroné mais oublier d'ajouter le nouveau, ou ajouter le nouveau mais laisser l'ancien, cassé, sur place.
    • Analogie : Imaginez qu'on vous dise de changer un pneu crevé. L'IA retire le pneu crevé mais oublie de mettre la roue de secours. Ou alors, elle met la roue de secours mais laisse le pneu crevé rouler par terre.
  • Le Problème du « Ne Touchez Pas » : Un autre échec fréquent se produisait lorsque le bureau était déjà presque terminé. L'IA voyait une tâche déjà correcte et, au lieu de simplement la laisser tranquille, elle essayait de la « réparer » à nouveau, créant un double.
    • Analogie : Vous dites au robot : « Le café est déjà préparé. » Le robot répond : « D'accord », puis en prépare immédiatement une deuxième cafetière, créant un désordre.
  • L'Efficacité Compte : Certains modèles ont pris beaucoup trop d'étapes pour résoudre des problèmes simples, tandis que d'autres étaient rapides mais faisaient des erreurs. Les meilleurs performeurs étaient ceux qui vérifiaient d'abord l'état existant avant d'agir.

Les Deux Défis les Plus Difficiles

Le papier met en lumière deux types spécifiques de scénarios de « bureau encombré » qui ont mis en échec presque tous les modèles :

  1. Remplacement d'État Erroné : L'IA doit identifier quelque chose qui est faux et le remplacer par quelque chose de vrai, tout en gardant tout le reste en sécurité. C'était la tâche la plus difficile ; le meilleur modèle ne l'a réussie que 17 % du temps.
  2. Reprise de Flux de Travail Interrompu : L'IA doit entrer dans une pièce où quelqu'un d'autre a commencé un projet, terminer les pièces manquantes et ne pas refaire les parties déjà faites. L'écart entre les meilleurs et les pires modèles ici était énorme (de 17 % à 90 %), montrant que certains modèles sont bien meilleurs pour « lire la pièce » avant de se lancer.

Pourquoi Cela Compte

Les auteurs soutiennent que nous ne pouvons plus tester l'IA uniquement sur des tâches « propres ». Le travail réel implique de faire face à l'histoire, aux erreurs et aux progrès partiels. ClawForge est un outil pour mesurer si une IA est vraiment prête à travailler dans un vrai bureau, où les choses sont rarement parfaites et où repartir de zéro est rarement une option.

En résumé : ClawForge est une salle de sport pour les agents IA afin d'apprendre à nettoyer une pièce encombrée sans casser le mobilier qui fonctionne déjà. Pour l'instant, même les agents IA les plus puissants trébuchent encore sur leurs propres pieds dans cette salle de sport.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →