← Derniers articles
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench présente un benchmark de 115 tâches de codage complexes et à long horizon, fondées sur de réelles mises à jour de versions open-source, pour démontrer que les agents d'IA de pointe actuels éprouvent des difficultés significatives dans le développement logiciel à grande échelle et multi-cibles, en résolvant moins de 40 % des tâches même avec les modèles les plus avancés.

Auteurs originaux : Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Publié 2026-05-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous embauchiez une équipe de développeurs juniors surdoués, propulsés par l'IA. Vous voulez savoir s'ils peuvent assumer un vrai travail : non pas corriger une simple faute de frappe dans une recette, mais réécrire entièrement un immense livre de cuisine de 500 pages pour ajouter de nouveaux chapitres, modifier la manière dont les ingrédients sont mesurés et réparer des fours défectueux, le tout tout en veillant à ce que les anciennes recettes continuent de fonctionner pour les personnes qui utilisent encore l'ancienne version.

C'est exactement ce dont traite l'article ROADMAPBENCH.

Voici la décomposition de l'article en termes simples :

1. Le Problème : La « Faute de frappe » vs La « Rénovation »

Pendant longtemps, nous avons testé les assistants de codage IA sur de petites tâches faciles. C'est comme demander : « Peux-tu corriger cette seule phrase dans ce paragraphe ? » L'IA répond généralement : « Oui ! » et obtient un A+.

Mais dans le monde réel, le développement logiciel ne consiste pas à corriger une phrase. Il s'agit de rénover un gratte-ciel. Vous devez changer la plomberie, le câblage électrique et les systèmes d'ascenseurs sur 50 étages différents, tous en même temps, sans que le bâtiment ne s'effondre.

Les auteurs ont réalisé que les tests existants étaient trop faciles. C'était comme demander à un architecte de réparer un robinet qui fuit, alors que le vrai travail consiste à concevoir une nouvelle aile pour un hôpital. Alors, ils ont créé un nouveau test, beaucoup plus difficile, appelé ROADMAPBENCH.

2. Le Nouveau Test : Le Défi de la « Mise à niveau de version »

Au lieu de demander à l'IA de corriger un bug, ROADMAPBENCH lui remet une feuille de route.

  • Le Contexte : L'IA est plongée dans un atelier numérique avec une ancienne version d'un vrai projet logiciel (comme un outil open-source populaire).
  • La Mission : L'IA reçoit un document de « feuille de route ». Ce document indique : « Dans la prochaine version de ce logiciel, nous devons ajouter ces 5 nouvelles fonctionnalités, modifier le fonctionnement de ces 3 éléments et corriger ces 2 bugs. »
  • L'Échelle : Ce n'est pas un changement minime. En moyenne, l'IA doit réécrire 3 700 lignes de code à travers 51 fichiers différents. C'est comme demander à l'IA de réécrire l'intégralité du scénario d'un film, de changer les costumes et de tourner à nouveau les scènes, le tout en une seule fois.
  • Les Règles : L'IA ne peut pas jeter un coup d'œil à la « clé de réponse » (la nouvelle version du logiciel). Elle doit trouver la solution uniquement à partir des instructions.

3. Les Résultats : L'IA est toujours un « Junior »

Les chercheurs ont testé 13 des modèles d'IA les plus intelligents disponibles (y compris les toutes dernières versions de sociétés comme Anthropic, OpenAI et Google). Ils ont soumis ces modèles au test ROADMAPBENCH.

Le résultat était déprimant :

  • Même l'IA la plus intelligente (Claude-Opus-4.7) n'a réussi que 39,1 % des tâches.
  • L'IA la plus faible n'a réussi que 5,2 % des tâches.

La Métaphore :
Si vous demandiez à un développeur junior humain de rénover une maison et qu'il ne terminait le travail correctement que 4 fois sur 10, vous diriez : « Il est encore en train d'apprendre. » L'article montre que même notre IA la plus avancée est encore dans la phase d'« apprentissage » lorsqu'il s'agit de projets logiciels complexes et à long terme.

4. Où Échouent-ils ?

L'article ne s'est pas contenté de compter les échecs ; il a examiné pourquoi ils échouaient. Ils ont trouvé un modèle basé sur le niveau d'« intelligence » de l'IA :

  • Les Modèles Plus Puissants : Ils réussissaient généralement à compiler (construire) le code et pouvaient écrire la plupart des fonctionnalités. Mais ils échouaient sur les détails. C'est comme s'ils construisaient une maison parfaite, mais que la poignée de porte était du mauvais côté, ou que l'interrupteur lumineux ne faisait pas réellement allumer la lumière. Ils comprenaient la vue d'ensemble mais manquaient la logique minuscule et précise.
  • Les Modèles Plus Faibles : Ils ne parvenaient souvent même pas à construire la maison. Ils oubliaient d'installer le toit, ou ils essayaient de mettre la cuisine au sous-sol. Ils échouaient au niveau de la construction de base.

5. Pourquoi Cela Compte (Selon l'Article)

Les auteurs soutiennent que nous devons cesser de tester l'IA sur des « corrections de fautes de frappe » car cela nous donne un faux sentiment de sécurité. Le fait qu'une IA puisse corriger un bug ne signifie pas qu'elle peut construire une nouvelle fonctionnalité.

ROADMAPBENCH est une nouvelle règle honnête. Il nous dit que, bien que l'IA s'améliore, la capacité à gérer des projets logiciels longs, complexes et multi-étapes reste un énorme défi non résolu. L'IA est actuellement comme un apprenti très talentueux qui peut bien suivre les instructions pendant quelques étapes, mais qui se perd lorsque le projet devient trop grand et complexe.

Résumé

  • Anciens Tests : « Peux-tu corriger ce seul mot cassé ? » (IA : Oui !)
  • ROADMAPBENCH : « Voici un plan pour mettre à niveau tout un système logiciel. Peux-tu le faire ? » (IA : Je peux essayer, mais je vais probablement faire des erreurs dans les détails ou oublier une étape.)
  • Conclusion : Nous n'en sommes pas encore là. L'IA est intelligente, mais elle n'est pas encore prête à être l'ingénieur en chef d'un projet logiciel majeur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →