A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
Cet article introduit SWE-RPG, un benchmark unifié pour les agents de codage qui évalue non seulement le succès final du correctif mais aussi les étapes de raisonnement intermédiaires telles que la clarification des exigences et la planification de l'implémentation, révélant que la récupération implicite des exigences est le principal goulot d'étranglement limitant les performances des agents actuels sur les tâches au niveau du dépôt.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où vous possédez un assistant robotique super intelligent capable d'écrire du code informatique. Vous lui donnez une instruction simple comme : « Corrige le bug dans ce jeu », ou « Ajoute un nouveau niveau », et il se met au travail. C'est le rêve des agents de codage IA. Pendant longtemps, des scientifiques ont testé ces robots en leur donnant une tâche et en regardant si le résultat final fonctionne. Si le jeu se lance sans planter, le robot reçoit une étoile d'or. S'il plante, le robot reçoit une croix rouge.
Mais voici le problème : une croix rouge ne vous dit pas pourquoi le robot a échoué. A-t-il mal compris vos instructions ? A-t-il élaboré un mauvais plan ? Ou a-t-il simplement tapé le mauvais code ? C'est comme un élève qui rate un examen de mathématiques et qui ne reçoit qu'une note de « 0/10 » sans voir les annotations du professeur sur ses erreurs. Pour rendre ces robots réellement meilleurs, nous devons voir leur processus de pensée, pas seulement la réponse finale. C'est la grande question que l'article aborde : Comment passer de la simple notation du correctif final à un véritable diagnostic du cerveau du robot ?
Entrez en scène SWE-RPG, un nouveau test ultra-détaillé conçu pour scruter l'esprit du robot. Les chercheurs ont construit un benchmark (un test standardisé) en utilisant 163 tâches de codage réelles provenant de 31 projets logiciels différents. Au lieu de simplement vérifier si le code fonctionne à la fin, ils ont créé des références de « Vérité d'Or » (Gold Truth) pour chaque étape du parcours du robot. Imaginez cela comme le livre de recettes d'un grand chef qui ne montrerait pas seulement le plat final, mais listerait aussi chaque ingrédient caché que le chef a dû deviner, chaque étape du plan de cuisson, et le moment exact où le robot pourrait avoir dévié de la trajectoire.
Les chercheurs ont soumis trois agents de codage populaires (nommés Claude Code, Codex et OpenCode) à l'épreuve, en les associant à six modèles de « cerveau » différents (LLM). Les résultats ont été une petite douche froide. Même les meilleurs robots n'ont résolu qu'environ 31,5 % des tâches. Cela signifie qu'ils ont échoué près des deux tiers du temps ! Mais la véritable magie de SWE-RPG fut de comprendre où ils avaient échoué. L'étude a révélé que le principal goulot d'étranglement n'était pas réellement l'écriture du code, mais la compréhension des règles cachées. Environ 24,5 % à 46,0 % des échecs sont survenus parce que les robots n'ont pas réussi à comprendre les « exigences implicites » — les choses que vous n'avez pas dites, mais que le robot devait savoir pour bien faire son travail.
Par exemple, si vous demandiez à un robot de « corriger l'importation TSV », il pourrait corriger le code mais casser accidentellement l'importation CSV parce qu'il n'avait pas réalisé que les deux étaient liés. L'étude suggère que pour rendre ces agents réellement utiles, nous devons cesser de nous concentrer uniquement sur la rédaction de code plus rapide et commencer à leur apprendre à être de meilleurs détectives, capables de lire entre les lignes d'une requête utilisateur. L'article conclut que, bien que ces agents soient impressionnants, ils éprouvent encore des difficultés avec le côté complexe et humain du développement logiciel, et que SWE-RPG est la nouvelle carte dont nous avons besoin pour les aider à naviguer à travers ces exigences cachées et délicates.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.