SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Le document présente SWE-Bench ProMax, un benchmark multilingue rigoureusement organisé de 170 tâches de refactorisation de code à grande échelle conçu pour surmonter les failles et la saturation des évaluations existantes, démontrant que les agents d'IA de pointe actuels éprouvent encore des difficultés face aux défis complexes du génie logiciel préservant le comportement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où les ordinateurs apprennent à devenir des ingénieurs logiciels. Pendant des années, des scientifiques ont testé ces « agents de codage IA » en leur demandant de résoudre de minuscules énigmes isolées, comme écrire une fonction unique pour additionner deux nombres. C'est comme tester un pilote en le faisant rouler sur la piste d'un avion. Mais un véritable logiciel n'est pas construit ligne par ligne ; c'est une métropole massive et interconnectée de code où changer un seul panneau de signalisation peut nécessiter la mise à jour des cartes, des feux de signalisation et des horaires de bus dans toute la ville. La grande question que se posent les chercheurs est la suivante : ces agents d'IA peuvent-ils gérer la réalité désordonnée et complexe de la réécriture de pans entiers de logiciels sans rien casser ? C'est le domaine du « refactoring de code » — l'art de réorganiser le câblage interne d'un bâtiment sans modifier la façon dont les lumières s'allument pour les occupants.
Voici SWE-Bench ProMax, un nouveau test super exigeant conçu pour voir si les agents d'IA sont prêts pour la cour des grands. Les tests précédents étaient comme un jeu vidéo en mode « Facile », où l'IA pouvait souvent compter sur la mémorisation de réponses ou sur la résolution de problèmes trop simples. Les créateurs de ce nouveau benchmark ont réalisé que si les tests sont trop faciles ou mal conçus, les scores élevés de l'IA ne sont qu'une illusion d'intelligence. Ils ont donc construit un parcours du combattant en « Mode Difficile ». Ils ont rassemblé 170 défis logiciels réels provenant de sept langages de programmation différents (incluant Python, Java, C++ et Rust). Il ne s'agit pas de petites corrections ; ce sont des refontes massives où l'IA doit coordonner des changements à travers une moyenne de 11,4 fichiers différents et réécrire plus de 260 lignes de code, tout en s'assurant que le logiciel se comporte exactement de la même manière qu'auparavant.
Les résultats sont un rappel à la réalité pour l'industrie de l'IA. Lorsque les modèles d'IA les plus intelligents et les plus coûteux ont été jetés dans cette arène, ils n'ont pas réussi le test haut la main. Le meilleur modèle n'a réussi à résoudre que 41,2 % des tâches. Cela suggère que, bien que l'IA devienne douée pour les petites tâches, elle éprouve encore des difficultés avec la coordination complexe et multi-étapes requise pour l'ingénierie du monde réel. Curieusement, l'article a révélé que dépenser plus d'argent pour un modèle ne garantissait pas toujours de meilleurs résultats ; certains modèles open-source moins coûteux ont presque aussi bien performé que les géants onéreux. La raison principale de l'échec de l'IA ? Elle avait tendance à être une travailleuse « partielle ». Elle réparait le problème principal mais oubliait de mettre à jour les fichiers de support, comme réparer un tuyau qui fuit mais oublier de prévenir le compteur d'eau, ce qui fait échouer l'ensemble du système. Ce benchmark prouve que la maîtrise de l'ingénierie logicielle réelle pour l'IA est encore un travail en cours, nécessitant un niveau de planification et de coordination entre les fichiers que les agents actuels n'ont pas encore tout à fait maîtrisé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.