ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
Cet article présente ClassEval-Pro, une référence rigoureuse et interdomaine de 300 tâches de génération de code au niveau de la classe, validée par un ensemble de modèles de langage de grande taille et des suites de tests à haute couverture, qui révèle que les modèles de langage de pointe actuels éprouvent des difficultés à créer du code compositionnel en raison d'erreurs de logique et de dépendances, avec un meilleur Pass@1 de seulement 45,6 %.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un chef robot comment cuisiner.
L'Ancienne Méthode (Niveau Fonction) :
Jusqu'à présent, les chercheurs ont principalement testé ces chefs IA en leur demandant de préparer un seul ingrédient simple, comme « hacher un oignon » ou « faire bouillir de l'eau ». L'IA excelle dans ce domaine. Elle peut hacher des oignons parfaitement 90 % du temps. C'est comme tester si le robot sait manier un seul outil.
La Pièce Manquante (Niveau Classe) :
Mais dans le monde réel, la cuisine ne consiste pas seulement à hacher un seul objet. Il s'agit de construire un plat entier où les ingrédients doivent fonctionner ensemble. Vous avez besoin d'une sauce qui sait combien de sel a été ajouté, d'une garniture qui correspond au plat principal, et d'une stratégie de dressage qui maintient le tout ensemble. C'est ce que l'article appelle la « création de code compositionnel ». C'est la capacité de construire une « classe » complète et organisée (une unité autonome de logiciel) où plusieurs parties communiquent correctement entre elles.
Le Problème :
Les auteurs affirment que nous n'avions pas de bon test pour cette compétence du « plat entier ». Les anciens tests étaient trop simples, et les quelques tests qui existaient étaient conçus par des humains, ce qui est lent, coûteux, et les recettes auraient pu être divulguées à l'IA pendant son entraînement (comme si l'IA trichait en mémorisant les réponses du test).
La Solution : ClassEval-Pro
L'équipe a construit un nouveau test massif appelé ClassEval-Pro. Voici comment ils l'ont réalisé, en utilisant une analogie créative :
- Les Ingrédients (Données) : Au lieu d'écrire des recettes à la main, ils sont allés dans une immense bibliothèque numérique (GitHub) et ont récupéré des recettes écrites après janvier 2025. Cela garantit que l'IA ne les a jamais vues auparavant, rendant le test équitable.
- Le Saladier (Transversalité des Domaines) : Ils n'ont pas simplement mélangé des ingrédients similaires. Ils ont forcé l'IA à mélanger des mondes complètement différents. Imaginez demander au robot de construire une « Calculatrice Financière » qui doit aussi gérer un « Inventaire de Jeu Vidéo ». Il doit faire en sorte que la logique de l'argent et la logique du jeu fonctionnent ensemble dans un seul programme cohérent.
- Le Test de Goût (Validation) : Avant même que le test ne commence, ils utilisent un panel de juges IA pour vérifier si la recette a du sens et si les « tests de goût » du test (tests de code) couvrent au moins 90 % de la recette. Si la recette est cassée, ils la jettent.
Les Résultats : Les Chefs Robots Luttent
Ils ont demandé à cinq des chefs IA les plus intelligents (comme GPT-5.1, Gemini et Qwen) de préparer ces plats complexes.
- Le Score : Même le meilleur chef n'a réussi qu'environ 45 % des plats. C'est une chute énorme par rapport aux 90 % obtenus sur des tâches simples comme « hacher un oignon ».
- L'Écart : Il y avait une grande différence entre le meilleur chef et le pire. Le meilleur en a eu 45 % de bons, tandis que le plus faible n'en a eu que 28 %. Cela prouve que le test est bon pour distinguer les chefs forts des faibles.
- Le Piège de la « Méthode » : Fait intéressant, les chefs pouvaient souvent écrire les étapes individuelles correctement (comme « hacher l'oignon » ou « ajouter le sel »). Mais lorsqu'ils essayaient de tout assembler en un seul plat fonctionnel, tout s'effondrait. L'oignon était haché, mais le sel était ajouté dans le mauvais pot.
Comment Ils Ont Tenté d'Aider (Stratégies)
Les chercheurs ont essayé de donner aux chefs différentes approches pour cuisiner :
- L'approche « Du Bas vers le Haut » : « Commencez par les ingrédients de base, puis construisez la sauce, puis la garniture. » Cela a aidé les chefs plus faibles à s'améliorer considérablement.
- L'approche « Du Haut vers le Bas » : « Planifiez tout le menu d'abord, puis cuisinez. » Cela a aidé les chefs les plus forts.
- L'approche « Compositionnelle » : « Écrivez la recette de la sauce, puis la recette de la garniture, puis collez-les ensemble. » Ce fut un désastre. Les chefs se sont perdus en essayant de coller les pièces, et leur taux de réussite s'est effondré à près de zéro (1,3 % pour un modèle).
Qu'est-ce Qui a Mal Tourne ? (Les Erreurs)
L'équipe a examiné 500 plats ratés pour voir ce qui avait mal tourné. Ils ont trouvé deux problèmes principaux :
- Erreurs de Logique (56 %) : Le robot comprenait les mots mais se trompait sur le sens. (par exemple : « Si l'utilisateur est hors ligne, donnez-lui un message de succès » au lieu d'un message d'échec).
- Erreurs de Dépendance (38 %) : Les pièces ne s'assemblaient pas. (par exemple : la recette de la sauce demandait un ingrédient que la recette de la garniture n'avait pas, ou ils utilisaient des noms différents pour le même bol).
La Grande Conclusion
L'article conclut que si l'IA est incroyable pour écrire de petits extraits de code isolés, elle est encore très mauvaise pour orchestrer un système entier. La partie la plus difficile n'est pas d'écrire le code d'une seule fonction ; c'est de s'assurer que cette fonction communique correctement avec les autres fonctions, partage les bonnes données et ne fait pas tout casser.
ClassEval-Pro est le nouveau « concours de cuisine » qui force enfin ces chefs IA à prouver qu'ils peuvent diriger une cuisine entière, et non pas simplement hacher un seul légume.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.