CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
L'article présente CoRE, une évaluation de raisonnement sur le code à granularité fine qui mesure les modèles de langage de grande taille sur l'invariance d'implémentation et la transparence du processus, révélant que les modèles actuels manquent souvent de robustesse face à des implémentations de code équivalentes et s'appuient sur une exécution superficielle plutôt que sur un raisonnement authentique sur les états intermédiaires.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La Grande Idée : Les codeurs IA « pensent-ils » vraiment ?
Imaginez que vous engagez un étudiant brillant pour résoudre un problème de mathématiques. Il écrit la réponse finale, et elle est correcte. Vous lui donnez une étoile dorée.
Mais ensuite, vous lui demandez d'expliquer comment il y est arrivé. Il commence à inventer des chiffres, à mélanger les étapes et à se perdre au milieu du processus. Pourtant, d'une manière ou d'une autre, il est toujours arrivé au bon chiffre final.
Le Problème : Les tests actuels pour l'IA (les modèles de langage ou LLM) sont comme cette étoile dorée. Ils ne vérifient que la réponse finale. Si l'IA produit la bonne sortie, nous supposons qu'elle « a compris » le code. Les auteurs de ce papier soutiennent que c'est un piège. L'IA pourrait simplement deviner ou utiliser des raccourcis (des heuristiques) plutôt que de simuler réellement l'exécution du code dans son « esprit ».
La Solution : CoRE (Le « test d'honnêteté » pour le code)
Les auteurs ont créé un nouveau benchmark appelé CoRE (Code Reasoning). Au lieu de simplement demander « Quelle est la réponse ? », CoRE pose deux questions beaucoup plus difficiles :
- Est-ce que la façon dont vous posez la question a de l'importance ? (Invariance d'implémentation)
- Savez-vous ce qui s'est passé au milieu ? (Transparence du processus)
Analogie 1 : « Le même gâteau, différentes recettes » (Invariance d'implémentation)
Imaginez que vous demandez à un chef de cuire un gâteau au chocolat.
- Test standard : Vous lui donnez une recette spécifique (Recette A). Il la cuit. C'est bon. Validé.
- Test CoRE : Vous lui donnez quatre recettes différentes pour exactement le même gâteau au chocolat.
- Recette 1 : Utilise du cacao en poudre.
- Recette 2 : Utilise des barres de chocolat fondues.
- Recette 3 : Utilise un ordre de mélange dans le bol différent.
- Recette 4 : Utilise une température de four différente.
Si le chef est vraiment un maître, il devrait pouvoir cuire un gâteau parfait, quelle que soit la recette utilisée.
La découverte du papier : Les modèles d'IA ont échoué à ce test. Ils étaient excellents pour cuire le gâteau lorsqu'ils utilisaient une recette qui ressemblait à celle qu'ils écrivent habituellement (leur propre « style »). Mais lorsqu'on leur donnait une recette écrite par une autre IA (un « style » différent), ils faisaient souvent des erreurs, même si les mathématiques étaient identiques. Ils étaient « obsédés par le style » plutôt que par la logique.
Analogie 2 : Le « réalisateur de film » vs le « spoiler » (Transparence du processus)
Imaginez que vous regardez un film.
- Test standard : On demande à l'IA : « Qui gagne à la fin du film ? » Elle répond : « Le héros gagne. » Correct !
- Test CoRE : On demande à l'IA : « À la minute 45, quand le héros se cache dans le placard, qu'est-ce que le méchant tient ? Et à la minute 60, quel est le score du héros ? »
Cela vérifie les états intermédiaires.
La découverte du papier : Les modèles d'IA répondaient souvent correctement à la question « Qui gagne ? », mais ils hallucinaient les détails du milieu. Ils devinaient la fin basée sur des motifs, mais ils ne regardaient pas vraiment le film étape par étape. Ils exécutaient le code superficiellement sans vraiment comprendre le voyage.
Comment ils ont construit CoRE
Pour rendre ce test équitable et difficile, les chercheurs ont fait deux choses principales :
- Généré de nombreuses versions : Ils ont utilisé différents modèles d'IA pour écrire du code pour les mêmes 60 problèmes. Cela a créé une bibliothèque de 255 versions différentes de code. Certaines étaient longues et désordonnées ; d'autres étaient courtes et ingénieuses. Mais elles faisaient toutes exactement la même chose.
- Créé des questions de « quiz surprise » : Pour chaque morceau de code, ils ont généré des questions sur le milieu du processus.
- Arithmétique : « Quel est le nombre exact dans cette variable en ce moment ? »
- Logique : « Cette condition est-elle vraie ou fausse ? »
- État : « Combien de fois cette boucle a-t-elle tourné jusqu'à présent ? »
- Limite : « Que se passe-t-il juste au moment où la boucle s'arrête ? »
Ce qu'ils ont trouvé (Les résultats)
Ils ont testé 8 des modèles d'IA les plus intelligents disponibles (comme GPT-5, Claude, DeepSeek, etc.) en utilisant ce nouveau benchmark. Les résultats étaient surprenants :
- Le fossé du « biais de style » : Les modèles comprenaient beaucoup mieux le code écrit par leur propre « famille » (par exemple, les modèles OpenAI comprenaient mieux le code OpenAI) que le code écrit par d'autres. Cela suggère qu'ils mémorisent les styles plutôt qu'ils n'apprennent une logique universelle.
- Le fossé de « l'exécution superficielle » : De nombreux modèles obtenaient la bonne réponse finale mais échouaient au « quiz surprise » sur les étapes intermédiaires. Ils devinaient la destination sans connaître le chemin.
- Le score « RCS » : Les auteurs ont créé un nouveau score appelé Reasoning Consistency Score (RCS) (Score de cohérence du raisonnement). Ce score pénalise les modèles qui obtiennent la bonne réponse pour les mauvaises raisons. Si vous obtenez la bonne réponse mais échouez aux étapes intermédiaires, votre score tombe à zéro.
La Conclusion
Le papier conclut que obtenir la bonne réponse ne suffit pas. Le fait qu'une IA puisse prédire la sortie finale d'un extrait de code ne signifie pas qu'elle comprend comment le code fonctionne.
Les modèles d'IA actuels sont comme des acteurs qui mémorisent la dernière réplique d'une pièce de théâtre mais oublient le dialogue entre les deux. CoRE est le nouveau test qui les force à montrer leur travail, prouvant qu'ils « pensent » réellement à travers le code, et non qu'ils devinent simplement la fin.
En bref : CoRE expose le fait que les IA les plus intelligentes d'aujourd'hui écrivant du code « font semblant » en s'appuyant sur des motifs et des styles plutôt que sur un raisonnement authentique, étape par étape.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.