How Robustly do LLMs Understand Execution Semantics?
Cette étude révèle que, contrairement aux modèles de raisonnement open-source qui conservent une compréhension robuste du code face aux perturbations, le modèle GPT-5.2 montre une fragilité marquée, soulignant ainsi les limites actuelles de la compréhension sémantique des LLMs et l'importance d'évaluer leur comportement via des transformations d'entrée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le Grand Test de Vérité des IA : Comprendre le Code ou juste "Reciter" ?
Imaginez que vous avez un super-élève (une Intelligence Artificielle) qui a lu tous les livres de code du monde. Il est capable de résoudre des énigmes complexes et de prédire exactement ce qu'un programme informatique va faire. C'est impressionnant, non ?
Mais les chercheurs de l'UC Davis et de l'UCL se posent une question cruciale : Est-ce que cet élève comprend vraiment ce qu'il fait, ou est-ce qu'il est juste un excellent acteur qui mémorise des scripts ?
Pour le savoir, ils ont organisé un examen très spécial avec trois épreuves pièges.
Épreuve 1 : Le Jeu de l'Élastique (Perturbation des Entrées)
L'analogie : Imaginez que vous demandez à votre élève de calculer le prix d'une pomme. Il répond "1 euro". Parfait. Maintenant, vous lui dites : "Et si la pomme pesait un tout petit peu plus ?" ou "Et si c'était une pomme verte au lieu d'une rouge ?".
- Ce qu'ils ont fait : Ils ont pris des milliers de petits programmes et ont légèrement modifié les données d'entrée (comme changer un nombre de 10 à 10,1).
- Le résultat surprenant :
- Les modèles "open-source" (comme DeepSeek) sont restés calmes. Ils ont un peu moins bien réussi, mais ils sont restés cohérents. C'est comme un élève qui dit : "Ah, c'est un peu plus lourd, donc le prix change un peu."
- Le modèle le plus célèbre et puissant, GPT-5.2, s'est effondré. Alors qu'il avait 99 % de réussite sur la question originale, il est tombé à 79 % dès qu'on a changé un tout petit détail.
- La leçon : GPT-5.2 semble avoir appris par cœur la réponse exacte, mais dès qu'on change le contexte, il panique. Il ne "comprend" pas la logique, il devine la réponse attendue.
Épreuve 2 : Le Déguisement (Transformation du Code)
L'analogie : C'est comme demander à votre élève de lire une histoire, puis de lui donner la même histoire écrite avec des mots différents, mais qui raconte exactement la même chose.
Exemple : Au lieu de dire "Le chien a couru", on dit "L'animal à quatre pattes s'est déplacé rapidement". Le sens est identique, mais les mots changent.
Ce qu'ils ont fait : Ils ont réécrit le code des programmes en changeant la structure (par exemple, remplacer une boucle
forpar une bouclewhile) sans changer ce que le programme fait.Le résultat :
- Là encore, GPT-5.2 a eu du mal. Il a perdu beaucoup de points. Il semble très sensible à la "façade" du code.
- Un autre modèle, Gemini 3 Pro, a été très robuste. Il a compris que l'histoire était la même, peu importe les mots utilisés.
- La leçon : Un vrai compréhension du code devrait être insensible à la façon dont il est écrit. GPT-5.2, malgré son titre de "meilleur", semble trop collé à la forme plutôt qu'au fond.
Épreuve 3 : Le Labyrinthe (Les Décisions et les Erreurs)
L'analogie : Imaginez un labyrinthe. Plus il y a de carrefours (décisions) et de murs, plus c'est difficile à naviguer. De plus, imaginez que certains chemins mènent à un précipice (une erreur de programmation).
- Ce qu'ils ont fait : Ils ont regardé combien de fois le programme prenait une décision (des "si... alors...") et si le programme plantait (lancait une exception).
- Le résultat :
- Plus le chemin était complexe (beaucoup de décisions), moins les IA étaient bonnes. C'est logique, c'est dur pour tout le monde.
- Le gros problème des erreurs : Quand le programme plante (par exemple, division par zéro), les IA ont terriblement du mal à dire "Attention, ça va planter !". Avec le message standard, GPT-5.2 n'avait que 15 % de réussite pour prédire les erreurs.
- Le remède magique (Le Prompt) : Les chercheurs ont simplement ajouté une phrase dans la consigne : "Vérifiez bien les types de données et les erreurs possibles".
- Résultat : La performance de GPT-5.2 pour prédire les erreurs est passée de 15 % à 81 % !
- La leçon : Les IA ne sont pas "bêtes", elles sont juste un peu paresseuses ou trop obéissantes. Si on ne leur demande pas explicitement de chercher les erreurs, elles ne le font pas. C'est comme si on demandait à un détective de trouver un voleur, mais qu'on ne lui disait pas de chercher des empreintes digitales.
En Résumé : Que retenir ?
- La force n'est pas la compréhension : Le fait qu'un modèle soit très performant sur les tests standards ne signifie pas qu'il comprend le code. Il peut simplement reconnaître des motifs.
- La fragilité des géants : Les modèles les plus puissants (comme GPT-5.2) sont parfois plus fragiles que des modèles plus petits quand on les teste avec des variations. Ils sont comme des athlètes de haut niveau qui trébuchent sur un petit caillou, tandis que des coureurs plus modestes restent stables.
- Le pouvoir des mots : La façon dont on pose la question (le "prompt") change tout. En demandant explicitement de chercher les erreurs, on peut transformer un élève médiocre en un expert.
Conclusion de l'auteur :
Les IA actuelles ne sont pas encore des ingénieurs logiciels fiables à 100 %. Elles sont brillantes, mais elles manquent de "robustesse". Pour les faire travailler en sécurité, il faut les tester avec des pièges (des perturbations) et leur donner des instructions très claires sur ce qu'il faut surveiller.
C'est un peu comme conduire une voiture autonome : elle roule bien sur l'autoroute (le test standard), mais il faut vérifier si elle sait gérer un chat qui traverse la route ou une route glissante (les perturbations) avant de lui faire confiance aveuglément.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.