LLMs Lean on Priors, Not Programming Language Semantics
Cet article introduit PLSemanticsBench pour démontrer que les modèles de langage de grande taille contemporains s'appuient principalement sur des associations lexicales préentraînées plutôt que de conditionner systématiquement leur raisonnement sur la sémantique formelle fournie, comme en témoigne leur forte dégradation de performance face aux mutations sémantiques, aux symboles nouveaux et aux traces d'exécution longues.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La grande question : Les LLM réfléchissent-ils ou ne font-ils que deviner ?
Imaginez que vous enseigniez à un élève comment jouer à un nouveau jeu de société. Vous lui donnez le livre de règles et vous dites : « Dans ce jeu, si tu fais un 6, tu recules. »
Un élève intelligent qui comprend les règles reculera immédiatement lorsqu'il fera un 6, même s'il n'a jamais joué à ce jeu spécifique auparavant.
Cependant, un élève qui a mémorisé des schémas en jouant à des milliers d'autres jeux de société pourrait hésiter. Il pourrait se dire : « Attendez, dans le Monopoly et le Cluedo, faire un 6 signifie généralement avancer. Je vais juste avancer, car c'est ce qui arrive habituellement. » Il se repose sur son expérience passée (ses « priors ») plutôt que sur les règles spécifiques que vous venez de lui donner.
Ce papier pose la question suivante : Les grands modèles de langage (LLM) agissent-ils comme l'élève intelligent qui suit les nouvelles règles, ou comme l'élève qui mémorise des schémas et ignore les nouvelles règles ?
L'expérience : Un langage de programmation « magique »
Pour tester cela, les chercheurs ont créé un langage de programmation spécial et léger appelé C⋆. Considérez ce langage comme une toile vierge.
Ils ont ensuite mis en place un test complexe avec trois scénarios différents :
- Le test standard : Ils ont donné au modèle le code et les règles normales (par exemple,
+signifie additionner). C'est comme jouer une partie normale d'échecs. - Le test de permutation (KeywordSwap) : Ils ont gardé le code identique, mais ils ont permuté la signification des symboles dans le livre de règles.
- L'astuce : Ils ont dit au modèle : « Dans cette version, le signe
+signifie en réalité soustraction ». - Le but : Si le modèle suit réellement les règles, il devrait soustraire. S'il se repose sur sa mémoire, il continuera d'additionner parce qu'il est habitué à ce que
+signifie addition.
- L'astuce : Ils ont dit au modèle : « Dans cette version, le signe
- Le test « extraterrestre » (KeywordObf) : Ils ont remplacé tous les symboles familiers par des caractères étranges, semblables à des symboles d'un script ancien et oublié, et ont fourni un livre de règles définissant la signification de ces symboles extraterrestres.
- Le but : Puisque le modèle n'a jamais vu ces symboles auparavant, il doit se fier entièrement au nouveau livre de règles. Il ne peut pas tricher en utilisant sa mémoire de ce que fait habituellement le signe
+.
- Le but : Puisque le modèle n'a jamais vu ces symboles auparavant, il doit se fier entièrement au nouveau livre de règles. Il ne peut pas tricher en utilisant sa mémoire de ce que fait habituellement le signe
Les résultats : Les « mémoriseurs de schémas » gagnent (et perdent)
Les chercheurs ont testé 11 des modèles d'IA les plus intelligents disponibles. Voici ce qui s'est passé :
1. Quand les règles sont normales :
Les modèles ont excellé ! Ils pouvaient prédire le résultat du code avec une grande précision (jusqu'à 90 %). Ils ressemblaient à des génies.
2. Quand les règles sont permutées (L'« Addition » devient « Soustraction ») :
Les modèles se sont effondrés. Leur précision a chuté de 40 % à 60 %.
- L'analogie : C'est comme un chef qui a cuisiné des millions de burgers. Vous lui dites : « Aujourd'hui, nous faisons un burger, mais le pain est en fait une pomme de terre. » Un vrai chef utiliserait la pomme de terre. Ces modèles, cependant, ont continué à vouloir utiliser le pain parce que leur cerveau est trop habitué à l'équation « Burger = Pain ». Ils n'ont pas pu outrepasser leur mémoire musculaire pour suivre votre nouvelle instruction.
3. Quand les règles sont extraterrestres (Le « KeywordObf ») :
Les modèles ont été légèrement plus performants ici que dans le test de permutation, mais ils ont tout de même beaucoup lutté. Ils ne pouvaient pas totalement faire confiance au nouveau livre de règles.
4. Le long terme (Boucles complexes) :
Lorsque le code devenait long et compliqué (comme une histoire avec de nombreux chapitres et des boucles), presque tous les modèles ont échoué. Même les modèles les plus « intelligents » n'arrivaient à obtenir correctement environ 35 % des séquences longues et complexes. Ils se perdaient au milieu de l'histoire et oubliaient les règles qu'ils étaient censés suivre.
Les modèles de « raisonnement » vs les modèles « non-raisonnement »
Les chercheurs ont également testé des modèles spécifiquement conçus pour « réfléchir étape par étape » (appelés modèles de raisonnement).
- La bonne nouvelle : Ces modèles étaient meilleurs pour suivre les nouvelles règles que les modèles standards.
- La mauvaise nouvelle : Même les meilleurs modèles de « raisonnement » ont échoué lorsque les règles ont été permutées. Ils se sont encore trop appuyés sur ce qu'ils avaient vu auparavant. Ils pouvaient suivre les règles pendant un court instant, mais dès que les règles devenaient bizarres ou que la tâche devenait longue, ils revenaient à leurs vieilles habitudes.
La « Chaîne de pensée » (Se parler à soi-même)
Les chercheurs ont testé une astuce appelée « Chaîne de pensée » (Chain of Thought), où ils demandaient aux modèles d'expliquer leur raisonnement à voix haute avant de donner la réponse.
- Résultat : Cela aidait les modèles à mieux réussir sur les tâches normales. Mais quand les règles étaient permutées (par exemple,
+signifie soustraire), le fait de « parler à voix haute » n'aidait pas. Les modèles faisaient toujours des erreurs de calcul parce que leur « mémoire musculaire » interne était trop forte.
La conclusion
Le papier conclut que les modèles d'IA actuels ne sont pas réellement basés sur le « raisonnement » à partir des règles que vous leur donnez. Au lieu de cela, ce sont des devineurs statistiques qui s'appuient lourdement sur ce qu'ils ont vu dans leurs données d'entraînement.
- La métaphore : Imaginez un acteur qui a mémorisé le script d'une pièce. Si vous lui dites : « Aujourd'hui, nous improvisons, et le mot 'Bonjour' signifie en fait 'Au revoir' », il dira probablement quand même « Bonjour » parce que c'est ce qu'il a l'habitude de dire. Il ne traite pas réellement la nouvelle signification ; il récite simplement le mot le plus probable issu de sa mémoire.
En bref : Si vous voulez qu'une IA suive un nouvel ensemble de règles strictes (comme un nouveau langage de programmation ou un nouveau contrat juridique), les modèles actuels ne sont pas fiables. Ils risquent d'ignorer vos nouvelles règles et de faire ce qu'ils pensent que vous vouliez probablement dire, en se basant sur leur entraînement passé.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.