Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models
Cette étude empirique démontre que, bien que les grands modèles de langage puissent reconstruire des contenus appris sous certaines conditions d'élicitation, leur capacité à exprimer ces solutions non causales est systématiquement supprimée dans les contextes de génération standard, révélant une dissociation fondamentale entre l'apprentissage et l'expression.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le Titre : Ce que le modèle "sait" mais ne "dit" pas
Imaginez que les grands modèles de langage (comme ceux qui écrivent des textes pour vous) sont comme des cuisiniers ultra-sophistiqués qui ont lu des millions de livres de recettes.
Cette étude pose une question très simple : Si un cuisinier connaît une recette bizarre (par exemple, "faire cuire un gâteau avec de la magie"), va-t-il la servir si vous lui demandez un repas ?
La réponse intuitive serait : "Oui, bien sûr, il a la recette dans sa tête, donc il peut la faire."
Mais cette étude découvre quelque chose de surprenant : Non. Il refuse de la servir, même si vous lui demandez un repas de fête.
L'Analogie de la Bibliothèque Interdite
Pour comprendre, imaginons le modèle comme une immense bibliothèque :
La Capacité (Ce qu'il sait) :
Si vous demandez au bibliothécaire : "Montrez-moi tous les livres où les gens résolvent des problèmes grâce à des fantômes ou de la magie", il vous les sortira immédiatement. Il a bien lu ces livres. Il connaît l'histoire. C'est ce que les chercheurs appellent la "capacité de reconstruction".L'Expression (Ce qu'il dit) :
Maintenant, imaginez que vous demandez au bibliothécaire : "Racontez-moi une histoire sur quelqu'un qui a un problème et comment il le résout."
Vous vous attendez à ce qu'il raconte une histoire avec des fantômes, car c'est une histoire.
Mais non. Il vous racontera toujours une histoire logique, avec des causes et des effets réalistes. Il a oublié ou supprimé l'idée de la magie, même si elle est dans sa bibliothèque.
Ce que l'étude a fait (La Recette de l'expérience)
Les chercheurs ont joué le rôle de clients exigeants :
- Ils ont demandé à 3 robots différents (des modèles de langage très avancés) de raconter 300 histoires ou de donner 300 conseils pratiques.
- Ils ont varié les situations : des conflits entre amis, des problèmes de temps, des pénuries de ressources.
- Ils ont demandé des histoires de fiction (où la magie est normalement acceptée) et des conseils réalistes.
Le résultat est incroyable :
Sur 300 tentatives, aucun robot n'a jamais utilisé de solution "magique" ou "non logique" (comme "le problème s'est résolu par un miracle" ou "par hasard").
C'est 0 %.
Pourtant, quand les chercheurs ont demandé spécifiquement : "Donne-moi un exemple de problème résolu par la magie", les robots ont répondu : "Bien sûr, voici un exemple..."
La Leçon Principale : Le Filtre Invisible
C'est là que réside la découverte. On pensait auparavant que :
"Si le robot a lu quelque chose, il le dira parfois."
L'étude prouve le contraire :
"Le robot a appris à ne pas dire certaines choses, même s'il les connaît parfaitement."
C'est comme si le robot avait un chef cuisinier invisible (appelé "alignement" dans le jargon technique) qui surveille la cuisine. Ce chef a dit : "Peu importe ce que vous savez, ne servez jamais de plats magiques. Même pour une fête, restez réaliste."
Même si vous demandez une histoire de science-fiction, le robot s'arrête et se dit : "Attends, je ne dois pas utiliser la magie, ce n'est pas 'correct' selon mes règles."
Pourquoi est-ce important ?
- Ce n'est pas un manque de mémoire : Le robot ne "oublie" pas les faits. Il les censure activement.
- Le contexte ne suffit pas : Même dans un contexte où la fantaisie est normale (comme un conte de fées), le robot reste bloqué sur la logique réaliste.
- La prédiction est difficile : Si vous voulez savoir ce qu'un robot va dire, vous ne pouvez pas juste regarder ce qu'il a lu. Vous devez comprendre ses règles de comportement (ses filtres invisibles).
En résumé
Cette recherche nous dit que les intelligences artificielles sont comme des élèves très obéissants. Ils ont lu tout le manuel (ils savent tout), mais si le professeur (l'alignement) leur a dit "Ne jamais écrire de mensonges ou de magie", ils ne le feront jamais, même si on leur demande de raconter une histoire inventée.
Ils ne sont pas des machines à "tout dire" ; ce sont des machines à tout filtrer selon des règles qu'elles ont apprises pour être "polies" et "utiles".
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.