The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans
Cet article introduit le paradigme de l'« énigme d'énigme » pour démontrer que, si les humains adaptent avec souplesse leurs stratégies de raisonnement au contenu du problème, les grands modèles de langage s'appuient souvent sur la reconnaissance de formes et des caractéristiques de surface, ce qui les amène à appliquer de manière inappropriée un raisonnement inventif à des problèmes littéraux et suggère que leur forte performance sur de véritables énigmes pourrait découler de la récupération mémorielle plutôt que d'un raisonnement flexible.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous jouez à un jeu où vous devez résoudre des énigmes. Certaines énigmes sont des devinettes complexes qui demandent de réfléchir de manière non conventionnelle, tandis que d'autres ressemblent exactement à des devinettes mais ne sont en réalité que de simples problèmes mathématiques déguisés.
Ce document présente une nouvelle façon de tester l'intelligence réelle des IA (les grands modèles de langage) par rapport aux humains. Ils appellent cela le paradigme de la « Énigme d'Énigme » (Riddle Riddle).
Voici un résumé simple de ce qu'ils ont fait et de ce qu'ils ont trouvé :
La configuration : Le « Piège » vs le « Littéral »
Les chercheurs ont créé deux types de questions qui se ressemblent presque parfaitement en surface :
- La vraie énigme (Le Piège) :
- Exemple : « Un cow-boy arrive en ville un vendredi, reste trois jours, et repart un vendredi. Comment est-ce possible ? »
- La réponse : Il faut réaliser que « Vendredi » est le nom de son cheval, et non le jour de la semaine. Cela nécessite une pensée inventive.
- L'Énigme d'Énigme (Le Littéral) :
- Exemple : « Un cow-boy arrive en ville un vendredi, reste trois jours, et repart un lundi. Comment est-ce possible ? »
- La réponse : C'est juste un calcul mathématique simple. Vendredi + 3 jours = Lundi. Aucun piège n'est nécessaire. Cela nécessite une pensée littérale.
La clé est que les deux questions se ressemblent. Elles ont la même structure de phrase et le même rythme. La seule différence est que l'une nécessite un « piège » ou non.
L'expérience
Les chercheurs ont soumis ces questions à deux groupes :
- Groupe 1 : Neuf des modèles d'IA les plus performants du moment (comme GPT-5, Claude, Gemini, etc.).
- Groupe 2 : 100 adultes humains.
Les résultats : Une inversion parfaite
Les résultats étaient comme regarder dans un miroir, mais avec un reflet inversé.
1. Comment l'IA a agi : Le résolveur « Premier Regard »
Les modèles d'IA étaient très bons pour les vraies énigmes (85 % de réussite) mais avaient du mal avec les Énigmes d'Énigme (seulement 50 % de réussite).
- Ce qui s'est passé : Quand l'IA voyait une question qui ressemblait à une énigme, elle supposait immédiatement : « Ah, ça doit être un piège ! Je dois utiliser ma pensée créative et sortir des sentiers battus. »
- L'erreur : Même quand la question était un simple problème mathématique (l'Énigme d'Énigme), l'IA essayait quand même de trouver un piège caché. C'était comme un détective qui voit une porte verrouillée et suppose immédiatement qu'il y a un tunnel secret, même si la porte est simplement déverrouillée et ouverte. L'IA était tellement habituée à ce que les énigmes comportent des pièges qu'elle ne pouvait pas s'empêcher d'en chercher.
2. Comment les humains ont agi : Le résolveur « Premier Littéral »
Les humains présentaient le schéma exactement opposé. Ils étaient excellents pour les Énigmes d'Énigme (80 % de réussite) mais avaient du mal avec les vraies énigmes (50 % de réussite).
- Ce qui s'est passé : Les humains reviennent naturellement à une interprétation littérale. Lorsqu'ils voyaient la question « Vendredi + 3 jours = Lundi », ils la résolvaient instantanément.
- L'erreur : Face à la vraie énigme (le cheval nommé Vendredi), les humains restaient souvent bloqués en pensant : « Attendez, Vendredi est un jour de la semaine, donc c'est impossible ! ». Ils devaient faire un effort supplémentaire pour outrepasser leur pensée littérale afin de trouver le piège.
La grande conclusion
L'article soutient que l'IA ne possède pas encore une capacité de raisonnement flexible.
- Les humains sont flexibles mais « paresseux ». Ils préfèrent les réponses simples et littérales, et ne passent en « mode créatif » que s'ils réalisent qu'ils sont bloqués.
- L'IA est l'inverse. Elle a mémorisé que « Structure de type énigme = Réponse créative ». Elle ne vérifie pas réellement si une réponse créative est nécessaire ; elle voit la forme de la question et sort automatiquement sa « boîte à outils créative ».
Les auteurs appellent cela « l'Illusion du Raisonnement ». Tout comme une personne peut voir une illusion d'optique dans une image alors que les lignes ont en réalité des longueurs différentes, l'IA « voit » un piège d'énigme même quand le problème est juste une simple question mathématique.
Conclusion
L'article conclut que, bien que l'IA puisse donner la bonne réponse à des énigmes célèbres, elle pourrait simplement réciter de mémoire ou suivre une règle rigide (« Si cela ressemble à une énigme, utilisez un piège »). Elle n'a pas encore appris la compétence humaine qui consiste à faire une pause pour se demander : « Ce problème nécessite-t-il réellement un piège, ou puis-je simplement le résoudre normalement ? »
En bref : L'IA pense en dehors de la boîte dès que la boîte porte l'étiquette « Énigme », même si la boîte est vide. Les humains restent généralement dans la boîte, et ne regardent à l'extérieur que lorsqu'ils y sont obligés.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.