Tracing the ongoing emergence of human-like reasoning in Large Language Models
Ce papier révèle que, bien que les grands modèles de langage démontrent une grande précision en logique sémantique, ils échouent généralement à reproduire le raisonnement pragmatique qui permet aux humains d'enrichir les énoncés conditionnels de significations dépendantes du contexte, une capacité qui demeure une aptitude émergente indépendamment de l'architecture du modèle ou de son orientation d'entraînement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un robot à comprendre la conversation humaine. Vous voulez savoir si le robot n'est qu'un dictionnaire ultra-rapide qui connaît les définitions des mots, ou s'il a véritablement appris les « règles non écrites » de la façon dont les humains parlent et pensent réellement.
Ce document est comme un bulletin de notes pour 25 modèles d'IA différents (Grands Modèles de Langage, ou LLM) sur un test spécifique de raisonnement à la manière humaine. Voici le détail de leurs résultats, illustré par des analogies simples.
Le Test : Le Jeu du « Si »
Les chercheurs ont utilisé une énigme logique classique impliquant des phrases avec « Si ». Dans la conversation humaine, les phrases avec « Si » peuvent signifier deux choses très différentes selon la situation.
- Le « Marché » (Conditionnelle Standard) :
- Exemple : « Si tu tondes la pelouse, je te donnerai 50 $. »
- Logique humaine : Nous comprenons cela comme un accord strict. Vous ne recevez l'argent que si vous tondez la pelouse. Si vous ne la tondez pas, vous n'êtes pas payé. Nous ajoutons une règle implicite : « Pas de tonte = Pas d'argent. »
- Le « Préavis » (Conditionnelle Biscuit) :
- Exemple : « Si tu as faim, il y a une pizza au four. »
- Logique humaine : Nous comprenons cela comme un conseil utile. La pizza est là indépendamment du fait que vous ayez faim ou non. Le « Si » n'est pas une condition pour l'existence de la pizza ; c'est simplement un moyen de vérifier si vous en avez besoin.
Le Défi : Les chercheurs ont demandé à des humains et aux modèles d'IA de juger si la deuxième partie de la phrase (la conséquence) était vraie dans des situations délicates.
- Scénario : Vous n'avez pas tondu la pelouse. Avez-vous reçu l'argent ? (Les humains disent « Non » à cause du marché).
- Scénario : Vous n'avez pas faim. Y a-t-il une pizza au four ? (Les humains disent « Oui » car la pizza est là de toute façon).
Les Résultats : Le « Littéral » contre le « Flexible »
L'étude a révélé une division claire entre la façon dont les humains et l'IA ont géré ces tests.
1. Les humains sont des « Détectives du Contexte »
Les humains sont excellents pour lire entre les lignes. Nous savons qu'une promesse concernant la tonte de la pelouse est un accord strict, mais qu'un commentaire sur la pizza n'est qu'un fait utile. Nous ajustons automatiquement notre compréhension en fonction de la situation.
2. Les modèles d'IA sont des « Robots Littéraux »
Les modèles d'IA ont généralement échoué à agir comme des détectives humains. Ils sont tombés dans deux pièges principaux :
- Piège A : Le « Comptable Rigide »
Certains modèles ont agi comme un programme informatique rigide. Ils ont regardé la phrase « Si tu tonds la pelouse, je te paierai » et ont dit : « D'accord, logiquement, si vous ne l'avez pas tondu, l'énoncé reste techniquement vrai car la condition n'a pas été remplie. » Ils ont manqué l'accord implicite. Ils étaient si concentrés sur la logique stricte qu'ils ignoraient le sens humain. - Piège B : Le « Sur-Correcteur »
D'autres modèles ont essayé d'être trop intelligents. Ils ont décidé que chaque phrase avec « Si » est un accord strict. Donc, quand ils ont entendu « Si tu as faim, il y a une pizza », ils ont pensé : « Ah, donc si tu n'as pas faim, il n'y a PAS de pizza. » Ils ont appliqué la règle de « tondre la pelouse » à la phrase sur la pizza, ce qui est faux.
Le Verdict : Les modèles d'IA sont excellents pour connaître la définition de dictionnaire de « Si » (la logique), mais ils sont terribles pour comprendre le contexte social (la pragmatique). Ils sont comme des acteurs qui ont mémorisé le script parfaitement mais ne comprennent pas les sentiments du personnage.
Le « Type » d'IA a-t-il importé ?
Les chercheurs se sont demandé si la « personnalité » ou la « structure » de l'IA changerait les résultats. Ils ont vérifié :
- Open Source vs Closed Source : Les modèles avec un code public (Open) ont-ils mieux réussi que les secrets (Closed) ? Non.
- Spécialisé vs Général : Les modèles conçus spécifiquement pour le « raisonnement » ont-ils mieux réussi que les chatbots généraux ? Non.
- Architecture : Les modèles avec une conception interne spécifique (Mixture-of-Experts) ont-ils mieux réussi que les modèles standard ? Non.
C'était comme tester différentes marques de voitures pour voir laquelle conduit mieux sur la glace. Étonnamment, cela n'a pas importé qu'il s'agisse d'une Ferrari ou d'une Toyota ; elles ont toutes glissé de la même manière. La capacité de comprendre ces « règles non écrites » n'était pas quelque chose qui découlait automatiquement du fait d'être un modèle plus grand ou plus complexe. Cela semblait être une compétence spécifique et émergente que certains modèles possédaient par hasard et d'autres non, mais vous ne pouviez pas la prédire simplement en regardant les spécifications du modèle.
Le « Biais de Décontextualisation »
Les auteurs appellent ce problème un « Biais de Décontextualisation ».
Imaginez un élève qui est excellent pour les problèmes de mathématiques sur une feuille d'exercices mais échoue quand vous lui demandez d'utiliser les mathématiques pour partager l'addition d'un dîner avec des amis. L'IA est cet élève qui connaît les mathématiques (la logique) mais n'a pas appris comment les appliquer à la vie réelle (le contexte). Parce que l'IA a été entraînée sur du texte mais ne vit pas réellement dans le monde réel, elle lutte pour comprendre que parfois « Si » signifie un accord, et parfois cela signifie simplement « Au fait ».
Résumé
- Les humains passent naturellement de la logique stricte au contexte social.
- L'IA tend à s'en tenir à une règle rigide (soit toujours stricte, soit toujours souple) et manque la nuance.
- La Cause : Il ne s'agit pas de la taille du modèle ou du fait qu'il soit « open source ». C'est que l'IA manque actuellement de «ancrage dans le monde réel» qui aide les humains à comprendre la différence entre une promesse et un conseil.
Le document conclut que si l'IA s'améliore en logique, la capacité « à la manière humaine » de lire la pièce et de comprendre les significations implicites est encore en cours de développement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.