Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
Cette étude révèle que si les modèles BERT bidirectionnels sont immunisés contre la « malédiction de l'inversion » qui entrave les modèles GPT autorégressifs dans la déduction logique symétrique, les deux architectures peinent face au raisonnement déductif complexe sur multi-ensembles, suggérant que la sélection du modèle doit être adaptée aux exigences logiques spécifiques de tâches telles que la construction de graphes de connaissances biomédicales.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les Robots Intelligents et le Labyrinthe des Miroirs
Imaginez que vous enseigniez à un robot à comprendre le monde. Vous lui montrez la photo d'un chat et dites : « Ceci est un chat. » Plus tard, vous lui montrez le mot « chat » et lui demandez : « Quelle image correspond à ceci ? » Un cerveau humain gère ce basculement sans effort ; nous savons que si « Chat » égale « Image », alors « Image » égale « Chat ». Mais pendant longtemps, les cerveaux informatiques les plus avancés, connus sous le nom de Grands Modèles de Langage (LLM), ont lutté avec ce simple renversement. Ils étaient comme des étudiants qui mémorisent une liste de réponses mais ne parviennent pas à comprendre la question si elle est posée à l'envers. Ce bug spécifique est appelé la « Malédiction de l'Inversion » (Reversal Curse).
Pour comprendre pourquoi cela importe, imaginez ces modèles d'IA comme deux types de lecteurs différents. L'un est le Décodeur (comme la célèbre série GPT), qui lit une histoire de gauche à droite, prédisant le mot suivant en se basant uniquement sur ce qui précède. Il est excellent pour écrire des histoires ou terminer des phrases, mais il ne peut pas regarder devant lui pour voir l'image globale. L'autre type est l'Encodeur (comme BERT), qui lit une phrase d'un seul coup, en examinant chaque mot en relation avec tous les autres simultanément. C'est comme lire une phrase avec une loupe qui vous montre le contexte de chaque mot en même temps. Les scientifiques se sont demandé : si nous apprenons à ces robots à faire des mathématiques de base avec des groupes de choses — comme combiner des listes d'amis ou trouver les amis qu'ils ont en commun — peuvent-ils réellement penser à travers la logique, ou ne font-ils que deviner en se basant sur les motifs qu'ils ont déjà vus ? Cette question est cruciale car si nous voulons utiliser ces robots pour construire des cartes de connaissances complexes (comme pour la médecine ou la science), ils doivent être capables de raisonner, et non pas seulement de répéter.
L'histoire de l'article : Qui peut renverser la vapeur ?
Dans cette étude, les chercheurs Da Wu, Jingye Yang et Kai Wang ont décidé de mettre ces différents cerveaux de robots à l'épreuve. Ils voulaient voir si la « Malédiction de l'Inversion » était un bug permanent ou simplement une particularité de la construction de certains modèles, et si ces modèles pouvaient réellement gérer des énigmes logiques plus compliquées impliquant des ensembles d'éléments.
Le test du miroir : La Malédiction de l'Inversion
D'abord, ils se sont attaqués à la « Malédiction de l'Inversion ». Imaginez que vous appreniez à un robot que « Jimmy Carter est le 39e président ». Si vous demandez au robot : « Qui est le 39e président ? », un robot standard (comme GPT-3) se fige souvent. Il connaît le fait dans un sens, mais ne peut pas le renverser pour répondre à la question inverse. Les chercheurs ont découvert que les modèles Décodeurs (comme GPT et Llama) souffrent réellement de cette malédiction ; ils ont du mal à déduire « B est A » à partir de « A est B ».
Cependant, le modèle Encodeur (BERT) racontait une histoire différente. Parce que BERT lit dans les deux sens à la fois, il ne s'est pas confondu. Lorsque les chercheurs ont posé la question inverse à BERT, il a répondu correctement environ 99 % du temps. Il s'avère que si vous voulez qu'un robot comprenne qu'une relation fonctionne dans les deux sens, vous avez besoin d'un cerveau capable de regarder l'image globale, et non pas seulement le passé.
L'énigme logique : Mélanger et assortir des groupes
Ensuite, l'équipe est passée à un défi plus difficile : les opérations sur les ensembles. Ils ont appris aux robots à effectuer une « Union » (combiner deux listes d'amis en une seule grande liste) et une « Intersection » (trouver les amis qui apparaissent sur les deux listes).
- Le niveau facile (Deux ensembles) : Lorsqu'on demandait aux robots de combiner ou de comparer seulement deux groupes de noms (comme « Super-héros » et « Dinosaures »), les modèles Décodeurs (Llama 2 et 3) ainsi que le modèle Encodeur (BERT) ont fait un travail fantastique. Ils ont donné les bonnes réponses presque à chaque fois. On aurait dit qu'ils avaient maîtrisé la logique.
- Le niveau difficile (Trois ensembles) : Ensuite, les chercheurs ont rendu l'énigme plus dure. Ils ont demandé aux robots de mélanger trois groupes à la fois, ou de faire un mélange d'opérations, comme : « Trouve les amis communs au Groupe A et au Groupe B, puis ajoute le Groupe C. »
C'est ici que le tour de magie a échoué. Bien que les robots aient été excellents pour les tâches simples à deux groupes, ils ont trébuché lors de l'implication de trois groupes.
- Le problème de BERT : Le modèle BERT semblait tricher. Il ne faisait pas réellement les mathématiques ; il cherchait simplement des mots qu'il reconnaissait. Si une phrase contenait un nouveau nom qu'il n'avait jamais vu, il disait immédiatement « Non, c'est faux ». Mais si la mauvaise réponse utilisait des noms qu'il connaissait, il se confondait et disait « Oui, c'est vrai ». Il mémorisait le vocabulaire, pas la logique.
- Le problème de Llama : Les modèles Llama (les modèles Décodeurs) ont également eu des difficultés. Lorsqu'on leur demandait de trouver les amis communs dans trois groupes, ils se contentaient souvent de lister tout le monde qu'ils connaissaient, ignorant les règles spécifiques de l'énigme. Ils semblaient rappeler une liste de noms vus durant leur entraînement plutôt que de calculer l'intersection correcte.
L'imprévisible GPT-4
Les chercheurs ont également testé le tout dernier modèle à code source fermé, GPT-4. Ce robot était bien meilleur que les autres. Il pouvait gérer la plupart des énigmes logiques à trois ensembles correctement, en décomposant souvent le problème en étapes plus petites pour le résoudre. Cependant, même GPT-4 a commencé à commettre des erreurs lorsque le nombre de groupes devenait trop élevé (comme sept ou huit ensembles), suggérant que même les modèles les plus intelligents actuels ont des limites lorsqu'il s'agit de déduction complexe à plusieurs étapes.
La conclusion principale
La leçon principale de cet article est que tous les cerveaux d'IA ne sont pas construits de la même manière, et qu'aucun robot n'est parfait pour chaque tâche. Si vous avez besoin d'un modèle pour comprendre une relation en sens inverse (comme inverser un fait), un modèle bidirectionnel comme BERT est le grand gagnant. Mais si vous avez besoin d'un modèle pour écrire une histoire ou prédire le mot suivant dans une phrase, les modèles unidirectionnels comme GPT restent les rois.
Plus important encore, l'étude suggère que, bien que ces modèles soient incroyables pour repérer des motifs et imiter le langage humain, ils ne « pensent » pas nécessairement comme les humains le font. Lorsque la logique devient trop complexe, ils ont tendance à revenir à la mémorisation de mots plutôt qu'à la compréhension des règles. Ainsi, si vous construisez un système pour créer un graphe de connaissances médicales ou résoudre une preuve mathématique difficile, vous ne pouvez pas simplement faire confiance au robot pour qu'il le comprenne par lui-même ; vous devez être très prudent quant à la manière dont vous posez les questions et au type de robot que vous choisissez pour faire le travail. Les robots deviennent plus intelligents, mais ils ont encore beaucoup à apprendre sur la véritable raisonnement logique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.