Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
Cet article examine si LLaMA 2 et Flan-T5 font preuve d'un véritable raisonnement transitif ou s'appuient sur des indices superficiels en contrôlant les chevauchements de mots, les connaissances pré-entraînées et les entités nommées, révélant que bien que les deux modèles exploitent les chevauchements lexicaux, Flan-T5 démontre une plus grande résilience aux manipulations basées sur la connaissance, suggérant un rôle potentiel du réglage fin dans le développement de la compréhension logique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le domaine en évolution rapide de l'intelligence artificielle, un type spécifique de programme informatique connu sous le nom de grand modèle de langage a captivé l'attention du monde entier. Ces systèmes, entraînés sur de vastes quantités de textes provenant d'Internet, peuvent écrire des histoires, traduire des langues et répondre à des questions complexes. Une question centrale pour les scientifiques étudiant ces machines est de savoir s'ils comprennent réellement la logique ou s'ils se contentent de mimer les motifs qu'ils ont vus auparavant. Pour tester cela, les chercheurs examinent une compétence fondamentale appelée raisonnement transitif. En termes courants, il s'agit de la capacité à relier deux informations distinctes pour parvenir à une nouvelle conclusion. Par exemple, si une personne sait qu'un chat est un type d'animal, et que tous les animaux ont besoin de nourriture, elle peut logiquement déduire qu'un chat a besoin de nourriture sans qu'on lui ait explicitement communiqué ce fait précis. Ce processus exige plus qu'une simple mémoire ; il demande la capacité de tisser les faits ensemble. La question qui anime les recherches récentes est de savoir si ces puissants programmes informatiques effectuent réellement ce tissage mental, ou s'ils prennent un raccourci en repérant des mots familiers et en devinant la réponse.
Une équipe de chercheurs de l'Université Heriot-Watt et de l'Université d'Édimbourg s'est donné pour mission d'étudier précisément cette question. Ils se sont concentrés sur deux types distincts de modèles de langage, l'un appelé LLaMA 2 et l'autre Flan-T5, pour voir comment ils géraient des questions nécessitant de relier deux faits. Les scientifiques ont utilisé deux collections existantes de questions conçues pour tester ce type de pensée. Une collection, connue sous le nom de QASC, présente des questions à choix multiples sur la science qui nécessitent de combiner deux affirmations pour trouver la bonne réponse. L'autre collection, appelée Bamboogle, contient des questions assez complexes pour qu'un moteur de recherche classique sur Internet puisse se tromper, forçant ainsi le modèle à s'appuyer sur son propre traitement. Les chercheurs voulaient savoir si les modèles raisonnaient véritablement à travers les étapes ou s'ils s'accrochaient simplement à des mots spécifiques, comme des dates ou des noms, qui apparaissaient à la fois dans la question et dans la réponse.
Pour découvrir la vérité, l'équipe a conçu une série d'expériences astucieuses où elle a systématiquement modifié les informations données aux modèles. Ils ont commencé par vérifier si les modèles pouvaient résoudre les problèmes lorsqu'on leur donnait les faits et un exemple clair de la manière de les relier. Les deux modèles ont bien performé dans ces conditions, mais les chercheurs soupçonnaient que cela était trop facile. Ils ont ensuite supprimé l'exemple de la manière de relier les faits, laissant les modèles le découvrir par eux-mêmes. Les résultats ont été révélateurs. Le modèle Flan-T5, qui avait été spécifiquement entraîné sur des tâches de raisonnement similaires, a continué à très bien performer même sans l'exemple. Le modèle LLaMA 2, cependant, a éprouvé des difficultés significatives sans ce guidage, suggérant qu'il dépendait fortement de la visualisation du schéma de raisonnement avant de pouvoir le suivre.
Les chercheurs ont ensuite adopté une approche plus radicale pour voir si les modèles comprenaient réellement le sens des mots. Ils ont mélangé l'ordre des mots au sein des faits, transformant des phrases claires en chaînes de texte incohérentes et absurdes. Étonnamment, la performance des modèles n'a pratiquement pas chuté. Ils étaient toujours capables de choisir la bonne réponse même lorsque les phrases n'avaient aucun sens grammatical. Cela suggérait que les modèles ne lisaient pas les phrases comme des pensées cohérentes. Au lieu de cela, ils scrutaient probablement des mots-clés spécifiques qui correspondaient aux choix de réponses. Lorsque les chercheurs ont entièrement supprimé ces mots-clés correspondants, la précision des modèles s'est effondrée, confirmant qu'ils se contentaient souvent d'associer des mots plutôt que de déduire une logique.
Pour écarter la possibilité que les modèles ne fassent que mémoriser les réponses de leurs données d'entraînement, l'équipe s'est tournée vers le jeu de données Bamboogle, qui contenait des questions qu'ils n'avaient jamais vues auparavant. Ici, ils ont introduit un dernier test rigoureux. Ils ont pris les noms de personnes, de lieux et de dates — les entités spécifiques qui apparaissent souvent dans les réponses — et les ont remplacés par des mots sans aucun sens. Ils ont également mélangé l'ordre des mots dans les faits. Face à ces versions de charabia, le modèle LLaMA 2 a presque totalement échoué. Il ne pouvait pas trouver la réponse sans les noms et les dates familiers pour le guider. Le modèle Flan-T5, cependant, a montré une autre forme de résilience. Bien que sa performance ait chuté, elle est restée nettement supérieure à celle de l'autre modèle. Cela suggère que, parce que Flan-T5 a été explicitement entraîné sur des tâches de raisonnement, il avait développé une capacité plus robuste à suivre la chaîne logique, même lorsque les indices familiers étaient supprimés.
L'étude conclut que, bien que les grands modèles de langage puissent donner l'apparence de raisonner, leur succès dépend souvent de la manière spécifique dont ils ont été entraînés et des indices disponibles dans le texte. Pour les modèles qui n'ont pas été spécifiquement affinés sur des tâches de raisonnement, la capacité à répondre à des questions complexes semble reposer lourdement sur la reconnaissance de mots et de motifs familiers plutôt que sur une véritable déduction logique. Même lorsqu'ils semblent réfléchir étape par étape, ils peuvent simplement repérer les bons mots-clés. Cependant, la recherche suggère que lorsqu'un modèle est soigneusement entraîné sur des ensembles de données conçus pour lui apprendre à relier les faits, il peut développer une capacité plus authentique de raisonnement transitif. Cette capacité lui permet de traiter des questions même lorsque les raccourcis habituels, comme les noms ou les dates reconnaissables, sont retirés. Les conclusions rappellent que des scores élevés lors de tests de raisonnement ne prouvent pas toujours qu'une machine comprend la logique ; parfois, elle est simplement très douée pour trouver les bons mots.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.