Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled
Cette étude démontre que lorsqu'on contrôle l'expansion de la dimensionnalité en utilisant des modèles de langage de grande taille non entraînés, le pouvoir prédictif des vecteurs de LLM entraînés pour le temps de lecture humain et les données d'IRMf présente une mise à l'échelle inverse, avec une valeur ajoutée de l'entraînement qui diminue jusqu'à zéro à seulement quelques milliards de paramètres.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Depuis des décennies, les scientifiques observent des ordinateurs apprendre à lire et à écrire avec une rapidité qui semble presque biologique. Ces machines, connues sous le nom de grands modèles de langage, sont entraînées sur de vastes bibliothèques de textes humains jusqu'à ce qu'elles puissent prédire le mot suivant dans une phrase avec une précision stupéfiante. Parce qu'elles gèrent si bien le langage, les chercheurs ont commencé à se demander si ces machines ne faisaient pas que nous imiter, mais reflétaient réellement la façon dont nos propres cerveaux traitent le langage. L'espoir prédominant était qu'à mesure que ces modèles deviendraient plus grands et plus complexes, ils deviendraient de plus en plus performants pour prédire le temps qu'un humain met à lire un mot, ou la façon dont nos cerveaux s'illuminent lorsque nous écoutons une histoire. Cette idée suggérait que l'architecture de ces esprits numériques pourrait être une carte de l'architecture de la pensée humaine, impliquant que tout échec à correspondre aux données humaines n'était qu'une simple question de besoin de plus de puissance de calcul.
Cependant, une nouvelle étude menée par des chercheurs de l'Université d'État de l'Ohio et de l'Université de Californie à San Diego remet en question cette vision optimiste. Ils ont découvert que lorsqu'ils contrôlaient soigneusement la taille brute des données que ces modèles produisaient, la relation entre la taille du modèle et la performance de type humain changeait d'une manière spécifique : le bénéfice supplémentaire de l'entraînement disparaissait. Au lieu que le processus d'entraînement rende les modèles plus grands significativement meilleurs que leurs homologues non entraînés, les modèles les plus grands ne performaient pas mieux que les versions non entraînées de même taille. L'étude suggère que le succès apparent de ces systèmes massifs était largement une illusion créée par le volume colossal d'informations auxquelles ils pouvaient accéder, plutôt qu'une véritable compréhension du langage. Lorsque les chercheurs ont supprimé cet avantage, l'entraînement qui rendait ces modèles si puissants ne semblait offrir aucun avantage supplémentaire par rapport à une version totalement non entraînée de la même machine.
Pour comprendre comment ils sont arrivés à cette conclusion, il faut d'abord examiner la manière dont ces modèles sont typiquement testés. Les chercheurs nourrissent souvent un modèle de langage avec une histoire et comparent l'état interne du modèle à des données humaines, comme le temps de pause d'une personne sur un mot spécifique ou la façon dont son cerveau réagit à une phrase. Dans des études antérieures, il semblait que les modèles plus grands, qui possèdent plus de variables internes, prédisaient systématiquement mieux le comportement humain. Cela a conduit à une théorie appelée l'hypothèse « qualité-puissance » : plus le modèle est grand, plus il ressemble à l'esprit humain. Mais les chercheurs soupçonnaient une faille cachée dans cette logique. Lorsqu'un modèle s'agrandit, il ne devient pas seulement plus intelligent ; il produit également un nombre beaucoup plus élevé de signaux internes, ou vecteurs, à analyser. C'est comme donner à un étudiant un examen avec deux fois plus de questions ; même si l'étudiant ne sait rien, avoir plus de questions lui donne plus de chances de deviner la bonne réponse par chance. Les chercheurs ont réalisé que les études précédentes mesuraient peut-être le bénéfice d'avoir plus de questions, plutôt que le bénéfice d'avoir un meilleur cerveau.
Pour résoudre ce casse-tête, l'équipe a conçu une série d'expériences séparant l'effet de la taille de celui de l'intelligence. Ils ont rassemblé des données provenant de cinq familles différentes de modèles de langage, allant de petits modèles de quelques centaines de millions de paramètres à des modèles massifs de 66 milliards de paramètres. Ils ont testé ces modèles par rapport à de réelles données humaines, incluant les temps de lecture de personnes lisant des histoires naturelles et des scanners cérébraux de personnes écoutant ces mêmes histoires. Dans leur première expérience, ils ont répliqué les conclusions antérieures : à mesure que les modèles devenaient plus grands, leurs prédictions du comportement humain semblaient effectivement s'améliorer. Cela a confirmé que l'effet « qualité-puissance » était visible en surface.
Mais ensuite, ils ont introduit un contrôle crucial. Ils ont pris les mêmes modèles et les ont examinés avant qu'ils ne soient entraînés sur un quelconque texte. Ces modèles non entraînés possèdent exactement la même taille et la même structure que les modèles entraînés, mais ils sont essentiellement du bruit aléatoire, sans connaissance du langage. En comparant les modèles entraînés à leurs jumeaux non entraînés, les chercheurs pouvaient voir quelle part de l'amélioration provenait de l'apprentissage réel et quelle part provenait simplement du fait de disposer d'un plus grand nombre de signaux internes. Ils ont utilisé une méthode similaire à un réservoir, où un réseau non entraîné massif agit comme une source de matière brute qui peut être façonnée par un classificateur simple. Si l'entraînement rendait réellement le modèle plus humain, la version entraînée devrait nettement surpasser la version non entraînée, surtout à mesure que les modèles grandissaient.
Les résultats furent surprenants. Lorsque les chercheurs ont contrôlé la taille des signaux internes, l'avantage supplémentaire de l'entraînement a disparu. En fait, pour les modèles de plus de quelques milliards de paramètres, les versions entraînées ne performaient pas mieux que les versions non entraînées. Sur plusieurs ensembles de données, le bénéfice supplémentaire de l'entraînement est tombé à zéro. Cela signifie que les améliorations massives observées dans les études précédentes n'étaient pas dues au fait que les modèles plus grands avaient acquis une compréhension plus profonde du langage, mais simplement parce qu'ils possédaient plus de dimensions internes pour ajuster les données. Les chercheurs ont constaté qu'à mesure que les modèles dépassaient un certain seuil, la contribution de l'entraînement à l'ajustement du modèle par rapport à une base non entraînée chutait vers zéro, plutôt que d'augmenter. Plus le modèle devenait grand, moins le processus d'entraînement ajoutait de puissance prédictive par rapport à la puissance fournie par la taille du modèle seule.
L'étude a également examiné les différentes couches au sein des modèles, vérifiant si les sections médianes du réseau, que certains travaux précédents jugeaient plus importantes, se comportaient différemment. Ils ont trouvé le même schéma : la contribution de l'entraînement chutait vers zéro à travers toutes les couches à mesure que les modèles croissaient. Même lorsqu'ils ont ajusté leurs méthodes statistiques pour tenir compte de la possibilité que les modèles atteignaient simplement une limite dans leur capacité à prédire les données humaines, la tendance se maintenait. Les chercheurs ont conclu que le succès de ces grands modèles à prédire le comportement humain est largement dû à un effet statistique où le fait d'avoir plus de variables permet un meilleur ajustement, plutôt qu'à un reflet authentique de la cognition humaine.
Cette découverte suggère un désalignement significatif entre la façon dont ces systèmes artificiels sont construits et la façon dont les cerveaux humains fonctionnent. Le processus d'entraînement qui rend ces modèles si doués pour générer du texte ne les rend pas nécessairement meilleurs modèles de la lecture ou de l'activité cérébrale humaine. En fait, l'étude soutient que les versions non entraînées de ces réseaux massifs, qui agissent comme des réservoirs complexes de connexions aléatoires, pourraient être tout aussi efficaces pour prédire les données humaines que les versions coûteuses et entièrement entraînées. Les chercheurs proposent que les études futures utilisent ces modèles non entraînés comme une ligne de base standard pour garantir que toute amélioration attribuée à l'entraînement est réelle et n'est pas simplement un sous-produit de la taille du modèle. Si l'idée que « plus grand est meilleur » a fait progresser le domaine pendant des années, ce travail suggère que dans le domaine du traitement du langage humain, il existe un point où ajouter de la taille et de l'entraînement ne nous rapproche pas de la compréhension de l'esprit humain, mais nous en éloigne au contraire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.