Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review
Cette revue synthétise les preuves issues des perspectives représentationnelle, comportementale et mécaniste sur l'accord sujet-verbe, la négation et la généralisation compositionnelle dans les Transformers pré-entraînés afin de révéler des modèles distincts de convergence et de fragmentation, proposant finalement un diagnostic d'accessibilité et d'usage pour clarifier les limites actuelles et guider la recherche future à travers les différents niveaux.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le langage est un système de règles qui nous permet de prendre des idées simples et de les combiner en une infinité de nouvelles pensées. Depuis des décennies, les scientifiques se demandent si les programmes informatiques massifs qui rédigent désormais des textes fluides et répondent à des questions complexes ont véritablement appris ces règles, ou s'ils ne font que imiter des motifs qu'ils ont vus auparavant. Ces programmes, connus sous le nom de modèles de langage pré-entraînés, sont entraînés sur de vastes quantités d'écrits humains. Ils peuvent produire des phrases qui semblent parfaitement naturelles, ce qui amène beaucoup de gens à supposer qu'ils comprennent la grammaire et le sens de la même manière que les humains. Cependant, produire les bons mots n'est pas la même chose que savoir pourquoi ces mots vont ensemble. Un programme peut obtenir une phrase correcte par accident, ou en s'appuyant sur un raccourci, sans réellement saisir la logique sous-jacente. Pour résoudre ce mystère, les chercheurs ont développé trois façons différentes d'observer l'intérieur de ces modèles : vérifier quelles informations sont stockées dans leur mémoire interne, tester ce qu'ils produisent réellement dans leur sortie, et tracer les voies spécifiques qui les poussent à prendre une décision.
Une nouvelle revue menée par les chercheurs Yizhe Wang et Zhenhua Ling réunit ces trois manières d'observer pour voir si elles racontent la même histoire. Les auteurs se sont concentrés sur trois domaines spécifiques du langage qui sont essentiels pour comprendre comment ces modèles fonctionnent : la façon dont les verbes s'accordent avec leurs sujets, la façon dont le mot « ne... pas » (negation) modifie le sens d'une phrase, et la façon dont les modèles combinent des parties familières pour créer de nouvelles idées complexes. En rassemblant et en comparant des centaines d'études qui utilisaient ces trois méthodes différentes, les chercheurs ont découvert que la réponse dépend entièrement de la partie du langage à laquelle vous vous intéressez. Parfois, les preuves issues des trois méthodes concordent parfaitement ; d'autres fois, les méthodes racontent des histoires contradictoires, révélant des lacunes dans ce que les modèles savent réellement.
La plus claire réussite trouvée par les chercheurs concerne l'accord sujet-verbe, la règle selon laquelle un sujet singulier nécessite un verbe singulier, comme « le chat court », tandis qu'un sujet pluriel nécessite un verbe pluriel, comme « les chats courent ». Dans ce domaine, les trois différentes manières d'observer les modèles concordent. Lorsque les chercheurs ont regardé à l'intérieur des états internes du modèle, ils ont pu trouver un signal clair indiquant si un nom était singulier ou pluriel. Lorsqu'ils ont testé la sortie du modèle, celui-ci choisissait presque toujours la forme verbale correcte. Plus important encore, lorsque les chercheurs sont intervenus pour modifier ce signal interne, le comportement du modèle a changé de manière prévisible, le forçant à choisir le mauvais verbe. Cette convergence suggère que, pour les règles grammaticales simples, ces modèles ont véritablement appris la relation et l'utilisent pour prendre des décisions.
Le tableau devient beaucoup plus compliqué lorsqu'on examine la négation, ou la façon dont les modèles gèrent le mot « ne... pas ». Ici, les trois lentilles ne sont pas d'accord. Les vérifications internes montrent que les modèles peuvent détecter la présence du mot de négation et comprendre approximativement où il s'applique dans une phrase. Cependant, lorsqu'on demande aux modèles de produire du texte ou de répondre à des questions basées sur une phrase niée, ils échouent souvent à appliquer le sens correct. Ils peuvent voir le mot « ne... pas » mais agir tout de même comme si la phrase était affirmative. Les chercheurs ont découvert que, bien que les modèles puissent repérer le marqueur, ils ne l'utilisent pas de manière fiable pour inverser la vérité de l'énoncé. C'est comme si le modèle voyait le signe, mais ne suivait pas l'instruction qu'il donne. Ce décalage signifie que, bien que les modèles possèdent les morceaux d'information, ils ne les utilisent pas systématiquement pour comprendre le sens complet.
Le troisième domaine, qui implique la combinaison de différentes parties du langage pour créer de nouveaux sens, montre la plus grande confusion. Il s'agit de la capacité à prendre des mots et des règles connus et à les appliquer à des situations que le modèle n'a jamais vues auparavant. Les preuves ici sont fragmentées. Certaines études montrent que les modèles peuvent gérer des combinaisons simples, surtout lorsque les chercheurs fournissent des indices ou décomposent la tâche en étapes plus petites. D'autres études montrent que lorsque les modèles sont laissés à eux-mêmes pour résoudre des chaînes de raisonnement complexes, ils échouent souvent. Le problème est que les différentes études ne regardent pas la même chose. Certaines testent si le modèle peut reconnaître un motif, tandis que d'autres testent s'il peut construire une nouvelle idée à partir de zéro. Parce que les chercheurs n'ont pas pu trouver une manière unique et cohérente de mesurer cette capacité à travers toutes les études, ils n'ont pas pu conclure si les modèles possèdent réellement une compétence générale de combinaison d'idées ou s'ils sont simplement doués pour des astuces spécifiques et étroites.
Les auteurs de la revue suggèrent que ces différents résultats se produisent parce que certaines caractéristiques du langage sont plus faciles à isoler et à utiliser que d'autres. Pour l'accord sujet-verbe, la caractéristique est simple et isolée, de sorte que le modèle peut la trouver et l'utiliser. Pour la négation, le modèle peut trouver le marqueur mais peine à l'utiliser pour changer le sens global. Pour les combinaisons complexes, la caractéristique est si diffuse et difficile à définir que le modèle ne peut même pas l'isoler clairement. Les chercheurs concluent que nous ne pouvons pas supposer que ces modèles connaissent le langage de manière générale. Au contraire, leur connaissance est spécifique à la tâche. Ils sont excellents pour certaines choses, comme l'accord des verbes, mais sont incohérents pour d'autres, comme la compréhension de la négation, et ne sont pas encore prouvés pour la tâche la plus complexe consistant à créer de nouvelles idées à partir de parties anciennes. Cette conclusion change la façon dont nous devons évaluer ces systèmes : nous ne pouvons pas simplement regarder s'ils obtiennent la bonne réponse, mais nous devons aussi vérifier s'ils utilisent la bonne logique pour y parvenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.