Language models suffer from a curse of ambiguity
Cet article identifie et analyse théoriquement une « malédiction de l'ambiguïté » dans les grands modèles de langage, démontrant que les distributions de jetons suivants ambiguës sont intrinsèquement plus difficiles à apprendre avec précision en raison d'une augmentation des exigences de capacité, de la taille des plongements, des étapes d'entraînement et d'un bruit d'échantillonnage amplifié, un constat validé par des expériences tant synthétiques que réelles.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les ordinateurs modernes qui écrivent et parlent sont fondés sur une idée simple et puissante : ils prédisent le mot suivant dans une phrase en observant les mots qui l'ont précédé. Ce processus se déroule un mot à la fois, comme une personne réfléchissant à une histoire, choisissant l'étape suivante la plus probable en fonction de ce qui a déjà été dit. Pendant des années, les ingénieurs se sont concentrés sur la manière de rendre ces machines plus performantes pour trouver la réponse unique la plus évidente. Mais à mesure que ces systèmes deviennent plus avancés, on leur demande de plus en plus de gérer des situations où il n'y a pas de réponse unique évidente. Lorsqu'une phrase peut se terminer de nombreuses façons différentes et tout aussi raisonnables, la machine doit apprendre à répartir sa confiance entre toutes ces possibilités, et non pas seulement choisir la meilleure d'entre elles. Cette capacité à comprendre l'incertitude devient critique, surtout lorsque ces machines commencent à rédiger les données d'entraînement de leurs propres versions futures. Si elles échouent à capturer toute la gamme des possibilités, elles risquent de créer une boucle étroite et répétitive qui dégrade la qualité de leur propre apprentissage.
Une équipe de chercheurs de l'Université de Stanford a découvert une barrière fondamentale qui rend cette tâche étonnamment difficile. Ils ont trouvé que plus une situation est ambiguë — c'est-à-dire qu'il existe de nombreux mots suivants plausibles — plus il est difficile pour la machine d'apprendre la distribution correcte des probabilités. Ils appellent cela la « malédiction de l'ambiguïté ». Il ne s'agit pas simplement d'une question de machine légèrement plus lente ou ayant besoin de plus de données ; la difficulté est ancrée dans l'architecture même des réseaux de neurones qui alimentent ces modèles. Les chercheurs ont montré que lorsque le nombre de réponses correctes augmente, la machine nécessite considérablement plus d'espace de stockage interne, des représentations internes de mots plus larges et beaucoup plus d'étapes d'entraînement pour maîtriser les calculs mathématiques. Même lorsque la machine finit par apprendre, le processus de sélection d'un seul mot parmi les nombreuses possibilités introduit un type de bruit qui l'empêche de correspondre parfaitement à la véritable distribution du langage.
Pour comprendre pourquoi cela se produit, l'équipe a décomposé le problème en ses plus petites parties. Ils ont traité la couche de décision finale de la machine comme un simple classificateur qui associe un contexte à un ensemble de résultats possibles. Dans leurs expériences, ils ont créé des tâches synthétiques où ils connaissaient la vérité terrain exacte : un nombre spécifique de mots étaient également probables après une expression donnée. Ils ont découvert que stocker un motif comportant dix issues possibles nécessitait environ dix fois plus de capacité que de stocker un motif n'en comportant qu'une seule. C'est comme si la machine devait construire un chemin distinct et séparé pour chaque option possible qu'elle doit mémoriser. De plus, ils ont découvert que le « vocabulaire » interne que la machine utilise pour contenir ces contextes doit croître en taille pour accommoder l'ambiguïté. Si la machine tente de représenter une situation avec de multiples fins valides en utilisant une représentation trop petite, elle ne peut tout simplement pas distinguer les options, peu importe l'intensité de son entraînement.
La difficulté ne se limite pas au stockage. Les chercheurs ont également analysé comment la machine apprend au fil du temps. Ils ont constaté que lorsqu'une situation présente de nombreux résultats possibles, le processus d'apprentissage commence beaucoup plus lentement. Parce que la machine voit chaque mot correct spécifique moins fréquemment lorsqu'il y en a beaucoup, le signal qu'elle reçoit pour ajuster ses paramètres internes est plus faible. Cela signifie qu'il lui faut plus de temps pour commencer à progresser. Pire encore, l'acte de s'entraîner sur des données réelles, où la machine ne voit qu'un exemple aléatoire du mot suivant correct à la fois, introduit une erreur persistante. Lorsque la cible est un mot unique et certain, la machine peut finir par l'apprendre parfaitement. Mais lorsque la cible est un éventail de nombreux mots, l'aléa de ne voir qu'un seul exemple à chaque étape crée un plancher d'erreur que la machine ne peut franchir. Peu importe la durée de son entraînement, elle sera toujours légèrement imprécise, incapable de répliquer parfaitement la véritable étendue des probabilités.
L'équipe a confirmé ces conclusions non seulement dans leurs tests synthétiques contrôlés, mais aussi dans de grands modèles de langage entraînés sur des textes du monde réel. En analysant la façon dont ces modèles se comportent sur des données réelles, ils ont observé les mêmes signatures : à mesure que l'ambiguïté d'un contexte augmentait, les prédictions du modèle devenaient moins précises, et celui-ci avait tendance à laisser fuiter de la masse de probabilité vers des mots qui ne devraient pas être là. Cela suggère que la malédiction de l'ambiguïté est une propriété universelle de ces systèmes, affectant tout, des petits modèles expérimentaux aux systèmes massifs de mille milliards de paramètres utilisés aujourd'hui. Les chercheurs soutiennent que cette limitation n'est pas un bug qui peut être corrigé par une simple mise à jour logicielle, mais une contrainte fondamentale de la manière dont ces réseaux représentent l'incertitude.
Cette découverte change notre façon de concevoir les capacités de l'intelligence artificielle. Elle suggère que, bien que l'augmentation de la taille de ces modèles aide, elle ne résout pas le problème central de l'ambiguïté. Même les plus grands modèles auront toujours du mal à modéliser parfaitement les situations comportant de nombreux résultats plausibles, laissant une fraction résiduelle de la vérité non apprise. Cela a des implications pratiques pour la façon dont nous faisons confiance à ces systèmes. Dans les domaines où la précision est cruciale, tels que le diagnostic médical ou le raisonnement juridique, nous devons être conscients que la distribution de confiance du modèle peut être intrinsèquement bruyante lorsque la réponse n'est pas tranchée. Ces travaux fournissent un nouveau cadre pour comprendre quand faire confiance à la production d'une machine et quand son incertitude est le signe d'une limitation structurelle profonde plutôt que d'un manque de données. En fin de compte, l'article révèle que la chose même qui rend le langage humain riche et flexible — la capacité de dire beaucoup de choses différentes de beaucoup de manières différentes — est précisément ce qui rend l'apprentissage par une machine si difficile.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.