TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
Cet article présente TANGO, une nouvelle architecture de modèle de langage qui remplace les sous-couches standard du Transformer par une mise à jour résiduelle à porte inter-jetons (cross-token gated residual update) afin d'atteindre des performances supérieures sur les ensembles de données mathématiques et éducatives, ainsi que sa variante à complexité linéaire, WANGO, qui surpasse les modèles existants en temps linéaire.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, les outils les plus puissants pour comprendre le langage reposent sur une structure appelée le Transformer. Imaginez un lecteur parcourant un document long ; pour comprendre un mot spécifique, il doit revenir en arrière sur les mots qui l'ont précédé afin d'en saisir le contexte. Les modèles d'IA standards procèdent de cette manière en utilisant deux étapes distinctes. Premièrement, ils scannent l'intégralité de l'historique du texte pour rassembler les informations pertinentes provenant des mots passés, un processus semblable à un bibliothécaire localisant rapidement chaque livre qui pourrait être pertinent pour un sujet. Deuxièmement, ils prennent ces informations rassemblées et les traitent à travers un filtre séparé et indépendant à chaque position de la phrase pour affiner la signification. Cette danse en deux étapes a bien servi le domaine, mais elle est coûteuse en calculs, car elle exige que le modèle effectue une quantité massive de calculs pour chaque nouveau mot qu'il génère, surtout à mesure que le texte s'allonge. Les chercheurs cherchent depuis longtemps un moyen de combiner ces étapes ou de les rationaliser, espérant construire des modèles qui soient à la fois plus intelligents et plus efficaces, capables de gérer de vastes quantités d'informations sans être accablés par le poids pur des mathématiques nécessaires à leur traitement.
Un chercheur de l'Université Indiana à Bloomington a introduit une nouvelle approche qui remodèle fondamentalement la façon dont ces modèles interagissent avec le langage. Ils appellent leur création TANGO, ce qui signifie « Token-Aggregated Nonlinear Gating Operators » (Opérateurs de porte non linéaires agrégés par jeton). Au lieu de maintenir les étapes de collecte d'informations et de raffinement d'informations séparées, TANGO les fusionne en une action unique et unifiée. Dans ce nouveau design, chaque mot d'une phrase agit comme une source de contrôle. Tandis que le modèle lit, chaque mot génère un ensemble spécifique d'instructions, ou « portes », qui déterminent l'importance à accorder à différentes caractéristiques du texte. Lorsque le modèle atteint un nouveau mot, il ne se contente pas de regarder en arrière pour trouver les mots passés les plus pertinents ; il regarde en arrière pour voir quelles instructions ces mots passés ont préparées. Il fait ensuite la moyenne de ces instructions et les utilise pour mettre à l'échelle, ou ajuster, les caractéristiques du mot actuel avant de les ajouter à la mémoire du modèle. Cela signifie que l'influence d'un mot passé ne concerne pas seulement ce qu'il dit, mais aussi la manière dont il dit au mot actuel de s'interpréter lui-même.
Le chercheur a développé deux versions de ce système pour tester différents compromis entre précision et vitesse. La première, TATO, examine chaque mot qui a précédé le mot actuel, peu importe la distance qui le sépare dans le texte. Cette approche de « préfixe complet » permet au modèle de puiser dans l'intégralité de l'historique de la conversation ou du document, ce qui permet d'obtenir une compréhension très précise du contexte. Cependant, parce qu'il doit comparer le mot actuel avec chaque mot précédent, la charge de travail augmente rapidement à mesure que le texte s'allonge. La seconde version, appelée WANGO, adopte une approche plus pratique pour les textes très longs. Elle accorde une attention particulière aux mots les plus récents, en les traitant avec le même soin détaillé de l'historique complet que le premier modèle. Pour les mots plus anciens qui tombent en dehors d'une fenêtre récente, WANGO utilise une méthode différente et plus efficace pour résumer leur influence. Elle maintient un décompte courant des instructions générées par ces mots plus anciens, ce qui lui permet d'incorporer leur sagesse sans avoir à recalculer la relation avec chacun d'entre eux. Cette modification fait en sorte que la charge de travail du modèle Wango croît de manière linéaire à mesure que le texte s'allonge, plutôt que d'exploser en complexité, ce qui le rend beaucoup plus rapide pour les séquences longues.
Pour voir comment ces nouveaux designs se comportaient face à la technologie existante, le chercheur a entraîné six modèles différents en utilisant exactement la même quantité de données, le même nombre de paramètres et le même calendrier d'entraînement. Il a testé ces modèles sur trois défis très différents : une vaste collection de textes éducatifs du web, une bibliothèque de preuves mathématiques formelles écrites dans un langage appelé Lean, et une suite de problèmes mathématiques de DeepMind. Les résultats ont montré que le modèle TANGO, avec sa vue sur l'historique complet, a atteint la précision la plus élevée sur les trois tests, produisant les prédictions les plus fiables pour le mot suivant dans une séquence. Il a surpassé tous les autres modèles, y compris ceux qui utilisent des méthodes traditionnelles de partage de paramètres entre les couches. Le modèle Wango a également très bien performé, particulièrement dans la catégorie des modèles conçus pour être efficaces. Parmi les architectures capables de gérer des textes longs sans que leur coût computationnel ne s'emballe, Wango a produit les résultats les plus précis. Il a même battu un modèle qui utilisait une quantité de calcul similaire et reposait sur des techniques standard plus anciennes.
L'étude souligne un changement significatif dans la manière dont ces systèmes peuvent être construits. En permettant aux mots de contrôler le traitement des autres mots grâce à ces portes agrégées, le chercheur a trouvé un moyen de créer des modèles qui sont à la fois puissants et, dans le cas de Wango, efficaces. Le modèle TANGO a démontré qu'une étape unique et unifiée pour la collecte et le raffinement de l'information pouvait surpasser la performance du processus traditionnel en deux étapes, même lorsque le modèle était contraint d'effectuer plus de travail mathématique. Parallèlement, le modèle Wango a prouvé que ce haut niveau de performance n'a pas à se faire au détriment de la vitesse ; en résumant intelligemment les informations plus anciennes, il a maintenu une grande précision tout en gardant un coût de calcul gérable. Le chercheur a pris soin de noter que ces conclusions sont basées sur la capacité des modèles à prédire le mot suivant dans une séquence, une mesure standard de la compréhension du langage, et n'a pas affirmé que les modèles pouvaient nécessairement résoudre les problèmes mathématiques ou écrire les preuves parfaitement par eux-mêmes. Cependant, les résultats suggèrent que cette nouvelle façon de gérer l'information par des portes offre une voie prometteuse pour construire une IA capable de comprendre un langage complexe et des contextes longs avec une précision et une efficacité accrues.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.