← Últimos artículos
🤖 machine learning

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

Este artículo presenta TANGO, una novedosa arquitectura de modelo de lenguaje que reemplaza las subcapas estándar de Transformer con una actualización residual de compuerta entre tokens para lograr un rendimiento superior en conjuntos de datos matemáticos y educativos, junto con su variante de complejidad lineal WANGO, la cual supera a los modelos existentes de tiempo lineal.

Autores originales: Joshua Nunley

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Joshua Nunley

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, las herramientas más poderosas para comprender el lenguaje se basan en una estructura llamada Transformer. Imagine a un lector escaneando un documento largo; para entender una palabra específica, debe volver a mirar las palabras que la precedieron para captar el contexto. Los modelos de IA estándar hacen esto mediante dos pasos distintos. Primero, escanean todo el historial del texto para reunir información relevante de las palabras pasadas, un proceso similar al de un bibliotecario localizando rápidamente cada libro que podría ser relevante para un tema. Segundo, toman esa información recopilada y la procesan a través de un filtro separado e independiente en cada posición de la oración para refinar el significado. Este baile de dos pasos ha servido bien al campo, pero es computacionalmente pesado, ya que requiere que el modelo realice una cantidad masiva de cálculos por cada nueva palabra que genera, especialmente a medida que el texto se vuelve más largo. Los investigadores han buscado durante mucho tiempo una forma de combinar estos pasos o simplificarlos, con la esperanza de construir modelos que sean tanto más inteligentes como más eficientes, capaces de manejar vastas cantidades de información sin verse estancados por el peso puro de las matemáticas necesarias para procesarla.

Un investigador de la Universidad de Indiana en Bloomington ha introducido un nuevo enfoque que redefine fundamentalmente cómo estos modelos interactúan con el lenguaje. Llaman a su creación TANGO, que significa Operadores de Puerta No Lineales Agregados por Token (Token-Aggregated Nonlinear Gating Operators). En lugar de mantener los pasos de recopilación de información y refinamiento de información por separado, TANGO los fusiona en una única acción unificada. En este nuevo diseño, cada palabra en una oración actúa como una fuente de control. A medida que el modelo lee, cada palabra genera un conjunto específico de instrucciones, o "puertas" (gates), que determinan cuánta importancia se debe otorgar a diferentes características del texto. Cuando el modelo llega a una nueva palabra, no solo mira hacia atrás para encontrar las palabras pasadas más relevantes; mira hacia atrás para ver qué instrucciones han preparado esas palabras pasadas. Luego, promedia estas instrucciones y las utiliza para escalar, o ajustar, las características de la palabra actual antes de añadirla a la memoria del modelo. Esto significa que la influencia de una palabra pasada no trata solo de lo que dice, sino de cómo le dice a la palabra actual que se interprete a sí misma.

El investigador desarrolló dos versiones de este sistema para probar diferentes equilibrios entre precisión y velocidad. La primera, TANGO, observa cada una de las palabras que precedieron a la actual, sin importar qué tan atrás estén en el texto. Este enfoque de "prefijo completo" (full-prefix) permite al modelo nutrirse de todo el historial de la conversación o el documento, lo que resulta en una comprensión altamente precisa del contexto. Sin embargo, debido a que debe comparar la palabra actual con cada palabra anterior, la cantidad de trabajo que tiene que hacer crece rápidamente a medida que el texto se alarga. La segunda versión, llamada WANGO, adopta un enfoque más práctico para textos muy largos. Presta mucha atención a las palabras más recientes, tratándolas con el mismo cuidado detallado de historial completo que el primer modelo. Para las palabras más antiguas que quedan fuera de una ventana reciente, WANGO utiliza un método diferente y más eficiente para resumir su influencia. Mantiene un recuento acumulativo de las instrucciones que generaron esas palabras más antiguas, lo que le permite incorporar su sabiduría sin tener que recalcular la relación con cada una de ellas. Esta modificación hace que la carga de trabajo del modelo Wango crezca de forma lineal a medida que el texto se alarga, en lugar de que su complejidad explote, lo que lo hace mucho más rápido para secuencias largas.

Para ver cómo estos nuevos diseños se comparaban con la tecnología existente, el investigador entrenó seis modelos diferentes utilizando exactamente la misma cantidad de datos, el mismo número de parámetros y el mismo cronograma de entrenamiento. Probaron estos modelos en tres desafíos muy diferentes: una gran colección de textos educativos de la web, una biblioteca de pruebas matemáticas formales escritas en un lenguaje llamado Lean, y una serie de problemas matemáticos de DeepMind. Los resultados mostraron que el modelo TANGO, con su visión de historial completo, alcanzó la mayor precisión en las tres pruebas, produciendo las predicciones más fiables para la siguiente palabra en una secuencia. Superó a todos los demás modelos, incluidos aquellos que utilizan métodos tradicionales de compartir parámetros entre capas. El modelo Wango también funcionó excepcionalmente bien, particularmente en la categoría de modelos diseñados para ser eficientes. Entre las arquitecturas que pueden manejar textos largos sin que su costo computacional se descontrole, Wango produjo los resultados más precisos. Incluso venció a un modelo que utilizaba una cantidad similar de cálculo pero que dependía de técnicas estándar más antiguas.

El estudio destaca un cambio significativo en la forma en que estos sistemas pueden construirse. Al permitir que las palabras controlen el procesamiento de otras palabras a través de estas puertas agregadas, el investigador encontró una manera de crear modelos que son tanto potentes como, en el caso de Wango, eficientes. El modelo TANGO demostró que un paso único y unificado para reunir y refinar la información puede superar el rendimiento del proceso tradicional de dos pasos, incluso cuando el modelo se ve obligado a realizar más trabajo matemático. Mientras tanto, el modelo Wango demostró que este alto nivel de rendimiento no tiene por qué venir a costa de la velocidad; al resumir la información más antigua de manera inteligente, mantuvo una alta precisión mientras mantenía el costo computacional manejable. El investigador fue cuidadoso al señalar que estos hallazgos se basan en la capacidad de los modelos para predecir la siguiente palabra en una secuencia, una medida estándar de la comprensión del lenguaje, y no pretendían afirmar que los modelos pudieran necesariamente resolver los problemas matemáticos o escribir las pruebas por sí solos. Sin embargo, los resultados sugieren que esta nueva forma de gestionar la información mediante puertas ofrece un camino prometedor para construir una IA que pueda comprender el lenguaje complejo y los contextos largos con mayor precisión y eficiencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →