← Últimos artículos
💬 NLP

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

WhiteMatter es una novedosa arquitectura Transformer que mejora el rendimiento y reduce la huella de memoria mediante el empleo de un enrutador para mezclar los estados de los tokens de todas las capas en un conjunto comprimido de canales KV, permitiendo conexiones entre todas las capas de tipo todo-a-todo, dinámicas y adaptativas al token, durante la decodificación autorregresiva.

Autores originales: Wenbo Zhang, Xiang Ren

Publicado 2026-08-20
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Wenbo Zhang, Xiang Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial moderna que genera texto se basa en una estructura llamada Transformer, la cual procesa la información en una serie de capas apiladas. Imagine una línea de ensamblaje de una fábrica donde una materia prima pasa por la estación uno, luego por la estación dos, y así sucesivamente, con cada estación refinando el producto. En una configuración estándar, cuando el sistema se mueve al siguiente fragmento de texto, cada estación solo puede mirar hacia atrás al trabajo realizado por la estación directamente superior en el paso anterior. Esto significa que los conocimientos más profundos y complejos formados en la parte superior de la pila suelen ser inaccesibles para las estaciones inferiores y tempranas cuando están procesando nueva información. Si bien el sistema ha creado un historial rico de comprensión, lucha por utilizar toda esa profundidad de manera eficiente, lo que limita su capacidad para rastrear el contexto a largo plazo o resolver problemas complejos.

Investigadores de la Universidad del Sur de California han propuesto una nueva arquitectura llamada WhiteMatter para resolver este cuello de botella. En lugar de restringir cada capa a su propia profundidad, WhiteMatter permite que cada parte del sistema acceda a un resumen mezclado de la información de cada una de las capas del pasado. El equipo construyó un mecanismo que actúa como un enrutador dinámico, tomando los estados ocultos de todas las capas de una palabra anterior y mezclándolos en un conjunto más pequeño de canales compartidos. Cada capa de la palabra actual selecciona entonces uno de estos canales para leer de él. Este diseño imita la forma en que el cerebro humano conecta regiones distantes a través de fibras de la sustancia blanca, permitiendo que las partes superficiales de la red reciban información profunda y procesada del pasado, mientras que las partes profundas aún pueden acceder al contexto inmediato y bruto.

Los investigadores probaron este sistema entrenando modelos desde cero en un conjunto masivo de datos de ocho mil millones de tokens de texto. Compararon sus nuevos modelos WhiteMatter contra modelos estándar del mismo tamaño y contra modelos estándar mucho más grandes. Los resultados mostraron que un modelo WhiteMatter de dieciséis capas funcionó mejor que un modelo estándar de veinticuatro capas, logrando una tasa de error significativamente menor en la predicción de la siguiente palabra. Esta mejora se logró incluso cuando los investigadores comprimieron la memoria de almacenamiento requerida para el sistema a la mitad, demostiendo que el modelo podía mantener su alto rendimiento utilizando menos memoria. El estudio también demostró que el sistema podía entrenarse eficientemente utilizando un método iterativo específico que permite a la computadora procesar muchas palabras a la vez, en lugar de verse obligada a trabajar a través de ellas una por una, lo cual suele ser necesario para tales conexiones profundas.

La innovación central reside en cómo el sistema maneja la memoria de las palabras pasadas. En una configuración típica, la memoria de una palabra se almacena capa por capa, y la siguiente palabra solo puede acceder a la memoria en la misma profundidad. WhiteMatter rompe esta regla creando un grupo de canales de memoria que se actualizan basándose en el contenido de la palabra misma. Un enrutador analiza los estados ocultos de todas las capas de una palabra pasada y los mezcla en unos pocos canales. El número de estos canales puede ajustarse; los investigadores descubrieron que usar menos canales que el número total de capas reducía la huella de memoria sin sacrificar la capacidad del modelo para comprender textos complejos. Esta flexibilidad permite que el sistema sea más eficiente, ya que no necesita almacenar la historia de cada capa en su totalidad y detalle, sino solo las mezclas más relevantes.

Para que esto funcione durante la fase de entrenamiento, los investigadores tuvieron que superar una dependencia circular. Debido a que la memoria de una palabra depende del procesamiento de esa palabra, y el procesamiento depende de la memoria, el sistema no puede simplemente calcular todo en una sola pasada. El equipo desarrolló un método llamado iteración cíclica de Gauss–Seidel, que procesa el texto en grupos. Esto permite que el sistema actualice su comprensión en etapas, donde los grupos posteriores en una secuencia pueden utilizar inmediatamente la información actualizada de los grupos anteriores dentro de la misma pasada. Este enfoque resultó ser significamente más rápido que métodos anteriores que requerían muchas más pasadas para alcanzar el mismo nivel de precisión, haciendo que el entrenamiento de tales modelos profundos e interconectados fuera factible en hardware estándar.

Los experimentos confirmaron que esta arquitectura no solo mejora la calidad del texto generado, sino que también potencia el rendimiento del modelo en diversas tareas de razonamiento. Al ser probada en pruebas estándar de comprensión del lenguaje, los modelos WhiteMatter superaron consistentemente a sus contrapartes estándar de la misma profundidad e incluso superaron a modelos estándar más grandes. La configuración de mitad de memoria, que utilizó solo ocho canales para un modelo de dieciséis capas, mantuvo la mayor parte de las ganancias de rendimiento utilizando significativamente menos memoria que un caché completo. Esto sugiere que la capacidad de mezclar dinámicamente la información de todas las profundidades es más valiosa que simplemente aumentar el tamaño del almacenamiento de la memoria.

El estudio también exploró cómo se comporta el sistema bajo diferentes condiciones de entrenamiento. Los investigadores encontraron que la forma específica en que el sistema itera a través de los datos durante el entrenamiento tiene un gran impacto en su rendimiento final. Los modelos entrenados con un programa que imita de cerca el proceso de decodificación paso a paso final funcionaron mejor y fueron más estables. Sin embargo, incluso con un programa de entrenamiento más simple, los modelos WhiteMatter superaron a los modelos estándar, lo que indica que el cambio arquitectónico es el principal motor de la mejora. Los investigadores señalaron que, si bien el proceso de entrenamiento requiere más potencia computacional que un modelo estándar, el proceso de decodificación —la generación real de texto— es casi tan rápido, lo que hace que el sistema sea práctico para aplicaciones del mundo real.

En el contexto más amplio de la inteligencia artificial, este trabajo aborda una limitación fundamental en cómo los modelos de aprendizaje profundo procesan la información a lo largo del tiempo. Al permitir que cada capa acceda a una visión sintetizada de la historia de toda la red, WhiteMatter supera el aislamiento que típicamente afecta a las arquitecturas profundas. Los hallazgos sugieren que la eficiencia de estos sistemas no proviene únicamente de hacerlos más grandes o más profundos, sino de cómo conectan y comparten la información a través de sus estructuras internas. La capacidad de comprimir la memoria de las interacciones pasadas sin perder la riqueza de los datos ofrece un camino prometedor para construir modelos de lenguaje más capaces y eficientes.

Los investigadores concluyeron que su enfoque integra con éxito la retroalimentación de profundo a superficial, permitiendo que el sistema utilice la totalidad de la profundidad de sus representaciones. Demostraron que esto se puede lograr con una huella de memoria reducida, desafiando la suposición de que un mejor rendimiento requiere más almacenamiento. Si bien el proceso de entrenamiento implica cierta complejidad adicional, las ganancias en precisión y eficiencia durante el uso real del modelo son sustanciales. El trabajo proporciona un ejemplo concreto de cómo repensar las conexiones entre diferentes partes de una red neuronal puede conducir a mejoras significativas en el rendimiento, ofreciendo una nueva dirección para el desarrollo de futuros sistemas de inteligencia artificial.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →