← Últimos artículos
🤖 machine learning

RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT introduce una arquitectura de transformador de profundidad recurrente que itera una única capa central compartida con modulación de compuerta, logrando una precisión y eficiencia de memoria superiores en comparación con los transformadores profundos estándar al intercambiar eficazmente el recuento de parámetros por la reutilización de profundidad adaptativa.

Autores originales: Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial moderna ha llegado a un punto en el que hacer que los modelos sean más inteligentes a menudo significa hacerlos más pesados. Para entender una oración o escribir una historia, estos sistemas dependen de vastas redes de conexiones matemáticas, conocidas como parámetros. En los diseños estándar, cada paso del proceso de pensamiento utiliza un conjunto único de estas conexiones. Este enfoque funciona bien, pero crea una carga pesada: para añadir más profundidad al razonamiento, los ingenieros deben añadir más memoria, lo que rápidamente se vuelve costoso y difícil de gestionar en el hardware físico. Existe una creciente tensión entre el deseo de un pensamiento profundo y complejo y los límites físicos de la memoria de las computadoras.

Durante décadas, los científicos han sabido que repetir el mismo proceso simple una y otra vez puede resolver problemas increíblemente complejos. Esta idea, arraigada en el trabajo fundacional de Alan Turing, sugiere que un sistema no necesita una biblioteca masiva de herramientas únicas para pensar; puede lograr la inteligencia aplicando una única herramienta refinada repetidamente. Si bien los modelos de lenguaje modernos se han alejado en gran medida de este estilo repetitivo en favor de la acumulación de muchas capas diferentes, un nuevo enfoque busca traer de vuelta el poder de la repetición, no ralentizando el sistema, sino haciendo que la repetición sea más inteligente. El objetivo es crear un modelo que pueda "pensar" más profundamente sin necesidad de almacenar más partes únicas.

Investigadores de la Universidad Alemana de El Cairo, la Universidad Técnica de Múnich y Cerebras Systems han desarrollado una nueva arquitectura llamada RecurrentGPT para resolver este problema. En lugar de construir una larga cadena de capas únicas, diseñaron un sistema con un conjunto pequeño y fijo de capas que se reutilizan varias veces. Imagine una línea de ensamblaje de una fábrica donde un solo trabajador altamente capacitado realiza una tarea, luego pasa el producto a sí mismo para refinarlo, y luego se lo vuelve a pasar de nuevo. En este nuevo sistema, el "trabiente" es un bloque compartido del cerebro del modelo. Procesa la entrada, luego toma su propia salida y la procesa de nuevo, y de nuevo, un número determinado de veces. Esto permite que el modelo realice el trabajo de un sistema mucho más grande almacenando solo una fracción de las partes únicas.

Sin embargo, simplemente repetir el mismo proceso crea un nuevo problema: si el trabajador hace exactamente lo mismo cada vez, el producto nunca cambia realmente. Los investigadores descubrieron que, sin un mecanismo para variar el proceso, los pasos repetidos colapsarían en una única transformación inútil. Para solucionar esto, introdujeron una compuerta dinámica —un mecanismo de toma de decisiones aprendido que controla cuánto de la nueva información reemplaza a la antigua. Esta compuerta observa el estado actual del modelo, la entrada original y una pequeña cantidad de ruido aleatorio para decidir exactamente qué mantener y qué actualizar en cada paso. Esto asegura que, aunque se utilicen los mismos pesos repetidamente, el modelo se comporte de manera diferente en cada turno, permitiéndole especializar su pensamiento a medida que profundiza.

Los resultados de este enfoque son sorprendentes. Cuando se probó bajo estrictas restricciones donde la cantidad total de potencia de cómputo utilizada para entrenar y ejecutar el modelo se mantuvo igual a la de los modelos estándar más grandes, el nuevo sistema funcionó igual de bien. En una prueba específica, un modelo con solo tres capas de pesos únicos, repetidas diez veces, igualó la precisión de un modelo estándar de doce capas. Esto significa que el nuevo diseño logró la misma calidad utilizando un 64 por ciento menos de parámetros únicos. Cuando los investigadores permitieron que el modelo utilizara más potencia de cómputo durante el proceso de pensamiento pero mantuvieron el número de partes almacenadas igual, el sistema repetido superó al estándar, demostrando que la profundidad y la repetición pueden ser una forma poderosa de mejorar la inteligencia sin inflar los costos de memoria.

El sistema también descubrió un efecto secundario útil por su cuenta. Debido a que el modelo fue entrenado para poder detenerse en cualquier punto de su ciclo de repetición, aprendió a producir respuestas de alta calidad incluso si se detenía temprano. Esto permite que el sistema actúe como un dial de velocidad versus calidad: puede dar una respuesta rápida y aproximada en una fracción del tiempo, o dedicar más ciclos para refinar esa respuesta en algo más preciso, todo a partir del mismo modelo entrenado. Esta flexibilidad es rara en los sistemas actuales, que usualmente requieren modelos separados para diferentes velocidades.

En términos prácticos, esto significa que un dispositivo con memoria limitada podría ejecutar un modelo de lenguaje mucho más capaz de lo que puede actualmente. Los investigadores midieron que su versión a gran escala requería un 59 por ciento menos de memoria pico durante la generación que un modelo estándar de capacidad similar. Aunque el tiempo que toma generar texto aumentó ligeramente debido a los pasos repetidos, la compensación es significativa para entornos donde la memoria es el cuello de botella. El estudio sugiere que el futuro de la inteligencia artificial eficiente puede no residir en construir cerebros más grandes y pesados, sino en enseñar a los más pequeños cómo pensar más profundamente revisitando sus propios pensamientos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →