← Últimos artículos
🔬 condensed matter

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

Este artículo demuestra que los modelos Transformer pueden aprender y predecir secuencias de Generadores Congruenciales Permutados (PCG) complejos mediante el aprendizaje por currículo y el descubrimiento de representaciones de rotación invariantes a nivel de bits, revelando una ley de escala donde la longitud del contexto requerida crece como la raíz cuadrada del módulo.

Autores originales: Tao Tao, Maissam Barkeshli

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tao Tao, Maissam Barkeshli

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a predecir el siguiente número en un truco de magia. Le muestras una secuencia como 3, 7, 15, 31, y tiene que adivinar qué viene después. En el mundo real, las computadoras usan recetas especiales llamadas Generadores de Números Pseudoaleatorios (PRNG, por sus siglas en inglés) para crear números que parecen completamente aleatorios para nosotros, como el barajado de una baraja de cartas o la estática en un televisor antiguo. Pero para la computadora, estos números no son aleatorios en absoluto; siguen una regla matemática estricta y oculta. Si conoces la regla y el número inicial, puedes predecir todo el futuro de la secuencia perfectamente.

Durante mucho tiempo, los científicos se han preguntado: ¿Puede la IA moderna, específicamente un tipo de modelo llamado "Transformer" (el mismo tipo de cerebro detrás de muchos chatbots y generadores de imágenes), descifrar estas reglas ocultas solo mirando ejemplos? Es como preguntar si un estudiante puede aprender el código secreto de una cerradura simplemente observando a alguien abrirla unas cuantas veces, sin que nunca se le diga cómo funciona la cerradura. Esto es algo muy importante porque estos generadores de números son la columna vertebral de la seguridad informática. Si la IA puede romperlos con demasiada facilidad, podría significar que nuestros cerrojos digitales no son tan seguros como pensamos. Pero si la IA no puede romperlos, nos dice algo profundo sobre cómo estos modelos aprenden patrones y dónde están sus límites.

La historia del artículo: Descifrando el código con un giro inesperado

En este artículo, los autores plantean un desafío para los Transformers utilizando una familia específica y difícil de generadores de números llamados Generadores Congruenciales Permutados (PCG). Piensa en un generador de números estándar como una máquina simple que suma y multiplica números para obtener el siguiente. Un PCG es esa misma máquina, pero con un giro: antes de mostrarte el resultado, desordena los bits (los diminutos 0s y 1s que componen el número) usando una serie de desplazamientos, giros y rotaciones. Es como tomar un mensaje secreto, escribirlo y luego desordenar las letras para que parezca un galimatías, aunque el mensaje original fuera perfectamente lógico.

Los investigadores descubrieron que los Transformers son sorprendentemente buenos en esto. Incluso cuando la computadora solo ve una pequeña y desordenada parte de la salida —a veces solo un bit, como un simple "sí" o "no"— el modelo aún puede predecir el siguiente número con alta precisión. Es como si el robot estuviera mirando un solo píxel de una imagen desordenada y, de alguna manera, supiera exactamente cómo es la imagen completa. Los modelos aprendieron a hacer esto sin que se les dijeran las reglas; simplemente descubrieron el patrón a partir de los ejemplos proporcionados.

Sin embargo, hay un inconveniente. Cuanto más difícil es el rompecabezas, más ayuda necesita el robot. Los autores descubrieron una "ley de escala": a medida que los números se vuelven más grandes (específicamente, a medida que el módulo, o el tamaño del conjunto de números, crece), el modelo necesita ver más ejemplos seguidos para resolver el rompecabezas. Si los números son pequeños, el modelo necesita ver unos 128 ejemplos. Si los números son enormes (como 2222^{22}), el modelo necesita ver aproximadamente m\sqrt{m} ejemplos, lo que significa que la longitud del contexto tiene que crecer significativamente. Es como intentar resolver un rompecabezas de piezas: si las piezas son diminutas, necesitas tener muchas en la mano para ver la imagen.

El descubrimiento más emocionante fue sobre cómo aprende el modelo. Cuando los investigadores intentaron entrenar al modelo directamente con los rompecabezas más grandes y difíciles, este se quedó estancado. El modelo se quedaba mirando los datos durante mucho tiempo, sin progresar casi nada, como un estudiante que mira un problema matemático que no entiende. Pero cuando utilizaron un "currículo" —una estrategia de enseñanza donde comenzaron el modelo con rompecabezas pequeños y fáciles e introdujeron gradualmente otros más difíciles— el modelo de repente lo logró. Fue como si el modelo necesitara aprender a caminar antes de poder correr. Al empezar con lo pequeño, el modelo aprendió la "gramática" básica de la generación de números, y luego pudo aplicar ese conocimiento a los rompecabezas gigantes y complejos.

Los autores también echaron un vistazo dentro del "cerebro" del modelo (sus representaciones de datos internas) y encontraron algo fascinante. El modelo no solo memorizó los números; los organizó basándose en su estructura binaria. Agrupó números que tenían patrones similares de ceros y unos, incluso si esos números parecían totalmente diferentes en la superficie. Parece que el modelo descubrió que las reglas de "desorden" utilizadas por los generadores tratan ciertos patrones de bits como si fueran el mismo, y aprendió a respetar esas reglas. Esto sugiere que el modelo no solo está adivinando; está construyendo un mapa mental de las simetrías matemáticas ocultas.

En resumen, el artículo muestra que los Transformers pueden aprender a predecir secuencias de números complejas y desordenadas, incluso cuando la información está muy recortada. Pero necesitan el camino de entrenamiento adecuado: empezar con lo pequeño y construir hacia arriba. Aunque pueden superar a algunos métodos de hackeo de la vieja escuela, todavía chocan contra un muro cuando los números se vuelven demasiado grandes sin ese currículo de ayuda. Esto nos dice que, si bien la IA está mejorando en la detección de patrones ocultos, todavía depende de una forma estructurada de aprendizaje, de forma muy similar a un estudiante humano, para abordar los misterios matemáticos más difíciles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →