← Últimos artículos
🤖 AI

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

Este artículo demuestra que los Modelos de Lenguaje de Difusión, a pesar de carecer de un condicionamiento explícito por paso de tiempo, codifican internamente una representación latente decodificable del progreso de la eliminación de ruido dentro de sus flujos residuales, la cual puede ser manipulada para controlar sistemáticamente la confianza y la entropía del modelo. En este contexto, la variable de activación hh utiliza índices donde nn representa el paso de tiempo de la difusión y tt denota la posición temporal dentro de la secuencia de entrada; sin embargo, la divergencia KL no escala linealmente con la distancia de t^t\hat{t}-t.

Autores originales: Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza University of Rome), Federico Alvetreti (Sapienza University of Rome), Giorgio Str
Publicado 2026-07-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza University of Rome), Federico Alvetreti (Sapienza University of Rome), Giorgio Strano (Sapienza University of Rome), Donato Crisostomi (Sapienza University of Rome), Giorgos Nikolaou (EPFL), Tommaso Mencattini (EPFL), Andrea Santilli (Independent researcher), Emanuele Rodolà (Sapienza University of Rome), Simone Scardapane (Sapienza University of Rome), Alessio Devoto (Independent researcher)

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo de Lenguaje de Difusión (DLM) como un maestro escultor trabajando en una habitación oscura. A diferencia de un escritor tradicional que construye una historia palabra por palabra de izquierda a derecha, este escultor comienza con un bloque de piedra completamente cubierto de arcilla (representado por tokens [MASK]). Su trabajo es ir quitando la arcilla, revelando las palabras ocultas debajo, capa por capa, hasta que la estatua final sea revelada.

El gran misterio que este artículo resuelve es: ¿Sabe el escultor cuánta arcilla queda?

En los modelos de escritura tradicionales, la computadora sabe exactamente cuántas palabras ha escrito. Pero en estos modelos de "escultura", el artículo pregunta si el modelo tiene un "reloj" interno o un sentido del progreso, a pesar de que no se le enseñó explícitamente a contar.

Aquí está lo que los investigadores descubrieron, explicado de forma sencilla:

1. El "Reloj Subliminal"

Los investigadores descubrieron que, aunque no se le dice al modelo "estás al 50%", este lleva la cuenta de su propio progreso en secreto. Es como un escultor que no tiene un reloj pero puede sentir el peso de la piedra en sus manos e instintivamente saber: "Estoy a la mitad".

Encontraron una señal oculta dentro del cerebro del modelo (específicamente en sus "flujos residuales", que son como las vías de pensamiento internas del modelo). Esta señal actúa como un reloj latente. Le dice al modelo exactamente cuánta "arcilla" (los tokens enmascarados) se ha quitado y cuánta queda.

Para entender cómo funciona esto técnicamente, los investigadores analizaron las activaciones internas del modelo, denotadas como hh. Es crucial aclarar qué significan los índices de esta variable para evitar confusiones:

  • nn representa la posición específica de una palabra (token) dentro de la secuencia de texto que el modelo está procesando.
  • tt representa el paso de tiempo o la etapa actual del proceso de difusión (es decir, cuánta "arcilla" o ruido ha sido eliminada hasta ese momento).

Al observar cómo cambia hh a medida que varía tt, los investigadores pudieron rastrear el progreso temporal del modelo independientemente de la posición de la palabra nn.

2. Leer la mente (Sondeo)

Para demostrar que este reloj existe, los investigadores construyeron un "decodificador" simple (una sonda). Observaron los pensamientos internos del modelo en diferentes etapas del proceso.

  • El Resultado: El decodificador podía leer con precisión el reloj interno del modelo. Podía decir, simplemente mirando la activación del modelo, si este se encontraba al puro principio (mucha arcilla), en el medio, o al puro final (casi nada de arcilla queda).
  • La Analogía: Es como ser capaz de mirar la postura de una persona y saber instantáneamente si acaba de empezar un maratón o si está a punto de cruzar la línea de meta, incluso si no ha dicho una sola palabra.

3. Hackear el reloj (Direccionamiento)

La parte más emocionante es que los investigadores no solo leyeron el reloj; ellos lo recablearon. Encontraron una dirección específica en el cerebro del modelo que corresponde al "tiempo" o al "progreso".

  • El Experimento: Empujaron artificialmente el reloj interno del modelo hacia adelante o hacia atrás.
    • Empujar hacia adelante: Le dijeron al modelo: "¡Ya casi terminas!" (aunque no fuera así). El modelo inmediatamente se volvió más seguro, habló con menos vacilación (menor entropía) y actuó como si estuviera listo para terminar.
    • Empujar hacia atrás: Le dijeron al modelo: "¡Apenas estás empezando!" (aunque estuviera cerca del final). El modelo se volvió confundido, menos seguro y empezó a dudar de sus propias elecciones.
  • La Conclusión: Esto demuestra que el reloj no es solo una observación pasiva; es un mecanismo de control. Si cambias el sentido del tiempo del modelo, cambias cómo se comporta. Cabe destacar que la divergencia KL (una medida de la diferencia entre distribuciones) no escala linealmente con la distancia entre el tiempo manipulado (t^\hat{t}) y el tiempo real (tt), lo que indica una relación más compleja en cómo el modelo procesa estas discrepancias temporales.

4. La forma del tiempo

Los investigadores también observaron la geometría de este "reloj". Descubrieron que el modelo no representa el tiempo como una nube desordenada y caótica. En cambio, organiza el tiempo en una curva muy limpia y suave (como una parábola).

  • La Analogía: Imagina la comprensión del tiempo del modelo como la vía de una montaña rusa. A medida que el proceso de eliminación de ruido avanza, el estado interno del modelo se desliza suavemente a lo largo de esta vía. Los investigadores descubrieron que casi toda la información sobre "qué tan avanzado estamos" cabe en esta única vía de baja dimensión.

5. El mecanismo de autocorrección

Uno de los hallazgos más geniales es que el modelo es lo suficientemente inteligente como para corregir errores.

  • Si los investigadores manipularon el reloj en las capas iniciales del modelo (el "principio" del proceso de pensamiento), el modelo a menudo se "corregía" a sí mismo a medida que la información pasaba por las capas más profundas. Se daba cuenta de: "Espera, me dijeron que estoy en la línea de meta, pero en realidad todavía estoy en la mitad", y ajustaba su estado interno de vuelta a la verdad.
  • Sin embargo, si manipularon el reloj en las capas finales, el modelo no podía corregirlo y el comportamiento cambiaba permanentemente.

Resumen

Este artículo revela que los Modelos de Lenguaje de Difusión tienen un sentido interno oculto de "cuánto trabajo queda por hacer".

  1. Tienen un reloj: Codifican su progreso en sus estados mentales internos.
  2. Podemos leerlo: Podemos medir este progreso con precisión.
  3. Podemos controlarlo: Al ajustar este reloj interno, podemos hacer que el modelo sea más o menos seguro de sí mismo.
  4. Está estructurado: Este "tiempo" se organiza en una forma geométrica limpia y predecible dentro del cerebro del modelo.

Esencialmente, el modelo es como una persona que camina a través de un túnel y sabe exactamente qué tan lejos está de la luz, incluso si nadie le ha dicho la distancia. Los investigadores encontraron la parte del cerebro que contiene ese conocimiento y demostraron que podían girar la perilla para cambiar cómo la persona se siente respecto al viaje.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →