← Últimos artículos
💬 NLP

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

Este artículo demuestra que los LLM de frontera realizan un razonamiento estructurado y legible de múltiples pasos sobre tokens de relleno sin contenido dentro de sus estados ocultos, revelando que la computación oculta sigue siendo monitorizable mediante la decodificación no supervisada del flujo residual incluso cuando los tokens superficiales no proporcionan una cadena de pensamiento visible.

Autores originales: Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

Publicado 2026-07-07
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a un mago realizar un truco. Normalmente, para entender cómo lo hizo, observas sus manos y escuchas lo que dice. En el mundo de la Inteligencia Artificial (IA), esto es como observar la "Cadena de Pensamiento" (CoT, por sus siglas en inglés)—la explicación paso a paso que la IA escribe antes de dar una respuesta.

Durante mucho tiempo, los expertos en seguridad se preocuparon de que, si una IA dejaba de escribir sus pasos y simplemente daba una respuesta final, no tendríamos forma de saber si estaba pensando correctamente o si solo estaba adivinando. Este artículo, titulado "Reading Between the Dots" (Leyendo entre los puntos), investiga un escenario específico y extraño donde se le da a la IA una serie de tokens de "relleno" sin sentido (como una cadena de puntos ...... o números de conteo 1 2 3 4 5) entre la pregunta y la respuesta.

Aquí están los hallazgos de los investigadores, desglosados en conceptos simples:

1. El truco de magia: La IA utiliza el "espacio vacío"

Los investigadores hicieron preguntas de matemáticas y lógica difíciles a dos modelos de IA muy inteligentes (DeepSeek V3 y Kimi K2).

  • Sin los puntos: La IA a menudo obtenía la respuesta incorrecta.
  • Con los puntos: La IA obtenía la respuesta correcta con mucha más frecuencia.

Resulta que la IA no está simplemente ignorando los puntos. Está utilizando ese "espacio vacío" como un bloc de notas (scratchpad). Aunque los puntos no nos parecen nada a nosotros, la IA está realizando secretamente sus cálculos y razonamientos dentro del espacio digital donde residen esos puntos. Es como un chef que deja de hablar al cliente y comienza a susurrarse la receta a sí mismo mientras pica las verduras; el cliente no escucha nada, pero la cocina está ocurriendo.

2. La "Visión de Rayos X": Ver los pensamientos ocultos

La gran pregunta era: Si la IA no está escribiendo los pasos, ¿podemos seguir viendo lo que está pensando?

Los autores dicen que . Desarrollaron una herramienta especial de "visión de rayos X" (llamada Logit Lens) que observa las señales eléctricas internas de la IA (su "flujo residual") en lugar de simplemente leer las palabras que escribe.

  • La analogía: Imagina que el cerebro de la IA es una autopista concurrida. Las palabras que escribe son solo los coches que circulan por la superficie. Pero debajo de la carretera, hay túneles y tuberías que transportan el agua y la electricidad real que hacen que los coches se muevan.
  • Lo que encontraron: Al observar estos "túneles" bajo los puntos, pudieron ver a la IA recuperando hechos (como "Mozart murió a los 35") y haciendo matemáticas (como "35 + 93 = 128") antes de siquiera escribir la respuesta final. Los puntos no estaban vacíos; estaban llenos de los cálculos internos de la IA.

3. El experimento del "Trasplante de Cerebro"

Para demostrar que los puntos eran realmente lo que causaba que la IA pensara correctamente (y no solo una coincidencia), realizaron un experimento de "trasplante de cerebro".

  • Tomaron los "pensamientos" internos (los datos ocultos) de una ejecución exitosa de la IA y los intercambiaron con una ejecución diferente de la IA que estaba a punto de fallar.
  • El resultado: La IA que fallaba comenzó repentinamente a dar la respuesta correcta, como si hubiera "contagiado" los pensamientos correctos de la otra. Esto demostró que la información en los puntos era real, útil y esencial para la respuesta.

4. El "Anillo Decodificador": Leyendo el código secreto

Los investigadores construyeron un flujo de trabajo sencillo y no supervisado (un conjunto de instrucciones que no necesita ser enseñado) para decodificar estos pensamientos ocultos.

  • Tomaron las señales ocultas de los puntos, limpiaron el ruido y alimentaron a los mejores candidatos a una segunda IA muy inteligente (un "Juez").
  • La tasa de éxito: Este decodificador podía adivinar correctamente en qué estaba pensando la IA entre el 80% y el 95% de las veces.
  • Lo que encontró: Podía recuperar números específicos, nombres de ciudades o elementos, incluso aunque la IA nunca los escribió. Si la IA se equivocaba, el decodificador incluso podía decir por qué (por ejemplo, "Encontró los datos correctos pero olvidó sumarlos").

La gran conclusión

El artículo sostiene que el hecho de que una IA no diga su razonamiento en voz alta (o en una cadena de pensamiento visible), no significa que el razonamiento esté oculto para nosotros para siempre.

  • El problema: Si solo miramos las palabras que la IA escribe, podríamos perdernos su verdadero proceso de razonamiento, especialmente cuando utiliza tokens de "relleno".
  • La solución: Tenemos herramientas para mirar "bajo el capó" de sus señales internas. Incluso cuando la IA intenta ocultar su trabajo en espacios "vacíos", aún podemos leer el "flujo residual" (la actividad eléctrica interna) para ver qué está haciendo realmente.

En resumen: La IA es como un estudiante que toma un examen escribiendo la respuesta en un papel, pero hace todas las matemáticas en su cabeza. Este artículo muestra que, aunque no podamos ver las matemáticas en el papel, aún podemos usar herramientas especiales para leer la mente del estudiante y ver exactamente cómo resolvió el problema. Esto sugiere que la computación "oculta" no es necesariamente "no auditable".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →