← Últimos artículos
🤖 machine learning

How Transparent is DiffusionGemma?

Este artículo demuestra que, si bien el espacio latente continuo de DiffusionGemma parece dificultar inicialmente la transparencia, el mapeo de sus pasos de eliminación de ruido a través de un cuello de botella de tokens interpretable mejora significativamente la transparencia de las variables y revela fenómenos de razonamiento únicos, mostrando finalmente que el modelo sigue siendo tan monitorizable como su contraparte autorregresiva.

Autores originales: Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveir
Publicado 2026-06-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran pregunta: ¿Podemos ver dentro de la máquina?

Imagina que tienes dos tipos diferentes de chefs intentando escribir una historia.

  1. Chef A (El modelo autorregresivo, como Gemma 4): Este chef escribe una palabra a la vez, de izquierda a derecha. Escribe "El", luego "gato", luego "se". Puedes ver cómo escribe cada palabra en tiempo real. Es fácil ver exactamente cómo está pensando porque su "proceso de pensamiento" es, literalmente, las palabras que está tecleando.
  2. Chef B (DiffusionGemma): Este chef comienza con un lienzo gigante lleno de garabatos aleatorios (como la estática de un televisor viejo). No escribe palabra por palabra. En su lugar, mira toda la imagen desordenada y la va "limpiando" poco a poco, una y otra vez. En la primera ronda, los garabatos pueden parecer un sinsentido. En la segunda ronda, se parecen un poco más a palabras. Para la ronda 48, es una historia perfecta.

El problema: Con el Chef B, los "pasos intermedios" (los garabatos entre rondas) no son solo palabras; son manchas matemáticas que los humanos no pueden leer. El artículo se pregunta: ¿Está el Chef B escondiendo su pensamiento en esas manchas, haciendo que sea imposible saber qué está haciendo?

La investigación: Tres formas de comprobar la transparencia

Los investigadores dividieron la "transparencia" (qué tan fácil es entender el modelo) en tres pruebas principales.

1. La prueba de los "Pasos Ocultos" (Profundidad Serial Opaca)

Imagina una carrera de relevos.

  • Chef A pasa el testigo (el pensamiento) al siguiente corredor inmediatamente. La distancia entre los corredores es corta.
  • Chef B parece pasar el testigo a través de un túnel largo y oscuro 48 veces antes de que el siguiente corredor lo vea. Si ese túnel es oscuro (ininterpretable), la carrera es 28.6 veces más difícil de seguir que la carrera del Chef A.

El descubrimiento: Los investigadores encontraron una forma de alumbrar con una linterna dentro de ese túnel. Se dieron cuenta de que, aunque las "manchas" parecen matemáticas, en realidad contienen mayormente conjeturas sobre cuáles serán las palabras finales. Si tratamos esas conjeturas como palabras legibles, el "túnel oscuro" se reduce drásticamente. De repente, la carrera del Chef B es solo 1.1 veces más difícil de seguir que la del Chef A. Es casi tan transparente como el modelo estándar.

2. La prueba del "Juego de Adivinanzas" (Transparencia Variable)

Los investigadores preguntaron: "¿Son esas manchas realmente solo conjeturas?".
Observaron los "garabatos" entre las rondas de limpieza del Chef B. Descubrieron que el 85% al 90% de las veces, el modelo solo estaba sosteniendo un cartel que decía: "Creo que la siguiente palabra es 'gato', o tal vez 'perro'".

  • La buena noticia: Estos carteles son mayormente conjeturas sobre la respuesta final. No son códigos secretos.
  • La mala noticia: A veces, el modelo sostiene un cartel con un montón de palabras aleatorias solo para rellenar espacio. Pero la mayor parte del tiempo, el "pensamiento" es visible si se mira de cerca las conjeturas principales.

3. La prueba del "Monitor de Seguridad" (Monitorabilidad)

Imagina a un inspector de seguridad tratando de atrapar a un chef si intenta escribir algo peligroso.

  • Los investigadores probaron si un inspector podía detectar un mal comportamiento en la historia del Chef B con solo leer la historia final.
  • El resultado: El inspector fue igual de bueno detectando al Chef B que al Chef A. Aunque el Chef B piensa de forma diferente, la historia final revela las mismas pistas sobre si el modelo está siendo "travieso" o "seguro".

Lo extraño: Cómo piensa el Chef B de forma diferente

Aunque el Chef B es transparente, piensa de formas en las que el Chef A nunca podría. El artículo encontró algunos comportamientos curiosos y extraños:

  • Pensar hacia atrás (Razonamiento no cronológico): El Chef A debe escribir el principio antes que el final. El Chef B puede escribir el final primero, y luego volver atrás para arreglar el principio.
    • Ejemplo: El Chef B podría adivinar que la respuesta a un problema matemático es "9", escribirla, luego hacer las cuentas en la siguiente ronda, darse cuenta de que es errónea, y cambiar el "9" por un "8" sin tener que reescribir toda la página.
  • El efecto "Borroso" (Dispersión de Tokens): A veces el Chef B sabe qué quiere decir, pero no dónde ponerlo.
    • Ejemplo: Podría poner la palabra "paréntesis" en tres lugares diferentes al mismo tiempo, como una foto borrosa, y luego enfocarla en un solo lugar en la ronda final.
  • Mantener dos mundos a la vez (Dispersión de Secuencias): El Chef B puede imaginar dos historias diferentes sucediendo al mismo tiempo.
    • Ejemplo: Puede estar un 50% seguro de que la respuesta es "12" y un 50% seguro de que es "9", manteniendo ambas versiones de la frase vivas en su mente hasta el último segundo, cuando elige una.
  • Marcadores de posición secretos (Contexto Intermedio): A veces el Chef B usa una palabra temporal para ayudarle a pensar, pero luego la elimina antes de mostrarte la respuesta final.
    • Ejemplo: Para resolver un problema matemático, podría escribir el número "3" para ayudar con un cálculo, y luego cambiarlo por la palabra "Oro" en la salida final. El "3" fue necesario para el pensamiento, pero nunca aparece en la historia final.

La Conclusión

El artículo concluye que DiffusionGemma es sorprendentemente transparente.

Aunque utiliza una forma de pensar diferente y más compleja (limpiar un lienzo en lugar de escribir palabra por palabra), aún podemos ver lo que está haciendo.

  1. Sus "pasos ocultos" son mayormente conjeturas sobre las palabras finales.
  2. Los monitores de seguridad pueden atraparlo tan bien como a los modelos estándar.
  3. Realiza un pensamiento genial y no lineal (arreglar el pasado, mantener dos opciones a la vez), pero aún podemos observar cómo sucede.

La advertencia: Los autores dicen que esto podría ser cierto solo para este modelo específico. Si los modelos futuros se entrenan de forma distinta, esas "manchas" podrían convertirse en códigos secretos que no podamos leer. Pero por ahora, DiffusionGemma es seguro de observar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →