← Últimos artículos
💬 NLP

Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models

Este artículo proporciona un análisis mecanístico de los modelos de lenguaje de difusión con enmascaramiento (DLMs), revelando que implementan un circuito de inducción bidireccional simétrico en dirección para el aprendizaje en contexto y computan implícitamente las fracciones de enmascaramiento global como pasos de tiempo, aunque solo superan a los modelos autorregresivos cuando aprovechan el contexto bidireccional completo.

Autores originales: Andy Catruna, Emilian Radoi

Publicado 2026-07-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andy Catruna, Emilian Radoi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo terminar una frase. Durante años, la mejor manera de hacer esto era hacer que el robot leyera una historia de izquierda a derecha, palabra por palabra, adivinando la siguiente basándose solo en lo que ya había visto. Así es como funcionan la mayoría de los escritores de IA modernos; son como una persona leyendo un libro que solo puede ver las páginas que ya ha pasado. Pero recientemente, los científicos han empezado a construir un tipo diferente de robot. En lugar de leer de izquierda a derecha, este nuevo robot ve una página entera de texto donde algunas palabras están ocultas tras cajas negras. Observa las palabras visibles tanto a la izquierda como a la derecha, adivina qué hay dentro de la caja, la rellena y luego repite el proceso hasta que toda la página esté despejada. Esto se llama un modelo de "difusión".

La gran pregunta para los científicos es: ¿Cómo aprende este nuevo robot? Cuando le muestras a un robot un patrón, como "El gato se sentó en la [BLANK]. El gato se sentó en el [BLANK]", y este deduce que el espacio en blanco debería ser "mat" (alfombra), llamamos a eso "inducción". Es la forma en que el robot dice: "Ya he visto esto antes, así que sé lo que viene después". Sabemos exactamente cómo los viejos robots de izquierda a derecha hacen este truco, pero no tenemos idea de cómo lo logran estos nuevos robots de "mirar todo". ¿Usan los mismos circuitos cerebrales? ¿Tienen un superpoder secreto porque pueden ver ambos lados de la palabra faltante? Comprender esto es crucial porque, si queremos construir una IA mejor, necesitamos saber cómo piensan realmente estas diferentes máquinas, no solo lo que dicen.


En este artículo, los investigadores decidieron jugar a ser detectives con dos robots muy similares para ver cómo resuelven el mismo rompecabezas. Construyeron un robot estándar de "izquierda a derecha" y un nuevo robot de "mirar todo", asegurándose de que fueran gemelos en todos los sentidos excepto en su forma de leer. Les dieron un juego sencillo: encontrar un patrón repetido en una larga cadena de letras aleatorias y copiar la letra faltante del lugar correspondiente.

El equipo descubrió que el nuevo robot no solo copia los trucos del viejo; aprende un nuevo superpoder de dos vías. Mientras que el viejo robot solo puede mirar hacia atrás para encontrar su respuesta, el nuevo robot construye un "circuito de inducción" especial que funciona en ambas direcciones. Es como si el robot tuviera dos pequeños ayudantes: uno que susurra lo que estaba justo a la izquierda de la palabra faltante, y otro que susurra lo que estaba justo a la derecha. Estos ayudantes escriben estas pistas en la memoria del robot. Luego, una tercera parte "detective" del robot utiliza esas pistas para escanear todo el texto —tanto el pasado como el futuro— para encontrar el patrón correspondiente y copiar la respuesta.

Aquí está el giro: el nuevo robot es mejor que el viejo solo cuando se le permite echar un vistazo a ambos lados de la palabra faltante. Si bloqueas su visión del futuro y lo obligas a mirar solo al pasado (tal como hacía el viejo robot), se comporta exactamente igual. Esto demuestra que el nuevo robot no es simplemente una versión "más inteligente" del anterior; su ventaja proviene enteramente de su capacidad para ver ambos lados del hueco al mismo tiempo.

Los investigadores también descubrieron algo sorprendente sobre cómo el robot sabe cuándo adivinar. Normalmente, a estos robots se les dice exactamente en qué paso del juego de adivinación se encuentran (como "Paso 1 de 100"). Pero a estos robots no se les dio esa información. En su lugar, el artículo muestra que el robot cuenta secretamente cuántas cajas negras quedan todavía en la página. Utiliza este conteo como un temporizador oculto. Si quedan muchas cajas, actúa de una manera; si quedan pocas, actúa de otra. Los científicos demostraron esto "pinchando" el cerebro del robot y mostrando que cambiar este "conteo de cajas" cambia directamente la confianza del robot en sus suposiciones.

En resumen, el artículo revela que estos nuevos robots de difusión no solo piensan de manera diferente; piensan en una calle de doble sentido y simétrica. Recopilan pistas de ambos lados, las cotejan e incluso mantienen un recuento mental secreto de cuánto trabajo queda por hacer, todo ello sin que se les diga explícitamente cómo hacerlo. Esto nos brinda un mapa más claro de cómo estas poderosas nuevas herramientas están aprendiendo a comprender el mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →