← Últimos artículos
💬 NLP

Rethinking the Generation Order of Block Diffusion Language Models

Este artículo presenta la Decodificación Autorregresiva Paralela (PARD), un método de muestreo libre de entrenamiento que aprovecha la alineación inherente de izquierda a derecha de los modelos de lenguaje de difusión por bloques para lograr velocidades de generación más rápidas con una pérdida de calidad mínima en comparación con la decodificación autorregresiva pura.

Autores originales: Kai Syun Hou, James Kwok

Publicado 2026-07-28
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Kai Syun Hou, James Kwok

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo escribir una historia. Durante mucho tiempo, la mejor manera de hacer esto era hacer que el robot escribiera una palabra a la vez, de izquierda a derecha, tal como un humano lee un libro. Este método, llamado generación "autorregresiva", es muy fiable pero puede ser lento, como una sola persona escribiendo una novela en una máquina de escribir. Recientemente, los científicos descubrieron una nueva forma llamada "difusión", que es más como un pintor que comienza con un lienzo en blanco cubierto de estática o ruido y gradualmente lo limpia hasta que aparece una imagen clara. Este nuevo método permite al robot adivinar muchas palabras a la vez, lo que potencialmente le permite escribir mucho más rápido. Sin embargo, hay un inconveniente: aunque este método de "limpieza de ruido" es excelente por su flexibilidad, a veces se confunde con el orden de las palabras, lo que genera un lenguaje sin sentido. La gran pregunta para los investigadores es: ¿cómo obtenemos la velocidad del pintor sin perder el flujo lógico de la máquina de escribir?

Este artículo aborda exactamente ese rompecabezas analizando una versión más reciente de estos modelos de "limpieza de ruido" llamada Modelos de Lenguaje de Difusión por Bloques (BDLM, por sus siglas en inglés). Los autores, Kai Syun Hou y James Kwok, descubrieron algo sorprendente: aunque estos modelos están construidos para ser flexibles y adivinar palabras en cualquier orden, en realidad "piensan" mucho más como la vieja máquina de escribir de izquierda a derecha de lo que cualquiera esperaba. Descubrieron que obligar a estos modelos a ceñirse a un orden estricto de izquierda a derecha, permitiéndoles al mismo tiempo adivinar algunas palabras a la vez, crea un punto ideal perfecto. Llaman a este nuevo método PARD (Decodificación Autorregresiva Paralela). Piensa en esto como un equipo de escritores que acuerdan escribir en orden, pero en lugar de esperar a que una persona termine una frase completa antes de que comience la siguiente, todos intervienen para terminar las siguientes pocas palabras simultáneamente si tienen la confianza suficiente. El resultado es que el robot escribe significativamente más rápido que el viejo método lento, pero la historia mantiene la misma lógica y calidad.

La historia del robot de "limpieza de ruido"

Para entender por qué esto es importante, imaginemos dos formas diferentes en las que un robot podría intentar escribir una oración.

La vieja forma (Autorregresiva): Imagina un robot que escribe una historia letra por letra. Escribe la "T", luego la "h", luego la "e", luego el espacio. No puede escribir la siguiente palabra hasta que haya terminado la actual. Es muy cuidadoso y rara vez comete errores, pero es lento. Es como una sola persona escribiendo una novela; no pueden terminar la última página hasta que hayan terminado la primera.

La nueva forma (Difusión): Ahora imagina un robot que comienza con una oración donde cada palabra ha sido reemplada por un signo de interrogación (o una "máscara"). Su trabajo es mirar toda la oración y adivinar qué palabras faltan. No tiene que adivinarlas en orden. Podría adivinar la última palabra primero, luego la primera, luego la del medio. Esto es como un pintor que mira un lienzo desordenado y borroso e intenta descubrir qué imagen final es. La ventaja es la velocidad: el robot puede corregir muchas partes de la oración al mismo tiempo. La desventaja es que si adivina el final de la oración antes que el principio, podría equivocarse con el contexto y producir algo sin sentido.

Durante un tiempo, los científicos intentaron que el robot de "limpieza de ruido" funcionara dejándolo adivinar palabras en el orden que quisiera, con la esperanza de que encontrara el mejor camino. Pero los autores de este artículo notaron algo extraño. Probaron un nuevo tipo de robot llamado Modelo de Lenguaje de Difusión por Bloques (BDLM). Estos robots son especiales porque están entrenados para trabajar en fragmentos (bloques) de texto, utilizando el texto limpio de los fragmentos anteriores para ayudar a adivinar el siguiente fragmento.

El gran descubrimiento: El robot prefiere el orden

Los autores realizaron una serie de experimentos para ver cómo se comportan realmente estos robots. Compararon un robot de "limpieza de ruido" estándar (LLaDA) con el nuevo robot de "bloques" (SDAR).

Descubrieron que el robot estándar realmente disfruta adivinando palabras en órdenes aleatorios. Pero el nuevo robot de bloques se comporta de manera muy diferente. Aunque puede adivinar palabras en cualquier orden, naturalmente prefiere adivinarlas de izquierda a derecha, tal como el viejo robot de la máquina de escribir.

Para demostrarlo, observaron la "confianza" del robot. Si le pides a un robot que adivine la siguiente palabra, generalmente tiene una "puntuación de confianza" para cada posibilidad. Los autores descubrieron que, para el robot de bloques, las suposiciones más confiables eran casi siempre las palabras al principio de la oración restante. Es como si el robot tuviera un hábito secreto: "Sé que puedo saltar de un lado a otro, pero realmente me siento más cómodo empezando desde la izquierda".

Incluso hicieron algunos cálculos matemáticos para explicar por qué sucede esto. Se dieron cuenta de que, durante el entrenamiento, al robot de bloques se le muestran muchos ejemplos donde el lado izquierdo de la oración ya está escrito y solo tiene que adivinar el lado derecho. Esto es exactamente cómo aprende el viejo robot de la "máquina de escribir". El robot de "limpieza de ruido" estándar, por otro lado, es entrenado con oraciones donde faltan palabras en todas partes, por lo que nunca aprende realmente a depender primero de la izquierda. Debido a que el robot de bloques es entrenado de esta manera, "quiere" ir de izquierda a derecha.

La solución: PARD (El equipo de escritores)

Entonces, si el robot de bloques naturalmente quiere ir de izquierda a derecha, ¿por qué no simplemente hacerlo ir de izquierda a derecha? El problema es que si va estrictamente de izquierda a derecha, pierde la ventaja de velocidad de adivinar múltiples palabras a la vez. Se vuelve lento de nuevo.

Los autores idearon una solución ingeniosa llamada PARD (Decodificación Autorregresiva Paralela).

Imagina a un grupo de escritores trabajando en una historia juntos.

  1. La Regla: Deben escribir en orden, de izquierda a derecha.
  2. El Giro: En lugar de esperar a que una persona termine una palabra antes de que la siguiente comience, todos miran las siguientes pocas palabras. Si están muy seguros de la siguiente palabra, la escriben. Si también están muy seguros de la palabra siguiente, escriben esa también.
  3. La Red de Seguridad: Si no están seguros de la segunda palabra, se detienen. No adivinan la segunda palabra solo por ser rápidos; esperan hasta estar seguros.

Esto es lo que hace PARD. Observa las puntuaciones de confianza del robot. Si el robot está seguro de la primera palabra enmascarada, la escribe. Luego, inmediatamente verifica si el robot también está seguro de la siguiente palabra. Si es así, también la escribe. Continúa siguiendo la línea, escribiendo un "prefijo" de palabras confiables, hasta que llega a una palabra en la que el robot no está seguro.

Los resultados: Rápidos y precisos

Los autores probaron este nuevo método en tres robots de bloques diferentes y seis tareas distintas, incluyendo la escritura de código y la resolución de problemas matemáticos.

  • Velocidad: PARD fue mucho más rápido que el viejo método de la "máquina de escribir". En algunos casos, fue 3.64 veces más rápido en uno de los modelos. Escribía tokens (fragmentos de texto) a una tasa de hasta 152 tokens por segundo, comparado con solo 70 para el método lento.
  • Calidad: A pesar de ser más rápido, las historias y el código que escribió eran tan buenos, o incluso mejores, que otros métodos rápidos que intentaban adivinar palabras en órdenes aleatorios. De hecho, en el modelo SDAR, PARD fue en realidad mejor que los métodos de orden aleatorio, obteniendo un 81.1% en una prueba de programación frente al 75.0% del método aleatorio.
  • La Comparación: Compararon PARD con otros métodos "rápidos" sofisticados que utilizan reglas complejas para decidir qué palabras adivinar. PARD los venció consistentemente a todos. Los métodos complejos eran como intentar resolver un rompecabezas saltando de un lado a otro aleatoriamente; PARD era como resolverlo siguiendo primero las piezas de los bordes, lo que resultó ser el camino más eficiente para estos robots específicos.

Por qué esto es importante

El artículo sugiere que, para estos nuevos robots de "bloques", la vieja idea de "adivinar en cualquier orden" no es realmente la mejor manera de ir. Los robots tienen un sesgo natural hacia el pensamiento de izquierda a derecha debido a la forma en que fueron entrenados. Al respetar ese sesgo y solo añadir velocidad paralela cuando el robot está seguro, obtenemos lo mejor de ambos mundos: la velocidad de un equipo de escritores y la precisión de un mecanógrafo cuidadoso.

Los autores señalan cuidadosamente que este es un método "libre de entrenamiento" (training-free). No tuvieron que reentrenar a los robots ni cambiar sus cerebros; simplemente cambiaron la forma en que les pedían que escribieran. Esto lo convierte en una herramienta muy práctica que se puede usar ahora mismo con modelos existentes.

En resumen, el artículo muestra que, a veces, la forma más rápida de avanzar es recordar que hay que moverse en línea recta, pero dando pasos más grandes cuando estás seguro de hacia dónde vas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →