← Últimos artículos
💬 NLP

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

Este artículo propone un marco conceptual unificado para los modelos de difusión discretos que se centra en la construcción del espacio de estados discretos, unificando así las formulaciones existentes, aclarando las compensaciones de diseño y guiando futuras direcciones de investigación.

Autores originales: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yanka
Publicado 2026-08-26
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Dawn Song, Philip S. Yu, Xue Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar escribir una historia colocando una palabra tras otra, sin permitirte nunca mirar atrás o cambiar lo que ya has escrito. Así es como funcionan la mayoría de los programas informáticos modernos que generan texto actualmente. Construyen oraciones de izquierda a derecha, comprometiéndose con cada palabra en el momento en que aparece. Si bien este método es rápido y fiable, tiene un fallo fundamental: si el escritor comete un error al principio, o si la historia necesita un giro que requiere cambiar el comienzo, el sistema no puede corregirlo sin empezar de cero. Es una calle de sentido único sin carriles de retorno.

Durante mucho tiempo, los científicos han estado buscando una forma diferente de generar datos, una que permita la planificación global y la capacidad de revisar decisiones a medida que el panorama completo va tomando forma. En el mundo de las imágenes y el sonido, una técnica llamada difusión ya ha resuelto este problema. Funciona comenzando con un caos completamente desordenado y limpiándolo gradualmente, paso a paso, hasta que emerge una imagen o un sonido claros. Debido a que el proceso observa la imagen completa en cada etapa, puede corregir errores y ajustar la composición sobre la marcha. Sin embargo, aplicar este mismo método de "limpieza" al texto, al código y otros datos discretos —donde los bloques de construcción son símbolos distintos como letras o palabras en lugar de tonos suaves de color— ha resultado ser increíblemente difícil. Las reglas que funcionan para las imágenes no se traducen directamente a las palabras, y los intentos previos de forzarlas a funcionar a menudo resultaron en galimatías o de baja calidad.

Un nuevo estudio exhaustivo realizado por un gran equipo de investigadores de instituciones que incluyen la Universidad McGill, la Universidad Mohamed bin Zayed de Inteligencia Artificial y otras, ofrece una forma unificada de comprender y mejorar estos modelos de difusión discretos. Los investigadores sostienen que la clave para que estos modelos funcionen bien no reside solo en el algoritmo de limpieza en sí, sino en cómo se descomponen primero los datos brutos en esos bloques de construcción básicos, o tokens. Proponen que la forma en que decidimos fragmentar una oración, una cadena de proteínas o una estructura molecular es la decisión de diseño más crítica, la cual moldea todo lo que sucede después. Al tratar esta descomposición inicial como una parte central del diseño en lugar de un simple paso de configuración, el equipo ha creado un marco único que explica cómo funcionan estos modelos en muchos campos diferentes, desde la escritura de código hasta el diseño de nuevos fármacos.

El núcleo de este nuevo marco es una idea simple pero poderosa: la forma en que se tokenizan los datos determina la naturaleza del "ruido" que los corrompe y la dificultad de la tarea que la computadora debe resolver para arreglarlos. En el mundo familiar del texto, las palabras a menudo se descomponen en piezas más pequeñas basadas en la frecuencia con la que aparecen. Pero para la difusión discreta, los investigadores descubrieron que el tamaño y la estructura de estas piezas importan inmensamente. Si las piezas son demasiado pequeñas, la computadora tiene que resolver un rompecabezas masivo con demasiadas partes diminutas. Si son demasiado grandes, el modelo tiene dificultades para predecir la combinación correcta. El estudio traza cómo diferentes tipos de datos requieren diferentes enfoques. Por ejemplo, en el lenguaje, el mejor enfoque a menudo implica ocultar palabras y pedirle al modelo que rellene los espacios en blanco, un método que aprovecha las fortalezas de las arquitecturas computacionales modernas. En contraste, para los datos científicos como las proteínas o el ADN, la estructura natural de las moléculas mismas proporciona una guía. Los investigadores demuestran que utilizar las relaciones conocidas entre aminoácidos o enlaces químicos para guiar el proceso de "limpieza" conduce a resultados mucho mejores que tratar todos los errores como iguales.

El artículo reúne una vasta gama de métodos existentes que anteriormente parecían desconectados. Muestra que ya sea que un modelo utilice una matriz de transición para describir cómo cambian los tokens, una estrategia de enmascaramiento para ocultar partes de los datos, o un enfoque basado en puntuación para medir la probabilidad, todos son variaciones de la misma estructura subyacente. Los investigadores descomponen cada modelo de difusión discreta en cuatro partes esenciales: el método utilizado para corromper los datos, la red neuronal que aprende a corregirlos, el objetivo matemático utilizado para entrenar esa red y el algoritmo utilizado para generar el resultado final. Al verlos a través de este lente común, el equipo revela que muchas de las diferencias entre los modelos exitosos y los fallidos se deben a cómo estas cuatro partes se ajustan al tipo específico de datos que se está utilizando.

Uno de los hallazgos más significativos es que estos modelos sobresalen en tareas que requieren observar el panorama completo. A diferencia de los escritores de izquierda a derecha que no pueden cambiar de opinión, estos modelos pueden refinar su producción de forma iterativa. Pueden comenzar con un borrador tosco, identificar puntos débiles y mejorarlos en pasadas subsecuentes. Esto los hace particularmente poderosos para tareas como completar secciones faltantes de un documento, editar texto preservando el contexto circundante, o generar estructuras complejas como moléculas químicas donde cada parte debe encajar perfectamente. El estudio destaca que, para estas tareas específicas, la capacidad de revisar y planificar globalmente es una ventaja distintiva que los modelos estándar actuales no pueden replicar fácilmente.

Sin embargo, los investigadores advierten cuidadosamente que esto no significa que los viejos métodos de izquierda a derecha hayan quedado obsoletos. Los nuevos modelos suelen ser más lentos porque tienen que procesar la secuencia completa varias veces, mientras que los métodos antiguos pueden generar texto palabra por palabra muy rápidamente. El estudio sugiere que el futuro probablemente radicará en sistemas híbridos, donde la velocidad de los métodos antiguos se combine con las capacidades de planificación y revisión de los nuevos. Por ejemplo, un sistema podría usar un modelo rápido para redactar un plan y luego usar un modelo de difusión para refinar los detalles y asegurar que todo sea consistente.

El artículo también aborda los desafíos prácticos de hacer que estos modelos funcionen a gran escala. Analiza cómo entrenarlos de manera eficiente, cómo acelerar el proceso de generación sin perder calidad y cómo evaluar si los resultados son realmente buenos. Los investigadores señalan que las formas estándar de medir el éxito, que fueron diseñadas para los modelos más antiguos, a menudo no logran capturar las fortalezas y debilidades únicas de estos nuevos sistemas. Proponen nuevas formas de medir el rendimiento que tengan en cuenta la naturaleza iterativa del proceso, como rastrear cuánto mejora el modelo con cada paso de refinamiento.

En última instancia, este trabajo proporciona una hoja de ruta para la próxima generación de inteligencia artificial. Al aclarar que la forma en que se representan los datos es tan importante como el algoritmo utilizado para generarlos, los investigadores han abierto nuevas vías de mejora. Demuestran que, al diseñar cuidadosamente el proceso de tokenización para que coincida con las necesidades específicas del dominio —ya sea la gramática de un lenguaje, la sintaxis de un código o la química de una molécula—, estos modelos pueden hacerse mucho más efectivos. El estudio no pretende haber resuelto todos los problemas; reconoce que aún existen preguntas abiertas sobre cómo estos modelos escalan y cómo pueden aprender del contexto tan bien como los métodos antiguos. Pero al proporcionar un marco unificado, ofrece a la comunidad científica un lenguaje claro y una estructura compartida sobre la cual construir, moviendo el campo de una colección de experimentos aislados hacia un enfoque coherente y poderoso de la inteligencia artificial generativa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →