← Últimos artículos
💻 computer science

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa introduce una nueva familia de modelos de visión y lenguaje construidos sobre mecanismos de difusión discreta que aprovechan la decodificación paralela y el contexto bidireccional para lograr un rendimiento competitivo, una inferencia más rápida y una mayor capacidad de control en comparación con los modelos autorregresivos tradicionales.

Autores originales: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

Publicado 2026-07-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden "ver" y "hablar" al mismo tiempo. Este es el reino de los Modelos de Visión y Lenguaje (VLM, por sus siglas en inglés), los asistentes de IA superinteligentes que pueden mirar una foto de un atardecer y escribir un poema sobre él, o examinar un gráfico complejo y explicar las tendencias. Durante años, la forma estándar en que estos modelos piensan es como un estudiante tomando un examen: responden palabra por palabra, estrictamente de izquierda a derecha. Escriben "El", luego "cielo", luego "es", sin volver atrás para cambiar una palabra previa. Aunque esto funciona bien, es lento porque no pueden escribir en paralelo, y es rígido; si cometen un error en la primera palabra de una oración, no pueden volver fácilmente para corregirla sin empezar de cero.

Pero, ¿y si hubiera una forma diferente? Imagina que, en lugar de escribir una oración palabra por palabra, comenzaras con una página en blanco llena de signos de interrogación y fueras llenando los espacios poco a poco, decidiendo qué palabras van en qué lugar, todo a la vez, refinando constantemente tus elecciones hasta que la imagen sea clara. Esta es la idea detrás de los "modelos de difusión". Originalmente famosos por crear imágenes impresionantes a partir del ruido, investigadores han intentado recientemente usar este enfoque de "completar los espacios en blanco" para el texto. La gran pregunta es: ¿Podemos combinar esta forma de pensar flexible y paralela con la capacidad de ver imágenes? Si pudiéramos, podríamos obtener una IA que no solo sea más inteligente al seguir reglas estrictas (como escribir un poema donde cada línea comience con una letra específica), sino también mucho más rápida porque no tiene que esperar a que termine una palabra antes de comenzar la siguiente.

Presentamos a LaViDa (Large Vision-Language Diffusion Model), una nueva familia de modelos de IA introducida por investigadores de UCLA, Panasonic, Adobe y Salesforce. Piensa en LaViDa como el primer "artista multitarea" que utiliza el método de difusión para entender imágenes y escribir sobre ellas. En lugar de escribir una historia palabra por palabra como un robot tradicional, LaViDa comienza con un lienzo en blanco de "máscaras" (marcadores de posición) y revela gradualmente la respuesta, llenando los espacios de una manera que le permite observar la estructura completa de la oración a la vez.

Los investigadores descubrieron que este enfoque tiene algunos superpoderes. Debido a que LaViDa puede observar la estructura completa de la oración antes de finalizarla, es increíblemente bueno en tareas que requieren reglas estrictas, como completar un poema donde cada línea debe comenzar con una letra específica. En las pruebas, superó por completo a la competencia en estas tareas "con restricciones", mejorando el rendimiento en un 59% en comparación con los mejores modelos estándar. También ofrece un "dial de velocidad" único para los usuarios: puedes decirle que sea súper rápido llenando menos espacios en blanco a la vez, o súper alta calidad tomando más pasos para refinar la respuesta. En la descripción de imágenes (image captioning), logró ser casi 2 veces más rápido que sus rivales mientras escribía descripciones mejores (obteniendo +4.1 puntos en una métrica de calidad llamada CIDEr).

Sin embargo, el artículo también señala que este nuevo método no es una varita mágica que lo resuelve todo instantáneamente. Los investigadores tuvieron que inventar algunos trucos ingeniosos para que funcionara bien. Por un lado, crearon una técnica de "enmascaramiento complementario", que es como darle al modelo dos versiones diferentes de un rompecabezas para resolver al mismo tiempo para que no se pierda ninguna pista importante. También construyeron un sistema "Prefix-DLM", que actúa como un atajo inteligente, permitiendo que el modelo recuerde la imagen y la pregunta sin tener que leerlas de nuevo cada vez que adivina una nueva palabra.

A pesar de estos éxitos, el artículo es cuidadoso al señalar dónde LaViDa aún tiene margen de crecimiento. Aunque supera a otros modelos en muchas pruebas de razonamiento y conocimiento general, a veces tiene dificultades para leer texto diminuto dentro de las imágenes (OCR) porque tuvo que comprimir los detalles de la imagen para que cupieran en su memoria. Los autores sugieren que, si bien los modelos de difusión son una alternativa poderosa y prometedora al enfoque estándar de "una palabra a la vez", todavía están aprendiendo cómo escalar para igualar a los modelos de IA más grandes y voraces de datos que existen. En última instancia, LaViDa demuestra que el método de "completar los espacios en blanco" no es solo para crear imágenes; puede ser una forma fuerte, flexible y rápida para que las computadoras entiendan nuestro mundo visual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →