← Últimos artículos
💬 NLP

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

Este artículo presenta el primer estudio sistemático que compara los Modelos de Lenguaje de Difusión Multimodales y los Modelos de Lenguaje de Visión Autorregresivos como herramientas de incrustación, revelando que, si bien los primeros generalmente rinden por debajo debido a una alineación insuficiente entre imagen y texto, la brecha de rendimiento varía significativamente entre modelos específicos.

Autores originales: Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

Publicado 2026-02-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante donde cada libro, foto y video se almacena no en estantes, sino como una "vibra" o una "huella digital" única. En el mundo de la IA, estas huellas digitales se llaman embeddings. Permiten que las computadoras entiendan que la imagen de un perro y la palabra "perro" están relacionadas, aunque una sea una imagen y la otra sea texto.

Durante mucho tiempo, la mejor forma de crear estas huellas digitales era mediante Modelos Autoregresivos. Piensa en estos como una persona leyendo una historia palabra por palabra, de izquierda a derecha. Son muy buenos entendiendo el contexto porque construyen el significado paso a paso.

Recientemente, un nuevo tipo de IA llamado Modelos de Difusión se ha vuelto popular. Imagina que estos son como un escultor que comienza con un bloque de mármol cubierto de ruido y, lentamente, va quitando el ruido para revelar la estatua. O piensa en ellos como una persona que puede mirar una oración completa a la vez y completar las palabras faltantes simultáneamente, en lugar de adivinar una por una. Estos modelos son excelentes porque pueden ver el "panorama general" (atención bidireccional) todo al mismo tiempo.

La Gran Pregunta
Los investigadores en este artículo se hicieron una pregunta simple: ¿Pueden estos nuevos modelos "escultores" (Difusión) ser tan buenos como los viejos modelos "lectores" (Autoregresivos) al crear estas huellas digitales de "vibra"?

El Experimento
Para averiguarlo, el equipo tomó los dos mejores modelos "escultores" (llamados LaViDa y MMaDA) y los dos mejores modelos "lectores" (llamados LLaVA-1.6 y Qwen2.5-VL). Les enseñaron a todos cómo crear estas huellas digitales usando un método de entrenamiento estándar (como enseñarles a emparejar una imagen con su descripción correcta).

Luego, los pusieron a prueba en tres escenarios diferentes:

  1. Clasificación: "¿Qué es esta imagen?" (por ejemplo, ¿es un gato o un perro?)
  2. Preguntas y Respuestas Visuales (VQA): "Mirando este gráfico, ¿cuál es el valor más alto?"
  3. Recuperación (Retrieval): "Encuéntrame una imagen que coincida con esta descripción específica."

Los Resultados: Los "Escultores" Tuvieron Problemas
Los resultados fueron sorprendentes. Aunque los modelos "escultores" (Difusión) tienen el superpoder de mirar todo a la vez, generalmente tuvieron un desempeño inferior en comparación con los modelos "lectores".

  • El Escultor "Bueno" (LaViDa): Este modelo lo hizo bastante bien. Solo estuvo ligeramente por detrás de los mejores modelos "lectores" (unos 3 o 4 puntos por debajo en una escala de 100). Fue especialmente bueno manejando tipos de datos nuevos y desconocidos (fuera del dominio), lo que sugiere que es un poco más flexible.
  • El Escultor que "Tiene Problemas" (MMaDA): Este modelo tuvo una brecha enorme. Obtuvo una puntuación más de 20 puntos inferior a los modelos "lectores" en todos los ámbitos. Simplemente no pudo mantener el ritmo.

¿Por qué sucedió esto?
Los investigadores profundizaron para entender por qué los "escultores" estaban perdiendo. Encontraron dos razones principales:

  1. Huellas Digitales Desalineadas: En los modelos "lectores", la imagen y el texto se acercan mucho en el espacio de la huella digital (se alinean perfectamente). En los modelos "escultores", la huella digital de la imagen y la de el texto a menudo permanecían separadas, como dos personas intentando tomarse de la mano pero paradas en lados opuestos de una habitación. Los modelos simplemente no aprendieron a conectar la imagen y el texto de manera tan estrecha.
  2. Objetivos de Entrenamiento Incorrectos: El modelo con problemas (MMaDA) fue entrenado para hacer dos cosas a la vez: entender imágenes y generar nuevas imágenes desde cero. Los investigadores sospechan que intentar ser un "pintor" (generar imágenes) distrajo al modelo de ser un buen "bibliotecario" (crear huellas digitales precisas para la búsqueda).

La Conclusión
Aunque los modelos de Difusión son emocionantes y tienen características geniales como mirar toda la imagen a la vez, no están listos para reemplazar a los viejos modelos "lectores" para crear huellas digitales aptas para la búsqueda. Los modelos "lectores" aún conservan la corona por su precisión, principalmente porque son mejores vinculando estrechamente lo que ven con lo que leen.

El artículo concluye que, si bien los modelos de Difusión tienen potencial (especialmente el LaViDa), necesitan mejorar mucho en la alineación de imágenes y texto antes de que puedan ser la opción preferida para estas tareas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →