← Últimos artículos
💬 NLP

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

Este artículo propone un método para mitigar las alucinaciones en los Grandes Modelos de Visión y Lenguaje mediante el refinamiento de los incrustamientos textuales para reducir la dependencia excesiva de los sesgos lingüísticos y promover una integración más equilibrada de las señales visuales, logrando mejoras significativas de rendimiento en múltiples evaluaciones de alucinación.

Autores originales: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El "Narrador Excesivamente Seguro de Sí Mismo"

Imagina que tienes un narrador brillante (el Modelo de Lenguaje Extenso, o LLM) que ha leído todos los libros de la biblioteca pero que nunca ha visto una foto real. Le muestras al narrador una foto de una encimera de cocina vacía y le preguntas: "¿Qué ves?".

Debido a que el narrador está tan acostumbrado a leer historias sobre cocinas, comienza a adivinar inmediatamente. Podría decir: "Veo una taza de café humeante y un cuenco con fruta", a pesar de que la encimera está completamente vacía. Está confiando en su memoria de las palabras en lugar de mirar la imagen.

En el mundo de la IA, esto se llama alucinación. El modelo es fluido y suena inteligente, pero está inventando cosas porque confía más en su entrenamiento de texto que en la evidencia visual.

La Configuración Actual: El "Tren de Dos Vías"

La mayoría de los modelos de IA actuales que observan imágenes (llamados LVLMs) funcionan como un tren con dos vías separadas que se fusionan al final:

  1. Vía A (Texto): Las palabras del narrador.
  2. Vía B (Visión): Los datos de la imagen.

El problema es que la locomotora del tren (la IA) fue construida para correr en la Vía A (texto). Cuando las dos vías se unen, la locomotora naturalmente prefiere la Vía A, que es suave y familiar. Ignora los bultos y los detalles de la Vía B (la imagen). Trata la imagen como una sugerencia secundaria en lugar de como el hecho principal.

La Solución: "VisAlign" – El "Mapa Pintado"

Los investigadores proponen un nuevo método llamado VisAlign. En lugar de simplemente fusionar las vías al final, deciden pintar la imagen directamente sobre las palabras antes de que la historia siquiera comience.

Así es como lo hacen:

  1. La Instantánea Global: Primero, la IA echa un vistazo rápido y promedio a toda la imagen (como entrecerrar los ojos ante una pintura para captar la vibra general).
  2. La Inyección: Toman esta "vibra" y la mezclan directamente en el ADN de cada una de las palabras que la IA está a punto de decir.
  3. El Resultado: Ahora, cuando la IA piensa en la palabra "taza", esa palabra ya no es solo una definición textual; lleva consigo la "textura" de la imagen real que está observando.

La Analogía:
Imagina que le estás dando direcciones a un amigo.

  • Forma Antigua: Dices: "Gira a la izquierda en la panadería", pero estás mirando un mapa de la ciudad que no tiene ninguna panadería allí. Solo estás recitando un guion.
  • Forma de VisAlign: Sostienes el mapa en tu mano, y cada vez que dices "panadería", estás señalando físicamente el lugar en el mapa. La palabra y la imagen están fusionadas. No puedes decir "panadería" sin ver el mapa.

¿Qué sucede cuando lo arreglan?

Los investigadores probaron este método en un modelo llamado Video-LLaVA (que observa videos y responde preguntas). Observaron cómo cambió la "atención" de la IA (hacia dónde enfoca su capacidad cerebral).

  • Antes de VisAlign: La IA se enfocaba fuertemente en el principio y el final de la oración (el texto) e ignoraba casi por completo la parte media donde residían los datos de la imagen. Era como un estudiante leyendo la pregunta de un examen pero ignorando el diagrama.
  • Después de Visalign: La IA comenzó a prestar atención a los datos de la imagen durante toda la oración. La "atención" se volvió equilibrada. Dejó de adivinar basándose en lo que suele suceder y empezó a observar lo que realmente está sucediendo.

Los Resultados: Menos Datos Inventados

El equipo probó este nuevo método en varios "Benchmarks de Alucinación" (pruebas diseñadas para engañar a la IA para que mienta). Los resultados fueron claros:

  • Mejor Precisión: El modelo mejoró significamente su capacidad para detectar cosas que no estaban allí (como un perro inexistente) y describir cosas que sí estaban allí.
  • Ganancias Específicas:
    • En una prueba llamada MMVP-MLLM, la precisión aumentó un 9.33%.
    • En POPE (una prueba para alucinaciones de objetos), la precisión subió casi un 3%.
    • En Merlin (una prueba para verificar si los objetos existen), mejoró hasta un 3.4%.
  • Generalización: Probaron este truco en otros modelos de IA (como LLaVA 1.5 y Open-Qwen2VL), y también funcionó allí. Es un arreglo universal para el problema de "texto sobre visión".

El Intercambio: Un Pequeño Precio a Pagar

El artículo señala una pequeña limitación. Debido a que la IA ahora está obligada a depender más de la imagen y menos de su memoria del mundo, podría volverse ligeramente peor en preguntas que solo requieren conocimiento general (como "¿Quién es un actor famoso?"). Sin embargo, para tareas que requieren mirar una imagen, la mejora es masiva.

Resumen

El artículo argumenta que los modelos de IA alucinan porque son "pesados en texto" y "ligeros en visión". Al mezclar la información visual directamente en las palabras del texto antes de que la IA comience a pensar, obligan al modelo a mirar la imagen. Este simple ajuste actúa como un cable de conexión a tierra, evitando que la IA flote hacia historias imaginarias y manteniéndola anclada en la realidad visual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →