← Últimos artículos
💬 NLP

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

El artículo propone EVisRAG, un marco guiado por evidencia que mitiga las alucinaciones visuales en el razonamiento de múltiples imágenes mediante la recopilación explícita de evidencia visual relevante para la pregunta y el empleo de un nuevo algoritmo RS-GRPO para una optimización conjunta mejorada de la localización y el razonamiento, logrando ganancias de rendimiento significativas en los bancos de pruebas de respuestas a preguntas visuales.

Autores originales: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

Publicado 2026-07-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio, pero en lugar de una sola pista, te entregan una pila desordenada de tres periódicos, fotos y mapas diferentes. Tienes un detective superinteligente en tu bolsillo: un programa informático llamado Modelo de Lenguaje-Visión (VLM, por sus siglas en inglés) que puede leer texto y mirar imágenes. Este detective es excelente respondiendo preguntas, pero a veces, cuando se enfrenta a una enorme pila de imágenes, se confunde. Podría empezar a inventar detalles que no vio, como afirmar que una foto muestra un gato cuando en realidad es un perro, o mezclar hechos de dos páginas distintas. Esto se llama "alucinación visual".

Para ayudar a estos detectives, los científicos han desarrollado un sistema llamado Generación Aumentada por Recuperación Visual (VRAG). Piensa en esto como darle al detective un carnet de biblioteca. Cuando haces una pregunta, el sistema extrae instantáneamente las páginas más relevantes de la biblioteca y se las entrega al detective. La idea es que, si el detective tiene la evidencia adecuada justo frente a él, no necesitará adivinar ni inventar cosas. Sin embargo, incluso con las páginas correctas, el detective suele tener dificultades para encontrar la frase o la imagen exacta que necesita entre el ruido, o puede distraerse con detalles irrelevantes y aun así inventar una respuesta. La gran pregunta es: ¿Cómo enseñamos al detective a ser un verdadero investigador que escanea cuidadosamente cada página, anota solo los hechos que realmente ve y luego resuelve el misterio sin adivinar?

Esto es exactamente lo que el artículo "VisRAG2.0" (específicamente el marco EVisRAG) pretende resolver. Los autores, un equipo de investigadores de universidades de China, proponen una nueva forma de entrenar a estos detectives de IA para que dejen de alucinar y comiencen a razonar con evidencia real. Descubrieron que los métodos anteriores eran como darle al detective una pila de papeles y decirle: "¡Simplemente descúbrelo!", lo que a menudo conducía a la confusión. En cambio, EVisRIG obliga al modelo a actuar como un detective meticuloso que sigue un proceso estricto de tres pasos: Observar, Registrar y Razonar.

Primero, el modelo observa las imágenes recuperadas y declara explícitamente lo que ve, página por página. Segundo, crea un "registro de evidencia", escribiendo hechos específicos de cada imagen y, crucialmente, señalando cuándo una imagen no tiene información útil. Finalmente, utiliza únicamente ese registro escrito para resolver el problema. Para asegurar que el modelo realmente aprenda este comportamiento, los investigadores inventaron un nuevo método de entrenamiento llamado RS-GRPO (Optimización de Política Relativa de Grupo con Alcance de Recompensa). Puedes pensar en esto como un entrenador muy estricto que no solo da una nota por la respuesta final. En su lugar, el entrenador da una puntuación separada para "¿Miraste la imagen correcta?" y otra puntuación para "¿Escribiste el hecho correctamente?". Esto evita que el modelo obtenga una buena nota solo por adivinar la respuesta correcta por suerte, asegurando que realmente aprenda a buscar la evidencia primero.

Los resultados de este nuevo enfoque son bastante impresionantes. Al ser probado en varios bancos de pruebas de respuesta de preguntas visuales (como leer gráficos, documentos y diapositivas), el modelo EVisRAG superó consistentemente a los modelos "base" estándar en un promedio de aproximadamente un 19% en precisión. Más importante aún, redujo significativamente la cantidad de veces que el modelo inventaba hechos. En una prueba específica, un modelo estándar podría mirar un gráfico y afirmar con confianza que el país equivocado tiene una población mayor porque alucinó un número. EVisRAG, sin embargo, miraría el gráfico, escribiría los números correctos en su registro de evidencia y luego deduciría correctamente la respuesta.

El artículo también argumenta en contra de la idea de que simplemente hacer que el modelo "piense durante más tiempo" o añadir agentes más complejos al sistema sea la mejor solución. En su lugar, demuestran que un enfoque estructurado y guiado por la evidencia, combinado con su método de entrenamiento específico (RS-GRPO), es más efectivo. Demostraron que, al delimitar el alcance de las recompensas —otorgando crédito solo por las acciones correctas en el momento adecuado—, el modelo se vuelve mucho más estable y confiable. Si bien el artículo no afirma que esto resuelva todos los problemas posibles de la IA, los experimentos sugieren que este método es un gran paso adelante para hacer que los sistemas de IA visual sean más confiables, precisos y menos propensos a inventar cosas cuando observan múltiples imágenes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →