← Últimos artículos
💬 NLP

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

El artículo presenta FilterRAG, un marco de generación aumentada por recuperación de cero disparos (zero-shot) que integra BLIP-VQA con fuentes de conocimiento externo como Wikipedia y DBpedia para reducir significativamente las alucinaciones y mejorar la precisión en la respuesta a preguntas visuales (Visual Question Answering), particularmente para escenarios impulsados por el conocimiento y fuera de la distribución (Out-of-Distribution).

Autores originales: Nobin Sarwar

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nobin Sarwar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en una fiesta y alguien te muestra la foto de un perro caliente con ingredientes extraños y te pregunta: "¿Qué son esos?". Si nunca has visto ese ingrediente específico antes, tu cerebro podría intentar adivinar basándose en lo que crees que parece. Podrías decir: "Probablemente es mostaza", aunque en realidad sea pepinillo. En el mundo de la Inteligencia Artificial, este juego de adivinanzas se llama alucinación. La IA está segura de sí misma, pero se equivoca.

Este artículo presenta un nuevo sistema llamado FilterRAG para evitar que la IA cometa estos errores de confianza, especialmente cuando se encuentra con cosas que no ha visto en sus datos de entrenamiento.

Así es como funciona, desglosado en conceptos simples:

1. El Problema: El "Sabelotodo" que adivina

Los modelos de IA actuales (como los que pueden mirar una imagen y responder preguntas) son excelentes describiendo lo que ven. Pero si les haces una pregunta que requiere conocimiento externo —como "¿Para qué deporte se usa esta motocicleta?" o "¿Qué es este condimento específico?"— suelen tener dificultades.

Sin una forma de verificar los hechos, estos modelos dependen de sus "memorias" de su entrenamiento. Si los datos de entrenamiento están sesgados o incompletos, la IA adivina. Es como un estudiante que toma un examen sin haber estudiado el capítulo específico; intenta dar una respuesta que suene bien, pero que en realidad es falsa.

2. La Solución: El enfoque del "Bibliotecario"

Los autores crearon FilterRAG. Piensa en este sistema como un estudiante al que se le permite usar una biblioteca durante el examen.

  • El Estudiante (BLIP-VQA): Esta es la parte de la IA que mira la imagen y lee la pregunta. Es inteligente viendo imágenes, pero necesita ayuda con los hechos.
  • La Biblioteca (Wikipedia y DBpedia): En lugar de adivinar, el sistema hace una pausa y corre a una biblioteca digital. Busca hechos del mundo real sobre la imagen y la pregunta.
  • El Bibliotecario (GPT-Neo): Esta es la parte que lee los hechos que la biblioteca encontró y escribe la respuesta final.

Al obligar a la IA a "consultar la biblioteca" antes de responder, evita adivinar y comienza a usar hechos.

3. Cómo funciona paso a paso

El artículo describe un proceso específico que podemos visualizar como la preparación de una comida:

  1. Cortar los ingredientes (La cuadrícula): El sistema toma la imagen y la corta en una cuadrícula de 2x2 (cuatro cuadrados).
    • ¿Por qué? Si cortas una foto en demasiados trozos diminutos (como una cuadrícula de 4x4), pierdes la visión general y la IA se confunde. Si la mantienes como un solo bloque grande, pierdes los detalles pequeños. La cuadrícula de 2x2 es el tamaño "Goldilocks" (el punto justo): mantiene la imagen coherente pero lo suficientemente detallada.
  2. Mirar la foto: El sistema analiza estos cuatro cuadrados junto con la pregunta.
  3. La búsqueda: Envía una consulta a la "biblioteca" (Wikipedia y DBedia) para encontrar hechos relevantes. Para la pregunta de la motocicleta, podría encontrar hechos sobre el "motocross". Para el perro caliente, podría encontrar hechos sobre el "pepinillo".
  4. El ensamblaje: El sistema combina la imagen, la pregunta y los nuevos hechos que acaba de encontrar.
  5. La respuesta: Un modelo de lenguaje congelado (GPT-Neo) lee toda esta información combinada y escribe la respuesta. Debido a que tiene los hechos, no necesita adivinar.

4. Los Resultados: Mejor en lo "Desconocido"

Los investigadores probaron esto en un conjunto de datos llamado OK-VQA, que está lleno de preguntas complicadas que requieren conocimiento externo.

  • La Línea Base: Los modelos de IA estándar (sin la biblioteca) acertaron aproximadamente el 40% de las respuestas en estas preguntas complicadas. Estaban alucinando mucho.
  • FilterRAG: El nuevo sistema obtuvo un 36.5% de precisión.
    • Espera, ¿es más bajo? El artículo señala que, aunque la cifra bruta es ligeramente inferior a la de algunos sistemas masivos y supercomplejos que usan computadoras enormes, FilterRAG es mucho más eficiente. Equilibra el rendimiento con la velocidad y el costo.
    • La verdadera victoria: El sistema fue mucho mejor en escenarios Fuera de la Distribución (OOD). Esto significa que cuando la IA veía algo totalmente nuevo o extraño (como una motocicleta en un contexto que no había visto antes), era menos probable que alucinara. Se mantenía fundamentada en los hechos en lugar de inventar cosas.

5. El "Puntaje de Fundamentación" (Grounding Score)

Para demostrar que la IA no estaba simplemente adivinando, los autores utilizaron un "Puntaje de Fundamentación". Imagina esto como un medidor de verdad.

  • Si la IA dice "Mostaza" pero la biblioteca dice "Pepinillo", el puntaje baja.
  • Si la IA dice "Pepinillo" porque la biblioteca dijo "Pepinillo", el puntaje se mantiene alto.
    FilterRAG mantuvo su medidor de verdad alto incluso cuando las preguntas eran difíciles, demostrando que realmente estaba utilizando los hechos que encontró, no solo inventando historias.

Resumen

FilterRAG es como darle a una IA una hoja de trucos (un motor de búsqueda) durante un examen. En lugar de confiar en su propia memoria defectuosa para adivinar la respuesta a una pregunta difícil sobre un perro caliente o una motocicleta, busca la respuesta en una base de datos confiable. Esto evita que diga cosas erróneas con total seguridad, haciéndolo más seguro y confiable para el uso en el mundo real donde podría encontrarse con cosas que nunca ha visto antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →