← Últimos artigos
💬 NLP

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

O artigo apresenta o FilterRAG, um framework de geração aumentada por recuperação zero-shot que integra o BLIP-VQA com fontes de conhecimento externas como Wikipedia e DBpedia para reduzir significativamente as alucinações e melhorar a precisão em Visual Question Answering, particularmente para cenários baseados em conhecimento e fora da distribuição (Out-of-Distribution).

Autores originais: Nobin Sarwar

Publicado 2026-01-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nobin Sarwar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está em uma festa e alguém lhe mostra a foto de um cachorro-quente com coberturas estranhas e pergunta: "O que são essas coisas?". Se você nunca viu esse ingredo específico antes, seu cérebro pode tentar adivinhar com base no que você acha que parece. Você pode dizer: "Provavelmente é mostarda", mesmo que seja na verdade relish. No mundo da Inteligência Artificial, esse jogo de adivinhação é chamado de alucinação. A IA está confiante, mas está errada.

Este artigo apresenta um novo sistema chamado FilterRAG para impedir que a IA cometa esses erros confiantes, especialmente quando encontra coisas que não viu em seus dados de treinamento.

Veja como ele funciona, dividido em conceitos simples:

1. O Problema: O "Sabe-Tudo" que Adivinha

Os modelos de IA atuais (como aqueles que podem olhar para uma imagem e responder perguntas) são ótimos em descrever o que veem. Mas, se você fizer uma pergunta que exige conhecimento externo — como "Para qual esporte esta motocicleta é usada?" ou "Que condimento específico é este?" — eles costertam muito.

Sem uma maneira de verificar os fatos, esses modelos dependem de "memórias" de seu treinamento. Se os dados de treinamento forem tendenciosos ou incompletos, a IA adivinha. É como um aluno fazendo uma prova sem ter estudado o capítulo específico; ele tenta dar uma resposta que soe bem, mas que é, na verdade, uma blefe.

2. A Solução: A Abordagem do "Bibliotecário"

Os autores criaram o FilterRAG. Pense neste sistema como um aluno que tem permissão para usar uma biblioteca durante a prova.

  • O Aluno (BLIP-VQA): Esta é a parte da IA que olha para a imagem e lê a pergunta. É inteligente para ver imagens, mas precisa de ajuda com fatos.
  • A Biblioteca (Wikipedia & DBpedia): Em vez de adivinhar, o sistema faz uma pausa e corre para uma biblioteca digital. Ele pesquisa fatos do mundo real sobre a imagem e a pergunta.
  • O Bibliotecário (GPT-Neo): Esta é a parte que lê os fatos que a biblioteca encontrou e escreve a resposta final.

Ao forçar a IA a "checar a biblioteca" antes de responder, o sistema para de adivinhar e começa a usar fatos.

3. Como Funciona Passo a Passo

O artigo descreve um processo específico, que podemos visualizar como o preparo de uma refeição:

  1. Cortando os Ingredientes (A Grade): O sistema pega a imagem e a corta em uma grade 2x2 (quatro quadrados).
    • Por quê? Se você cortar uma foto em muitas partes minúsculas (como uma grade 4x4), você perde a visão geral e a IA fica confusa. Se mantiver como um único bloco grande, você perde os detalhes pequenos. A grade 2x2 é o tamanho "Goldilocks" (no ponto ideal) — mantém a imagem coerente, mas detalhada o suficiente.
  2. Olhando para a Imagem: O sistema analisa esses quatro quadrados junto com a pergunta.
  3. A Busca: Ele envia uma consulta para a "biblioteca" (Wikipedia e DBpedia) para encontrar fatos relevantes. Para a pergunta da motocicleta, ele pode encontrar fatos sobre "motocross". Para o cachorro-quente, ele pode encontrar fatos sobre "relish".
  4. A Montagem: O sistema combina a imagem, a pergunta e os novos fatos que acabou de encontrar.
  5. A Resposta: Um modelo de linguagem congelado (GPT-Neo) lê todas essas informações combinadas e escreve a resposta. Porque possui os fatos, ele não precisa adivinhar.

4. Os Resultados: Melhor no "Desconhecido"

Os pesquisadores testaram isso em um conjunto de dados chamado OK-VQA, que é cheio de perguntas complicadas que exigem conhecimento externo.

  • A Linha de Base (Baseline): Modelos de IA padrão (sem a biblioteca) acertaram cerca de 40% das respostas nessas perguntas difíceis. Eles estavam alucinando muito.
  • FilterRAG: O novo sistema obteve 36,5% de precisão.
    • Espera, não é menor? O artigo observa que, embora o número bruto seja ligeiramente inferior ao de alguns sistemas massivos e supercomplexos que usam computadores gigantes, o FilterRAG é muito mais eficiente. Ele equilibra desempenho com velocidade e custo.
    • A Grande Vitória: O sistema foi muito melhor em cenários Fora da Distribuição (OOD - Out-of-Distribution). Isso significa que, quando a IA via algo totalmente novo ou estranho (como uma motocicleta em um contexto que não tinha visto antes), era menos provável que ela alucinasse. Ela permaneceu fundamentada em fatos em vez de inventar coisas.

5. O "Score de Fundamentação" (Grounding Score)

Para provar que a IA não estava apenas adivinhando, os autores usaram um "Score de Fundamentação". Imagine isso como um medidor de verdade.

  • Se a IA diz "Mostarda", mas a biblioteca diz "Relish", o score cai.
  • Se a IA diz "Relish" porque a biblioteca disse "Relish", o score permanece alto.
    O FilterRAG manteve seu medidor de verdade alto mesmo quando as perguntas eram difíceis, provando que ele estava realmente usando os fatos encontrados, e não apenas inventando histórias.

Resumo

FilterRAG é como dar a uma IA uma folha de cola (um mecanismo de busca) durante uma prova. Em vez de confiar em sua própria memória falha para adivinhar a resposta para uma pergunta difícil sobre um cachorro-quente ou uma motocicleta, ela procura a resposta em um banco de dados confiável. Isso impede que ela diga a coisa errada com confiança, tornando-a mais segura e confiável para o uso no mundo real, onde ela pode encontrar coisas que nunca viu antes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →