← Últimos artigos
💬 NLP

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

O artigo apresenta a Cadeia de Evidências (CoE), um framework agnóstico ao recuperador que aproveita Modelos Visuais-Linguísticos para permitir atribuição visual em nível de pixel na Geração Aumentada por Recuperação Iterativa, superando assim as limitações da análise baseada apenas em texto ao raciocinar diretamente sobre capturas de tela de documentos para fornecer citações precisas de caixas delimitadoras e preservar informações essenciais do layout visual.

Autores originais: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

Publicado 2026-05-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério complexo. No passado, você tinha que ler centenas de páginas de relatórios digitados para encontrar as pistas. Se o relatório dizia "O suspeito estava em Paris", você tinha que confiar nisso. Mas e se o relatório fosse, na verdade, um panfleto desorganizado com um mapa, uma foto de um bilhete de trem e uma nota manuscrita? Se você apenas digitasse as palavras desse panfleto, perderia o mapa e a foto, e não teria ideia de onde na página a pista estava se escondendo.

Este é o problema que os autores deste artigo estão resolvendo com um novo sistema chamado Cadeia de Evidências (CoE).

O Problema: A "Fotocópia Borrada"

Os sistemas atuais de IA que respondem a perguntas (chamados de Geração Aumentada por Recuperação, ou RAG) geralmente funcionam assim:

  1. Você faz uma pergunta.
  2. A IA encontra alguns documentos.
  3. Ela remove todas as imagens, gráficos e layouts elaborados, transformando tudo em texto simples (como uma fotocópia borrada).
  4. Ela fornece uma resposta e diz: "Encontrei isso no Documento A".

O Pulo do Gato: Se o Documento A for um conjunto de slides com um gráfico ou um PDF com uma tabela complexa, transformá-lo em texto simples destrói a lógica. É como tentar entender uma receita lendo apenas a lista de ingredientes, mas ignorando as fotos de como misturá-los. Além disso, quando a IA diz "Documento A", ela não informa qual parte desse documento contém a resposta. Você precisa rolar manualmente por 50 páginas para encontrar a frase específica. Este é o "Gargalo de Verificação".

A Solução: O "Detetive de Nível de Pixel"

Os autores propõem a Cadeia de Evidências (CoE), que muda o jogo ao tratar documentos como imagens (capturas de tela) em vez de apenas texto.

Pense na CoE como um detetive que não apenas lê o relatório, mas examina a foto original e não editada do documento.

  • Fim do Despojo: Ela não converte o documento para texto primeiro. Ela examina a captura de tela, mantendo todos os gráficos, setas e o layout intactos.
  • O "Marcador Mágico": Em vez de apenas dizer "Está no Documento 3", a CoE desenha um quadro preciso (uma caixa delimitadora) ao redor do local exato na imagem onde a resposta reside. Ela aponta diretamente para o número específico em um gráfico ou para a linha específica em um parágrafo.
  • A Cadeia: Para perguntas complexas que exigem múltiplos passos (por exemplo: "Quem dirigiu o filme e onde ele foi à escola?"), a CoE constrói uma cadeia visual. Ela mostra: "Passo 1: Olhe para esta caixa no Documento A para encontrar o diretor. Passo 2: Olhe para esta caixa no Documento B para encontrar a escola."

Como Eles Testaram

Para provar que isso funciona, a equipe construiu dois novos "campos de treinamento" (conjuntos de dados):

  1. Wiki-CoE: Uma vasta coleção de páginas da Wikipedia transformadas em capturas de tela. Eles pegaram perguntas que exigem saltar entre várias páginas e ensinaram a IA a encontrar o local visual exato para a resposta.
  2. SlideVQA: Uma coleção de slides de apresentação com layouts desorganizados, setas e diagramas complexos. Este é o teste de "modo difícil", porque sistemas baseados em texto geralmente falham aqui.

Os Resultados: Por Que Isso Importa

O artigo mostra que a CoE é uma mudança de paradigma, especialmente para documentos que não são apenas texto simples:

  • É Mais Esperta no "Onde": Em slides complexos, sistemas de IA padrão que dependem de texto frequentemente se perdem. A CoE, ao examinar o layout visual, identificou corretamente a evidência com muito mais frequência.
  • É Confiável: Como a CoE desenha uma caixa ao redor da evidência, você pode verificar a resposta instantaneamente. Você não precisa adivinhar; pode ver a prova ali mesmo na tela.
  • Não Precisa de um Motor de Busca Específico: A CoE funciona com qualquer ferramenta de busca que encontre documentos. Ela apenas pega os 5 melhores resultados (como imagens) e descobre a lógica.

A Conclusão

Os autores argumentam que, para a IA ser verdadeiramente confiável, especialmente com documentos complexos como relatórios, slides e gráficos, ela precisa "ver" o documento, não apenas "ler" uma versão em texto dele. A Cadeia de Evidências transforma a IA em um detetive visual que pode apontar o dedo diretamente para a verdade, tornando o processo de raciocínio transparente e fácil para os humanos verificarem.

Em resumo: Em vez de dar a você uma referência vaga a um livro, a CoE entrega o livro, abre na página exata e desenha um círculo ao redor da frase que você precisa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →