← Últimos artigos
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

O artigo apresenta o DRAGON, um conjunto de dados de referência e um quadro de avaliação projetados para avaliar a capacidade de modelos visão-linguagem de fundamentar suas respostas em evidências visuais específicas dentro de diagramas, abordando a limitação de alta precisão sem justificação de raciocínio confiável.

Autores originais: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Publicado 2026-04-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está fazendo uma prova onde precisa observar um diagrama complexo — como um mapa, um circuito impresso ou um gráfico de barras — e responder a uma pergunta sobre ele.

No passado, se um programa de computador (uma IA) acertava a resposta, assumíamos que ele "entendia" a imagem. Mas este novo artigo, DRAGON, argumenta que acertar a resposta não é suficiente. A IA pode estar trapaceando. Ela pode estar chutando a resposta com base nas palavras da pergunta ou em padrões nos dados, sem realmente observar as partes específicas da imagem que provam que a resposta é verdadeira.

Pense nisso como um aluno fazendo uma prova de matemática.

  • O Jeito Antigo: Se o aluno escreve "42" como resposta, o professor dá um visto. Não sabemos se ele fez a conta ou apenas chutou.
  • O Jeito DRAGON: O professor exige ver o trabalho do aluno. O aluno deve circular os números específicos que usou, desenhar setas para as fórmulas e destacar a parte do gráfico que levou ao "42". Se ele não puder apontar para a evidência, ele não resolveu realmente o problema, mesmo que o número final esteja correto.

O que é DRAGON?

DRAGON é um novo "teste" (benchmark) projetado para pegar modelos de IA que estão chutando. Ele faz uma pergunta simples, mas difícil: "Mostre-me exatamente onde na imagem você encontrou a resposta."

Para passar neste teste, a IA precisa desenhar um retângulo ao redor das pistas visuais específicas que usou. Essas pistas podem ser:

  • Uma barra específica em um gráfico.
  • Um rótulo em um mapa.
  • Um fio em um diagrama de circuito.
  • Uma legenda ou um título.

Como Eles Construíram o Teste

Os pesquisadores não apenas pediram à IA para chutar; eles construíram uma vasta biblioteca com mais de 11.000 perguntas a partir de seis tipos diferentes de diagramas (gráficos, mapas, circuitos, etc.).

Para cada pergunta individual, humanos atuaram como os "contadores da verdade". Eles olharam para o diagrama e para a resposta correta, depois desenharam as exatas caixas ao redor da evidência visual necessária para provar aquela resposta.

  • Analogia: Imagine um detetive resolvendo um crime. Os anotadores humanos são aqueles que dizem: "A pista não é apenas o quarto inteiro; a pista é esta pegada específica de lama no chão." A IA então tem que encontrar essa mesma pegada.

As Três Maneiras Como Eles Pediram à IA

Os pesquisadores tentaram três "prompts" diferentes (maneiras de pedir à IA para realizar a tarefa) para ver se ela poderia aprender a mostrar seu trabalho:

  1. EDGE (A Abordagem Direta): "Aqui está a imagem e a resposta. Apenas desenhe as caixas ao redor da evidência." (Como pedir a um aluno para apenas escrever a resposta).
  2. SAGE (A Abordagem Passo a Passo): "Primeiro, diga-me o que você precisa olhar (por exemplo, 'a barra vermelha' e 'o ano 2020'). Depois, desenhe as caixas ao redor delas." (Como pedir ao aluno para listar seus passos antes de resolver).
  3. VERGE (A Abordagem de Auto-correção): "Desenhe suas caixas. Agora, olhe para seu desenho novamente. Você perdeu algo? Sua caixa está grande demais? Corrija." (Como pedir ao aluno para verificar seu trabalho duas vezes).

O Que Eles Encontraram (Os Resultados)

Os resultados foram um pouco um alerta para a comunidade de IA:

  • A IA é boa em chutar, ruim em provar: Muitos modelos de IA acertaram a resposta, mas, quando pediram para desenhar as caixas, falharam miseravelmente. Frequentemente, apontavam para a parte errada da imagem ou perdiam detalhes cruciais.
  • O Problema da "Caixa Preta": Mesmo os modelos de IA mais inteligentes (como Claude Opus ou Gemini) lutaram para mostrar seu trabalho. Eles podiam dizer "A resposta é 50", mas não conseguiam apontar de forma confiável o "50" no gráfico.
  • Alguns modelos são melhores que outros: Os modelos "fechados" (os grandes e caros de empresas como Anthropic e Google) foram melhores em encontrar a evidência do que os de código aberto, mas nenhum deles foi perfeito.
  • Pedir educadamente ajuda um pouco: Usar os métodos passo a passo (SAGE) ou de auto-correção (VERGE) ajudou a IA a encontrar os locais corretos um pouco mais frequentemente, mas não resolveu o problema fundamental. A IA ainda frequentemente perdia partes da evidência.

Por Que Isso Importa

O artigo conclui que não podemos confiar na IA para raciocinar sobre diagramas apenas porque ela acerta a resposta. Se uma IA for usada para analisar gráficos médicos, gráficos financeiros ou diagramas de segurança, precisamos saber por que ela tomou uma decisão.

DRAGON é uma ferramenta para forçar a IA a parar de chutar e começar a "mostrar seu trabalho". É um novo padrão para garantir que, quando uma IA diz que entende uma imagem, ela possa realmente apontar para a prova.

As Limitações

Os autores admitem que seu teste não é perfeito. Eles usam caixas retangulares simples para marcar evidências. Isso funciona para barras grandes ou blocos, mas é difícil usar uma caixa para marcar um fio fino e sinuoso em um diagrama de circuito ou uma seta curva em um mapa. Além disso, às vezes diferentes humanos podem discordar sobre exatamente qual parte da imagem é a pista "mais importante", o que adiciona um pouco de subjetividade ao teste.

Em resumo: DRAGON é um novo regulamento que diz: "Não me dê apenas a resposta; mostre-me a evidência na imagem." E, no momento, a maioria dos alunos de IA está reprovando nesse teste.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →