← Últimos artigos
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

Este artigo apresenta o VISTAQA, um benchmark abrangente, e a métrica de avaliação GROVE, projetados para avaliar conjuntamente a correção da resposta a perguntas visuais e a precisão do alinhamento de evidências em nível de pixel, revelando uma lacuna significativa de desempenho nos modelos multimodais atuais que não alinham respostas com evidências visuais.

Autores originais: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um detetive para resolver um mistério com base em uma única fotografia.

No passado, se o detetive lhe desse o nome correto do culpado, você o contrataria. Você não se importava como ele sabia. Ele poderia ter adivinhado com base em um palpite, um estereótipo ou uma sorte. Se ele dissesse: "Foi o mordomo", e estivesse certo, ele ganhava uma estrela de ouro. Mesmo que ele apontasse para a pessoa errada na foto e dissesse: "Veja? Esse é o mordomo!", você ainda lhe dava a estrela de ouro porque o nome estava correto.

Este artigo argumenta que essa antiga forma de testar a IA está quebrada. É como contratar um detetive que obtém a resposta certa, mas não consegue mostrar a você as evidências.

O Problema: A IA da "Adivinhação Sortuda"

Os autores afirmam que os modelos atuais de IA (chamados Modelos de Linguagem Multimodal Grandes) são ótimos em adivinhar as palavras certas. Mas são terríveis em provar por que estão certos.

  • A Armadilha do "Apenas Texto": Se uma IA diz: "Há três patas naquele cachorro", mas o cachorro na imagem claramente tem quatro, a IA ainda pode dizer "três" porque aprendeu com textos que cachorros geralmente têm quatro, ou simplesmente adivinhou. Se ela acertar o número por acidente, nós a recompensamos.
  • A Armadilha do "Apenas Fundamentação": Por outro lado, alguns modelos de IA são bons em apontar coisas em uma imagem (como desenhar um círculo ao redor de um cachorro), mas são ruins em responder perguntas. Eles podem apontar perfeitamente para o cachorro, mas dizer: "Isso é um gato".

O artigo chama isso de "lacuna de modalidade". O cérebro da IA (texto) e seus olhos (visão) não estão conversando adequadamente entre si.

A Solução: VISTAQA (O Teste "Mostre Seu Trabalho")

Para corrigir isso, os autores criaram um novo teste chamado VISTAQA.

Pense no VISTAQA como um professor rigoroso que não apenas avalia sua resposta final; ele avalia seu trabalho.

  • As Regras: Para obter uma nota de aprovação, a IA deve fazer duas coisas ao mesmo tempo exato:
    1. Responder à pergunta corretamente (por exemplo: "O carro é vermelho").
    2. Desenhar uma máscara (como um marcador) nos pixels exatos do carro vermelho na imagem para provar que o viu.

Se a IA acertar a resposta, mas destacar o carro errado, ela reprova. Se destacar o carro certo, mas disser que é azul, ela reprova. Ela deve fazer ambas as coisas perfeitamente para obter uma nota alta.

O Conjunto de Dados: Um Mix de Desafios

O teste não é apenas um tipo de pergunta. Os autores construíram uma biblioteca de 1.157 quebra-cabeças curados por especialistas cobrindo:

  • Seis Tipos de Pensamento: Desde o simples "Qual é a cor disso?" (Percepção) até o complexo "Qual objeto está mais perto do braço robótico?" (Raciocínio).
  • Seis Mundos Diferentes: Salas internas, ruas externas, diagramas matemáticos, gráficos científicos, laboratórios de robótica e cenas de carros autônomos.
  • Perguntas "Armadilha": Cerca de 27% das perguntas são armadilhas. Elas perguntam sobre coisas que não estão na imagem (por exemplo: "Quantos elefantes vermelhos há nesta cozinha?"). Uma IA inteligente deve dizer: "Não há nenhum", e deixar a imagem em branco. Uma IA "alucinada" tentará desenhar um elefante vermelho que não existe.

O Boletim de Notas: GROVE

Como você avalia um teste onde você precisa estar certo de duas maneiras diferentes? Você não pode apenas somar as pontuações. Se você tirar 100% no texto, mas 0% na imagem, não deveria obter uma média alta.

Os autores inventaram um novo sistema de pontuação chamado GROVE.

  • A Analogia: Imagine um banco de duas pernas. Se uma perna estiver quebrada, o banco cai. Você não pode dizer: "Bem, a outra perna está perfeita, então o banco está bem".
  • Como funciona: O GROVE multiplica a "Pontuação de Texto" e a "Pontuação de Imagem". Se qualquer uma delas for zero (ou muito baixa), a pontuação final despenca. Isso força a IA a ser boa em ambas as coisas ou receber uma nota ruim.

Os Resultados: A IA Ainda Está Aprendendo

Os autores testaram os modelos de IA mais inteligentes disponíveis hoje (incluindo modelos do Google, OpenAI e outros) neste novo e mais rigoroso teste.

O veredito? Mesmo os melhores modelos lutaram.

  • Eles foram ótimos em adivinhar as palavras certas.
  • Eles foram razoáveis em apontar para coisas.
  • Mas quando solicitados a fazer ambas as coisas ao mesmo tempo, suas pontuações caíram significativamente.

O artigo conclui que, embora a IA esteja ficando mais inteligente ao falar, ela ainda não aprendeu totalmente a "ver" e "provar" suas respostas simultaneamente. Há uma enorme lacuna entre o que a IA diz e o que ela realmente .

Resumo

  • Antigo Jeito: Você acertou a resposta? Sim? Bom trabalho. (Ignora se você trapaceou ou adivinhou).
  • Novo Jeito (VISTAQA): Você acertou a resposta E consegue apontar para a prova na imagem?
  • A Pontuação (GROVE): Se você errar qualquer parte, você reprova.
  • A Descoberta: A IA atual ainda é como um aluno que consegue memorizar o gabarito, mas não entende a lição. Eles precisam aprender a mostrar seu trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →