← Últimos artigos
💬 NLP

VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

Este artigo apresenta o VistaHop, um novo benchmark e ambiente de avaliação projetado para avaliar as capacidades de modelos de raciocínio multimodal de grande escala na execução de raciocínio visual complexo de múltiplos saltos (multi-hop) e inspeção iterativa de imagens para Visual DeepSearch, revelando que os atuais modelos de última geração ainda enfrentam dificuldades significativas com essas tarefas.

Autores originais: Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Publicado 2026-06-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um detetive para resolver um mistério. No passado, a maioria dos "testes de detetive" para IA eram como charadas simples: você mostrava uma única foto para a IA e perguntava: "Qual é a cor do carro?". A IA apenas olhava uma vez, adivinhava a cor e seguia em frente.

Mas a investigação no mundo real é muito mais difícil. Às vezes, para resolver um caso, você precisa dar um zoom em um pequeno logotipo em um sapato, pesquisar o histórico dessa marca, descobrir onde fica a fábrica, verificar o clima lá e, então, conectar todos esses pontos para descobrir quem estava na cena.

Este artigo, VistaHop, trata da construção de um teste muito mais difícil para ver se os detetives de IA conseguem realmente realizar esse tipo de trabalho profundo e de múltiplas etapas.

O Problema: A Armadilha do "Olhar de Relance"

Os autores argumentam que os testes atuais de IA são fáceis demais. Eles são como dar a um detetive uma foto e perguntar: "Tem um cachorro nesta imagem?". A IA apenas olha de relance e diz "Sim".

O verdadeiro "Visual DeepSearch" (Busca Visual Profunda) é diferente. Ele exige que a IA:

  1. Olhe de perto: Dê zoom em partes específicas de uma imagem (como um texto minúsculo em uma placa).
  2. Vá e volte: Perceba que perdeu uma pista, dê zoom novamente e olhe para uma parte diferente da imagem.
  3. Conecte os pontos: Combine o que vê na foto com conhecimento externo (como consultar um banco de dados) através de muitas etapas.

Os autores dizem que os testes existentes falham porque permitem que a IA trapaceie usando pistas de texto ou apenas adivinhando sem realmente "ver" os detalhes.

A Solução: VistaHop (A "Pista de Obstáculos")

Para corrigir isso, a equipe criou o VistaHop, um novo benchmark (um conjunto de testes) projetado como uma complexa pista de obstáculos.

  • A Configuração: Eles reuniram 300 fotos de alta qualidade (como uma rua movimentada de uma cidade ou um museu).
  • A Tarefa: Eles criaram 350 perguntas que forçam a IA a fazer uma longa jornada.
    • Exemplo: "Olhe para o contêiner de transporte laranja no canto inferior direito. Encontre o logotipo da empresa. Descubra quando essa empresa foi fundada. Agora, encontre a cidade onde fica a sede deles. Em que ano aquela cidade foi fundada? Subtraia os dois anos."
  • As Regras: A IA não pode apenas adivinhar. Ela deve provar que olhou para a parte específica da imagem, encontrou o logotipo e seguiu a cadeia de pistas. Se ela tentar responder usando apenas o texto da pergunta (sem olhar para a imagem), o teste a pega e rejeita a resposta.

Eles também construíram o VistaArena, uma "academia" onde podem observar a IA treinar. Ela permite que a IA use ferramentas como uma lupa (para recortar/dar zoom em imagens), um mecanismo de busca (para encontrar fatos) e uma calculadora.

Os Resultados: A IA Ainda é uma Novata

Os autores submeteram os modelos de IA mais inteligentes disponíveis (como SenseNova, GPT-5 e Gemini) a esta pista de obstáculos.

O veredito? A IA teve dificuldades imensas.

  • Mesmo o melhor modelo acertou apenas cerca de 24% das respostas na primeira tentativa.
  • Quando a IA foi forçada a apenas olhar para a imagem sem usar ferramentas de busca, ela acertou menos de 8%.
  • A IA melhorou quando lhe foi permitido usar ferramentas (zoom e busca), mas ainda falhava frequentemente quando a "cadeia de pistas" ficava muito longa ou exigia olhar para vários pontos diferentes da foto.

A Conclusão

O artigo conclui que, embora a IA esteja ficando boa em "ver" imagens, ela ainda é muito ruim em ser uma investigadora persistente. Ela tende a desistir rápido demais, perder detalhes minúsculos ou esquecer de voltar e verificar a imagem novamente.

Os autores construíram o VistaHop não para vender um produto, mas para mostrar ao mundo que precisamos de melhores testes e melhores métodos de treinamento se quisermos que a IA realmente entenda mistérios visuais complexos. Eles tornaram seus dados e códigos públicos para que outros pesquisadores possam tentar construir melhores "detetives".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →