← Últimos artigos
🤖 AI

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

Este artigo apresenta o Visual-Seeker, um sistema de busca agente multimodal nativo visual que aproveita o raciocínio visual ativo e um conjunto de dados sintetizado de 5.000 trajetórias de alta qualidade para alcançar o estado da arte em tarefas de busca complexas e de mundo aberto ao colher dinamicamente evidências visuais detalhadas.

Autores originais: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um mistério, mas em vez de apenas ler pistas em um pedaço de papel, você tem que olhar para uma fotografia caótica e lotada para encontrar a resposta.

O Problema: O Detetive "Cego"
Os detetives de IA atuais (chamados de Modelos de Linguagem Grandes Multimodais) são ótimos em ler texto e observar imagens simples. Mas quando enfrentam uma foto complexa do mundo real — como um estádio cheio de pessoas ou um pôster de filme com detalhes minúsculos — eles costumam ficar confusos. Eles podem saber o que é um jogador de basquete, mas não conseguem facilmente encontrar qual jogador específico está usando a camisa nº 45 em uma foto borrada de uma multidão.

Além disso, quando esses AIs tentam pesquisar na internet por respostas, eles geralmente tratam a imagem como um "instantâneo" estático. Eles olham para ela uma vez, fazem uma pergunta em texto e param. Eles não sabem como dar zoom, recortar um rosto específico ou caçar ativamente novas imagens para comparar com a original. Eles são como um detetive que olha para a foto de uma cena de crime uma única vez e depois fecha os olhos e adivinha a resposta baseada na memória.

A Solução: Visual-Seeker
Os autores deste artigo construíram um novo agente de IA chamado Visual-Seeker. Pense no Visual-Seeker como um detetive que não apenas olha para a foto; ele a investiga ativamente.

Em vez de apenas encarar a imagem, o Visual-Seeker:

  1. Dá zoom: Ele consegue identificar detalhes minúsculos, como a cor de uma pena em um chapéu ou o número em uma camisa.
  2. Caça evidências: Se a foto não estiver clara o suficiente, ele sabe que deve ir à internet, pesquisar por "capas de DVD oficiais" ou "fotos do time", e baixar novas imagens para comparar com a original.
  3. Conecta os pontos: Ele combina o que vê nas novas imagens com a pergunta original para resolver o quebra-cabeça.

Como Eles o Ensinaram: O "Simulador de Treinamento"
Você não pode simplesmente dizer a uma IA para "ser melhor em olhar". Você precisa mostrar como. Os pesquisadores construíram uma fábrica de treinamento especial (chamada de "Pipeline de Dados de Raciocínio Visual Ativo").

Imagine um designer de videogame criando um curso de treinamento para um novo recruta:

  • Passo 1 (O Alvo): Eles pegam uma foto real e bagunçada e pedem para a IA identificar uma pessoa ou objeto específico (ex: "Encontre o cara de camisa rosa").
  • Passo 2 (A Trilha): Eles criam um caminho de "caça ao tesouro" falso. A IA tem que saltar de um fato para outro, como um detetive seguindo uma trilha de pistas.
  • Passo 3 (A Reviravolta): Crucialmente, eles forçam a IA a perceber que o texto não é suficiente. Eles injetam "evidência visual" no treinamento. Eles fazem a IA perceber: "Ei, você não consegue responder isso apenas lendo; você precisa encontrar uma foto do chapéu para ver a cor!"

Eles criaram 5.000 desses cenários de treinamento complexos para ensinar a IA a ser uma buscadora ativa, em vez de uma leitora passiva.

Os Resultados: O Novo Campeão
Quando testaram o Visual-Seeker contra outros modelos de IA de ponta (incluindo modelos proprietários caros de grandes empresas de tecnologia), ele venceu.

  • Ele não apenas adivinhou; ele realmente saiu, encontrou as fotos certas e deu zoom nos detalhes.
  • Ele teve um desempenho melhor do que os especialistas "apenas de texto" e até superou alguns dos modelos "multimodais" mais poderosos disponíveis atualmente.
  • Ele provou que, se você der à IA as ferramentas para olhar e buscar pistas visuais ativamente, ela se torna muito mais inteligente ao resolver enigmas do mundo real.

Em Resumo
As IAs anteriores eram como alunos que memorizaram um livro didático, mas não conseguiam aplicá-lo em um exame bagunçado do mundo real. O Visual-Seeker é o aluno que traz uma lupa, um mapa e uma câmera para o exame, coletando evidências ativamente para resolver o problema passo a passo. O artigo mostra que essa abordagem de "olhar ativamente" é a chave para tornar a IA verdadeiramente inteligente em um mundo visual.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →