InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
Este artigo apresenta o InterLV-Search, uma abrangente base de referência e estrutura de avaliação para busca agênica multimodal intercalada que destaca limitações significativas atuais na capacidade dos sistemas de integrar dinamicamente evidências textuais e visuais em cenários de busca ativa, offline controlada e na web aberta.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um mistério complexo, como encontrar uma pessoa específica com base em uma série de pistas.
O Jeito Antigo (Benchmarks Anteriores):
A maioria dos atuais "detetives" de IA é treinada assim: você lhes dá uma foto de um suspeito e pergunta: "Quem é esta pessoa?" ou "De que cor é o chapéu dela?". A IA olha para a foto e responde. Se a foto não for suficiente, a IA pode pesquisar na internet por texto sobre a pessoa, mas trata a foto apenas como o ponto de partida ou a resposta final. Raramente usa uma foto que encontra no meio de sua investigação para mudar sua direção. É como um detetive que olha para uma foto da cena do crime, depois apenas lê um artigo de jornal, e nunca percebe que uma nova foto que encontra na página 3 do jornal realmente o aponta para uma cidade completamente diferente.
O Novo Jeito (InterLV-Search):
Os autores deste artigo, "InterLV-Search", construíram um novo campo de treinamento (um benchmark) para testar se a IA pode fazer algo muito mais difícil: Busca Agente Multimodal Intercalada.
Pense nisso como um detetive que deve alternar constantemente entre olhar mapas (texto) e olhar fotos (imagens) para resolver o caso.
- O Twist: A IA encontra uma foto, olha para ela e percebe: "Oh! O logotipo neste prédio na foto me diz que preciso pesquisar por uma marca específica." Então ela pesquisa essa marca, encontra uma nova foto de um carro, vê uma placa de licença, e essa placa diz a ela para pesquisar uma cidade específica.
- O Objetivo: A foto não é apenas a resposta; a foto é um volante. Ela diz à IA para onde dirigir a seguir.
Os Três Níveis de Dificuldade
O artigo testa a IA em três níveis, como um videogame com dificuldade crescente:
Nível 1: O Desafio "Encontre a Imagem".
- A Tarefa: A IA recebe uma descrição textual como: "Encontre o jogo que apresenta este navio pirata." Ela precisa descobrir o que é o navio, pesquisar por ele, encontrar a imagem e, em seguida, responder a uma pergunta sobre a imagem (por exemplo: "Qual motor o navio usa?").
- A Metáfora: Você recebe um enigma sobre um objeto escondido. Você precisa encontrar o objeto primeiro antes de poder responder ao enigma.
Nível 2: O Desafio "Labirinto Controlado".
- A Tarefa: A IA está em um quarto fechado (um banco de dados offline controlado) com um mapa. Ela começa com uma pista textual, encontra uma foto, a foto dá uma nova pista, ela encontra outra foto, e assim por diante.
- A Metáfora: Imagine uma caça ao tesouro onde encontrar uma foto de uma porta vermelha leva você a uma pista textual sobre um carro azul, que leva você a uma foto de um pássaro amarelo. A IA deve usar a foto da porta para decidir procurar o carro. Se ela ignorar a foto e continuar apenas lendo texto, ela se perde.
Nível 3: O Desafio "Internet Selvagem".
- A Tarefa: Agora a IA está na internet real e bagunçada. Ela precisa pesquisar pistas, encontrar fotos, perceber que algumas fotos são falsas ou irrelevantes, comparar diferentes caminhos (por exemplo: "Este filme tem 60 minutos ou 90 minutos?") e escolher o caminho certo para continuar.
- A Metáfora: Isso é como um detetive tentando resolver um caso usando toda a internet. Ele precisa peneirar milhões de sites, alguns com fotos ruins, alguns com datas erradas, e decidir qual caminho seguir com base no que vê nas imagens.
O Que Eles Encontraram?
Os autores testaram muitos dos modelos de IA mais inteligentes (como GPT-5, Gemini e Claude) neste novo teste.
- O Resultado: Os modelos de IA estão atualmente muito ruins nisso. Mesmo os melhores acertaram menos de 50% das respostas.
- O Problema: Os modelos de IA são ótimos em ler texto e ótimos em olhar para uma única imagem. Mas eles lutam para conectar os pontos quando uma foto encontrada no meio de uma pesquisa precisa mudar todo o plano de busca. Eles frequentemente ficam presos procurando texto quando deveriam estar olhando para uma foto, ou tratam a foto apenas como uma "verificação final" em vez de uma "nova pista".
O Kit de Ferramentas (InterLV-Agent)
Para garantir que todos estivessem jogando pelas mesmas regras, os autores construíram um "controle de jogo" padrão chamado InterLV-Agent. Esta ferramenta permite que a IA use um navegador web, pesquise imagens, recorte imagens e mantenha um "caderno" (memória) do que ela encontrou até agora. Isso garante que, quando dizemos que uma IA falhou, é porque ela não conseguiu resolver o quebra-cabeça, e não porque não tinha as ferramentas certas.
Resumo
Em termos simples, este artigo diz: "Construímos um novo teste mais difícil para detetives de IA. Descobrimos que, embora a IA esteja ficando mais inteligente, ela ainda não consegue usar efetivamente as imagens que encontra durante uma pesquisa para mudar de ideia e encontrar a próxima pista. É como um detetive que pode ler um mapa e olhar para uma foto, mas não consegue perceber que a foto realmente diz a ele para tomar um caminho diferente."
Os autores lançaram este teste e as ferramentas para que outros pesquisadores possam tentar construir uma IA que seja melhor neste estilo de pensamento "intercalado".
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.