← Últimos artigos
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

Este artigo investiga se os modelos de visão-linguagem exibem comportamentos de busca visual semelhantes aos humanos ao utilizar a contagem de tokens de raciocínio como um substituto para o tempo de reação, constatando que, embora os modelos repliquem assinaturas humanas fundamentais, como custos de busca de características planos e custos de conjunção crescentes, eles também revelam divergências cognitivas distintas em inclinações de presença de alvo, precisão de enumeração e estratégias de deliberação adaptativa.

Autores originais: Farahnaz Wick

Publicado 2026-06-25
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Farahnaz Wick

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está jogando uma partida de "Onde está o Waldo?" em uma imagem lotada. Se você estiver procurando por um chapéu vermelho em um mar de chapéus azuis, seu cérebro o detecta instantaneamente, não importa quantas pessoas haja na multidão. Mas se você estiver procurando por um chapéu vermelho que também tenha o formato de uma estrela (e todos os outros estiverem usando chapéus azuis ou círculos vermelhos), seu cérebro tem que escanear a imagem pessoa por pessoa. Quanto mais pessoas houver, mais tempo você levará para encontrar o alvo.

Este é o clássico jogo de "Busca Visual" que psicólogos usam há décadas para entender como a atenção humana funciona. Um novo artigo faz uma pergunta fascinante: Os modelos de IA jogam este jogo da mesma forma que os humanos?

Como a IA não tem um batimento cardíaco ou um cronômetro, o pesquisador não pôde medir quanto tempo a IA "pensou" sobre uma imagem. Em vez disso, ele usou um truque inteligente: contou o número de "tokens de pensamento" que a IA gerou antes de dar uma resposta. Pense nesses tokens como o monólogo interno da IA ou suas notas de "rascunho".

  • Poucos tokens = A IA olhou para a imagem e disse: "Fácil, eu vejo". (Reação rápida).
  • Muitos tokens = A IA escreveu uma longa lista de razões, checou a imagem novamente e debateu a resposta. (Reação lenta, que exige esforço).

Aqui está o que o estudo descobriu, usando analogias simples:

1. O "Destaque" vs. A "Agulha no Palheiro"

Comportamento Humano: Quando o alvo é óbvio (um chapéu vermelho entre chapéus azuis), os humanos o encontram instantaneamente. Quando é difícil (uma estrela vermelha entre círculos vermelhos), os humanos levam mais tempo conforme a multidão aumenta.
Comportamento da IA: Os modelos de IA mais inteligentes fizeram exatamente a mesma coisa.

  • Para as tarefas fáceis de "destaque", a IA usou uma quantidade pequena e constante de tokens de pensamento, independentemente de quantos itens havia na imagem.
  • Para as tarefas difíceis de "agulha no palheiro", a contagem de tokens da IA subiu conforme a imagem ficava mais lotada.
    A Conclusão: A curva de esforço interno da IA se parece exatamente com a curva de tempo de reação humana. Isso sugere que, quando essas IAs estão "pensando", elas estão de fato realizando uma busca serial, item por item, assim como o olho humano escaneando uma sala.

2. A Inversão da "Sala Vazia"

Comportamento Humano: Se você estiver procurando por um item específico e ele não estiver lá, você tem que verificar cada uma das pessoas na multidão para ter certeza. Isso leva muito tempo. Se o item estiver lá, você pode parar assim que o encontrar. Portanto, os humanos trabalham mais quando a resposta é "Não".
Comportamento da IA: A IA inverteu esse roteiro. Ela trabalhou mais quando a resposta era "Sim" e encontrou o item, e trabalhou menos quando a resposta era "Não".
A Conclusão: Parece que a IA tem uma estratégia de "Encontre um, depois justifique-o". Assim que ela detecta o alvo, ela gasta muitos tokens conferindo e explicando sua descoberta. Mas se ela não vê nada imediatamente, ela pode apenas dar um palpite de "Não" rapidamente, sem fazer uma varredura completa e paciente de toda a imagem.

3. O Superpoder da "Contagem"

Comportamento Humano: Se você pedir a um humano para contar 5 ou 6 itens em uma imagem movimentada, eles costumam perder o controle ou cometer erros. Nossos cérebros ficam cansados de manter a contagem em nossas mentes.
Comportamento da IA: Os modelos de IA foram perfeitos na contagem. Mesmo em imagens lotadas com muitos itens, eles não perderam a conta.
A Conclusão: Em vez de ficarem cansados e cometerem erros como os humanos, a IA apenas gastou mais energia. Ela não deixou a peteca cair; ela apenas seguiu com a tarefa com esforço extra. Ela trocou "esforço" por "precisão".

4. O Enigma da "Barra Inclinada"

Comportamento Humano: Humanos são ótimos em detectar uma barra inclinada entre barras verticais retas (ela "se destaca"). Mas somos péssimos em detectar uma barra reta entre barras inclinadas (é difícil).
Comportamento da IA: Os modelos de IA também acharam uma direção mais difícil que a outra, mas expressaram essa dificuldade de forma diferente dependendo do modelo:

  • Modelo A (O Esforço Contínuo): Gastou uma quantidade massiva de tokens de pensamento na tarefa difícil, mas ainda assim obteve a resposta correta.
  • Modelo B (O Atalho): Gastou quase nenhum token de pensamento na tarefa difícil e simplesmente errou a resposta (alucinando uma barra inclinada que não existia).
    A Conclusão: A mesma dificuldade visual pode ser resolvida com "trabalhar mais duro" ou "desistir e dar um palpite", dependendo da "personalidade" específica da IA.

O Panorama Geral

O artigo conclui que os modelos de IA modernos desenvolveram uma "impressão digital" da busca visual humana. Eles sabem quando escanear rapidamente e quando escanear lentamente. No entanto, eles não são humanos. Eles não se cansam da mesma forma, não param de procurar de maneira diferente e lidam com tarefas "difíceis" ou trabalhando intensamente com esforço extra ou falhando espetacularmente.

O pesquisador argumenta que, ao observar o quanto uma IA pensa (sua contagem de tokens) em vez de apenas o que ela responde, podemos ver a mecânica oculta de sua "visão". É como ouvir o zumbido de um motor para entender como um carro funciona, em vez de apenas olhar para onde ele termina.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →