← Últimos artigos
💻 computer science

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

Este estudo demonstra que grandes modelos de visão-linguagem, particularmente o GPT-4o e o Gemini Pro, podem aproximar eficazmente padrões de atenção visual humana em ambientes relevantes para a segurança sem exigir dados de rastreamento ocular, conforme evidenciado por fortes métricas de alinhamento espacial entre os mapas de saliência gerados pelo modelo e os mapas de calor de fixação ocular humana.

Autores originais: Marta Vallejo, Siwen Wang

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Marta Vallejo, Siwen Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está caminhando por uma rua movimentada de uma cidade. Seus olhos naturalmente se voltam para os pneus cantando de um carro que quase causou um acidente, para o trecho escorregadio de gelo na calçada ou para uma barreira de construção bloqueando o caminho. Você não precisa pensar sobre isso; seu cérebro é programado para notar perigos primeiro. Isso é chamado de viés de negatividade — somos programados para prestar atenção em ameaças.

Agora, imagine que você quer ensinar um computador superinteligente (uma IA) a fazer o mesmo. Você quer que ele olhe para uma imagem e diga: "Ei, olhe aqui! É aqui que um humano notaria um risco."

Este artigo faz uma pergunta simples: Será que uma IA moderna consegue "ver" o perigo da mesma forma que um humano, sem nunca ter sido ensinada através da observação dos olhos humanos?

O Experimento: Um Jogo de "Para Onde Você Está Olhando?"

Os pesquisadores montaram um jogo com dois times: Os Humanos e A IA.

Time Humano (Os Rastreadores Oculares):
Eles colocaram 10 estudantes universitários em uma sala e deram a eles óculos especiais (chamados Pupil Invisible) que funcionam como pequenas câmaras para os olhos. Esses óculos não apenas observam os estudantes; eles observam para onde os estudantes estão olhando.

  • Os estudantes olharam para 33 imagens diferentes de cenas cotidianas (como uma rua inundada, um cruzamento movimentado ou um parque tranquilo).
  • Algumas imagens tinham riscos óbvios (como um acidente de carro ou uma tempestade), enquanto outras eram seguras.
  • Os óculos registraram exatamente onde os olhos de cada estudante pousou, criando um "mapa de calor". Pense neste mapa de calor como uma foto de câmera térmica: quanto mais quente (brilhante) o ponto, mais pessoas olharam para lá.

Time IA (O Modelo de Visão-Linguagem):
Os pesquisadores então pegaram as mesmas 33 imagens e as mostraram para uma IA poderosa chamada GPT-4o.

  • Eles não treinaram a IA com os dados de rastreamento ocular. Eles não disseram: "Aqui é onde os humanos olharam".
  • Em vez disso, eles simplesmente perguntaram à IA: "Olhe para esta imagem. Se um humano estivesse olhando para ela por 10 segundos, para onde seus olhos iriam? Por favor, forneça as coordenadas dos pontos mais importantes."
  • A IA gerou seu próprio "mapa de calor" baseado no que ela considerava importante.

O Confronto: Comparando os Mapas

Os pesquisadores então sobrepuseram o Mapa de Calor Humano e o Mapa de Calor da IA para ver o quanto eles coincidiam. Eles usaram quatro diferentes "réguas" (testes matemáticos) para medir a sobreposição:

  1. O Teste "Eles são Semelhantes?" (Correlação de Pearson): A IA destacou as mesmas áreas gerais que os humanos?
    • Resultado: Sim, moderadamente bem. A IA e os humanos concordaram sobre as áreas gerais 51% das vezes.
  2. O Teste "Você Olhou Para Lá?" (NSS): Quando os humanos olharam para um ponto específico, a IA também achou que esse ponto era importante?
    • Resultado: Sim. A IA deu pontuações altas para os pontos exatos onde os humanos fixaram o olhar.
  3. O Teste "Correspondência de Forma" (Divergência KL): A distribuição de atenção da IA era semelhante à dos humanos?
    • Resultado: O GPT-4o foi, na verdade, o melhor em corresponder à forma da atenção humana, mesmo que outros modelos fossem ligeiramente melhores em localizar pontos exatos.
  4. O Teste "Identificar o Perigo" (AUC-Judd): Se você tivesse que adivinhar quais partes da imagem eram arriscadas, a IA conseguiria fazer isso melhor do que um palpite aleatório?
    • Resultado: Absolutamente. A IA obteve uma pontuação de 0,80 de 1,0, enquanto um palpite aleatório obteria apenas 0,5.

O Veredito

O estudo descobriu que o GPT-4o consegue "ver" riscos de segurança quase exatamente onde os humanos veem, mesmo sem nunca ter usado óculos de rastreamento ocular.

  • A Conexão com o "Viés de Negatividade": A IA parece ter aprendido de seu vasto conjunto de dados de treinamento (todos os textos e imagens que leu online) que os humanos tendem a focar em coisas assustadoras ou perigosas. Ela imita nosso "viés de negatividade" naturalmente.
  • Não é Apenas Um Modelo: Os pesquisadores também testaram outras IAs (como Gemini Pro e Claude). Todas fizeram melhor do que o acaso, mas o GPT-4o foi o melhor em corresponder ao padrão de atenção humana, enquanto o Gemini Pro foi ligeiramente melhor em localizar o ponto exato dos riscos.

Por Que Isso Importa (Segundo o Artigo)

O artigo conclui que podemos não precisar de óculos de rastreamento ocular caros para construir sistemas de segurança para robôs ou carros autônomos. Se um grande modelo de IA pode prever onde um humano olharia para o perigo apenas "pensando" sobre a imagem, podemos usar essa IA para ajudar as máquinas a navegar com segurança.

Em resumo: A IA não precisou ser ensinada como olhar; ela só precisou ser questionada, e ela percebeu que, assim como nós, deve prestar atenção nas coisas assustadoras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →