← Últimos artigos
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

O DeepGaze3.5-VL estabelece um novo estado da arte na predição de trajetórias de varredura visual ao reformular a tarefa como geração autoregressiva de tokens dentro de um Modelo de Visão-Linguagem, permitindo o condicionamento flexível em identidades de observadores e tarefas, ao mesmo tempo em que alcança ganhos significativos de desempenho e facilita simulações comportamentais in-silico controladas.

Autores originais: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Publicado 2026-07-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine tentar prever para onde os olhos de uma pessoa olharão em seguida ao ver uma imagem. Por muito tempo, cientistas construíram máquinas especiais e rígidas apenas para esse trabalho. Essas máquinas tinham regras fixas (como "as pessoas sempre olham para o centro primeiro") e não podiam aprender truques novos facilmente, como "esta pessoa é um médico procurando um diagnóstico" ou "esta pessoa é uma criança procurando um brinquedo".

O artigo apresenta um novo modelo chamado DeepGaze3.5-VL que muda o jogo. Em vez de construir uma máquina especial, os autores tratam os movimentos oculares como se estivessem escrevendo uma história.

Aqui está a divisão de como isso funciona e o que eles descobriram, usando analogias simples:

1. A Ideia Central: Movimentos Oculares como uma História de "Texto"

Pense no caminho dos olhos de uma pessoa (chamado de scanpath) como uma frase.

  • O jeito antigo: Você construía um robô personalizado para desenhar a frase, mas se quisesse mudar o estilo (por exemplo, de uma caligrafia de criança para uma de adulto), você tinha que reconstruir o robô.
  • O jeito novo: Os autores perceberam que os movimentos oculares são apenas uma sequência de coordenadas (como "olhe aqui, depois olhe ali"). Eles ensinaram um enorme modelo de IA pré-treinado (um Grande Modelo de Visão-Linguagem) a tratar essas coordenadas como palavras em uma frase.

Ao transformar as posições do olhar em "tokens" (como letras em uma palavra), a IA pode usar seu céreão gigante — já treinado para entender imagens e linguagem — para prever a próxima "palavra" (o próximo lugar para onde o olho olhará).

2. A "Magia" do Prompt

Como este modelo pensa em linguagem, você pode dar instruções a ele exatamente como faria com um chatbot.

  • A Analogia: Imagine um guia turístico. Se você disser ao guia, "Mostre-me o museu como um turista", ele mostrará as estátuas famosas. Se você disser "Mostre-me como um historiador de arte", ele apontará para as pinceladas.
  • O Resultado: Os pesquisadores mostraram que, ao simplesmente alterar o prompt de texto (por exemplo, "Preveja o olhar de uma pessoa procurando por um gato" versus "Preveja o olhar de uma pessoa apenas olhando ao redor"), o modelo se adapta instantaneamente. Ele não precisa de novo hardware ou mudanças complexas de código; ele apenas lê a instrução.

3. Por que é Melhor: O Debate "Inteligente" vs. "Grande"

Os pesquisadores perguntaram: Este modelo é bom apenas porque é enorme, ou porque ele realmente entende a cena?

  • O Teste: Eles compararam seu modelo com outros modelos de topo que usavam exatamente os mesmos "olhos" (codificador de visão), mas com "cérebros" diferentes.
  • A Descoberta: O "cérebro" (a parte de linguagem da IA) importa mais do que apenas ter "olhos" maiores. Um modelo que entende o significado da imagem e a história do movimento ocular tem um desempenho muito superior a um modelo que apenas vê pixels.
  • A Pontuação: Em um teste padrão (MIT1003), o modelo deles melhorou a precisão da previsão em 46% em comparação com o método anterior mais eficaz.

4. O Experimento da "Máquina do Tempo" (Intervenções)

Uma das coisas mais legais que o artigo demonstra é a capacidade de rodar cenários de "e se" dentro do computador, sem a necessidade de humanos reais.

  • A Analogia: Imagine um videogame onde você pode pausar o tempo, mudar uma variável (como "o jogador estava cansado") e ver instantaneamente como o jogo se desenrola de forma diferente.
  • O Experimento: Os pesquisadores pegaram um momento específico em que um humano olhou para uma imagem por um curto período (50ms) e perguntaram ao modelo: "E se eles tivessem olhado por um longo tempo (600ms) em vez disso?"
  • O Resultado: O modelo previu que olhares curtos tendem a ser lampejos rápidos e instintivos (como um reflexo), enquanto olhares longos levam a uma exploração mais errante e pensativa. O modelo compreendeu esses comportamentos humanos complexos puramente lendo os dados, agindo como um sandbox digital para a visão humana.

5. O Fator "Quem" (Personalização)

O modelo também pode ser informado sobre quem está olhando.

  • A Analogia: Se você sabe que seu amigo ama cachorros, e você mostra a ele uma foto de um parque, você sabe que ele olhará para o cachorro primeiro. Se você mostrar a mesma foto para alguém que ama pássaros, essa pessoa olhará para a árvore.
  • O Resultado: Ao alimentar o modelo com um "ID de Sujeito" específico (como "Subject A3F8"), ele aprendeu a prever os hábitos únicos dessa pessoa específica. Não foi necessário uma nova arquitetura; ele apenas aprendeu que diferentes "personagens" têm diferentes "linhas de história".

Resumo

DeepGaze3.5-VL é uma nova maneira de prever para onde os humanos olham. Em vez de construir ferramentas especializadas e rígidas, os autores transformaram o rastreamento ocular em um problema de linguagem. Ao fazer isso, criaram um modelo que é:

  1. Mais Inteligente: Ele entende o contexto e o significado da cena.
  2. Flexível: Você pode mudar seu comportamento simplesmente digitando uma nova instrução.
  3. Preciso: Ele supera todos os recordes anteriores por uma margem ampla.
  4. Experimental: Ele permite que cientistas simulem cenários de "e se" sobre a visão humana instantaneamente, sem precisar realizar novos experimentos físicos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →