← Últimos artigos
💻 computer science

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

Este trabalho propõe um método inovador para antecipar interações humano-objeto em vídeos egocêntricos utilizando Modelos de Linguagem Visuais (VLLMs), que combina a técnica Set-of-Mark para melhor ancoragem visual, o rastreamento de trajetórias de fixação ocular para inferir intenções e uma estratégia de amostragem exponencial inversa para capturar dinâmicas temporais, superando os métodos atuais no conjunto de dados HD-EPIC.

Autores originais: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

Publicado 2026-04-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está usando óculos inteligentes que conseguem ler a sua mente (ou pelo menos prever o que você vai fazer a seguir). É exatamente isso que os pesquisadores Daniele Materia, Francesco Ragusa e Giovanni Maria Farinella propõem no seu novo trabalho.

Eles criaram um "super-olho" digital para ajudar computadores a entenderem o que as pessoas vão fazer em vídeos gravados do ponto de vista delas (chamado de visão egocêntrica, como se fosse a visão de um GoPro na cabeça de alguém).

Aqui está a explicação simplificada, usando analogias do dia a dia:

O Grande Desafio: Adivinhar o Futuro

Pense em uma cozinha. Você está pegando uma faca. O computador precisa saber: "Será que essa pessoa vai cortar um tomate ou vai tentar abrir uma lata de conserva?"
Antes, os computadores eram como crianças pequenas: olhavam para a cena e tentavam adivinhar, mas muitas vezes erravam porque não entendiam o contexto ou não sabiam onde a pessoa estava olhando.

A Solução: O "Cérebro" com Óculos Especiais

Os autores usaram uma tecnologia chamada VLLM (Modelos de Linguagem Grande com Visão). Pense nisso como um cérebro de IA muito inteligente que já sabe ler e ver, mas que precisa de algumas dicas extras para não se perder.

Eles deram a esse cérebro três "superpoderes" (ou ferramentas) para acertar a previsão:

1. O Mapa de Destaque (Set-of-Mark)

Imagine que você está em uma sala cheia de objetos e alguém pede para você encontrar um copo. Se você apenas olhar para a sala, pode se confundir.
Agora, imagine que alguém coloca um adesivo brilhante em cima de cada objeto importante (copo, faca, panela).

  • Na prática: O computador usa uma ferramenta chamada Set-of-Mark para desenhar "máscaras" ou contornos ao redor dos objetos na última imagem do vídeo. Isso ajuda a IA a não se distrair com o fundo e focar exatamente no que pode ser tocado. É como se a IA recebesse um mapa com os alvos marcados.

2. O Rastro de Luz (Trajetória do Olhar)

Sabe quando você está prestes a pegar algo e seus olhos já foram até lá antes da sua mão? Isso é o olhar.

  • Na prática: O sistema não olha apenas para a imagem estática. Ele desenha uma "trilha de luz" na tela, mostrando para onde os olhos da pessoa olharam nos últimos segundos.
    • Círculos Vermelhos: Onde a pessoa olhou mais recentemente (o alvo provável).
    • Círculos Azuis: Onde a pessoa olhou antes.
    • Isso funciona como um "rastro de migalhas" que diz para a IA: "Ei, a pessoa estava olhando para o ovo, então é muito provável que ela vá quebrar o ovo, não a panela!"

3. O Filtro de Tempo Inteligente (Amostragem Inversa Exponencial)

Vídeos têm muitos quadros (imagens por segundo). Mostrar 100 quadros para a IA é como tentar ler um livro inteiro para responder a uma pergunta sobre o último parágrafo. É cansativo e confuso.

  • Na prática: Em vez de mostrar tudo, o sistema escolhe os quadros mais importantes. Ele usa uma estratégia matemática inteligente para focar mais nos momentos logo antes da ação acontecer e menos no início do vídeo.
    • Imagine que você está assistindo a um filme de suspense. Você não precisa ver os créditos iniciais; você quer ver a cena do clímax. O sistema faz isso: ele "pula" o começo e foca no momento crucial onde a ação vai acontecer.

O Resultado: O Campeão de Adivinhação

Os pesquisadores testaram essa ideia no HD-EPIC, um banco de dados gigante de vídeos de cozinhas e atividades diárias.

  • O Antigo: Os melhores sistemas anteriores acertavam cerca de 21% das vezes.
  • O Novo (Com os 3 superpoderes): O sistema deles acertou 27,5% das vezes.

Pode parecer pouco, mas em inteligência artificial, ganhar 5 ou 6 pontos é como passar de um aluno mediano para o primeiro da turma. O sistema se tornou o melhor do mundo nessa tarefa específica.

Por que isso é importante?

Isso não é apenas um truque de laboratório. Imagine:

  • Cozinhas inteligentes: O sistema avisa: "Cuidado! Você vai pegar a panela quente sem luva!" antes que você se queime.
  • Fábricas: Ele pode alertar um trabalhador que ele está prestes a pegar uma ferramenta errada que pode causar um acidente.
  • Robôs de ajuda: Um robô pode entregar o objeto certo para você antes mesmo de você pedir, porque ele "leu" o seu olhar e a sua intenção.

Resumo Final

Os autores criaram um sistema que ensina a IA a olhar para onde você olha e a focar nos momentos certos, usando "adesivos" para identificar objetos. É como dar a um detetive um mapa, uma lupa e um relógio sincronizado para resolver o mistério do que você vai fazer a seguir. E o melhor: eles liberaram o código para que outros pesquisadores possam usar e melhorar essa tecnologia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →