← Últimos artigos
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

O artigo apresenta o EgoCoT-Bench, um benchmark de vídeo egocêntrico de granularidade fina que contém 3.172 pares de perguntas e respostas verificáveis com anotações explícitas de raciocínio passo a passo, projetado para avaliar e aprimorar as capacidades de raciocínio fundamentado e centrado em operações dos Modelos de Linguagem Multimodal de Grande Escala.

Autores originais: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um vídeo de alguém cozinhando a partir do próprio ponto de vista (como se estivesse usando uma GoPro na testa). Você vê mãos pegando uma faca, uma panela e uma colher. Agora, imagine que você pergunta a um robô de IA superinteligente: "Onde está o saleiro depois que o chef o coloca?"

O robô pode dizer: "Está no balcão." E pode estar certo! Mas eis o problema: o robô realmente viu o saleiro se mover até lá, ou ele apenas chutou?

Este é o problema que o artigo EgoCoT-Bench está tentando resolver.

O Problema: O Robô do "Chute Afortunado"

Atualmente, muitos modelos de IA são como alunos que memorizam o gabarito, mas não entendem a matemática. Eles podem olhar para um vídeo e dar a resposta correta a uma pergunta, mas sua explicação (seu "raciocínio") pode ser inventada, inconsistente ou baseada em coisas que na verdade não aconteceram no vídeo.

No mundo dos vídeos em "Primeira Pessoa" (Egocêntricos), isso é extra difícil porque:

  • Mãos frequentemente bloqueiam a visão.
  • Objetos desaparecem e reaparecem.
  • A câmera treme e se move violentamente.

Os testes existentes para IA apenas verificam se a resposta final está correta. Este artigo diz: "Isso não é suficiente! Precisamos verificar se a história da IA sobre o que aconteceu é realmente verdadeira em relação ao vídeo."

A Solução: EgoCoT-Bench (O Teste "Detetive da Verdade")

Os autores criaram um novo teste superdetalhado chamado EgoCoT-Bench. Pense nele como uma "prova de habilitação" para IA, mas em vez de dirigir um carro, a IA precisa entender um vídeo de alguém realizando tarefas com as mãos.

Como eles o construíram:

  1. O Mapa (STSG): Em vez de apenas assistir ao vídeo, eles primeiro construíram um "mapa" do vídeo. Este mapa rastreia cada objeto, cada mão e cada segundo de tempo, como um roteiro detalhado de uma peça de teatro.
  2. As Perguntas: Eles usaram esse mapa para criar 3.172 perguntas. Estas não são apenas perguntas do tipo "De que cor é a xícara?". São perguntas complicadas como: "A mão pegou a xícara azul às 1:00, depois a xícara vermelha às 1:05. Qual delas estava na mesa às 1:03?"
  3. A Prova: Cada pergunta vem com um "recibo". O teste inclui o horário exato, a localização e a prova visual necessária para respondê-la. Assim, podemos verificar se o raciocínio da IA corresponde ao recibo.

Os 4 Tipos de Desafios

O teste é dividido em quatro categorias principais, como níveis em um videogame:

  1. Identificar a Ação (Ancoragem e Percepção): "O que a mão está tocando agora?" (A IA consegue ver o que está acontecendo agora?)
  2. A Máquina do Tempo (Retrospecção): "Onde estava a colher antes da mão pegá-la?" (A IA consegue lembrar o passado?)
  3. O Vidente (Previsão e Inferência Causal): "A mão está segurando a tampa. O que acontecerá a seguir?" ou "Por que o café derramou?" (A IA consegue adivinhar o futuro ou explicar a causa?)
  4. A Visão Geral (Raciocínio de Alto Nível): "O chef terminou de fazer o sanduíche, ou há mais um passo?" (A IA consegue entender o objetivo completo?)

O Que Aconteceu Quando Eles Testaram a IA?

Os autores pegaram os modelos de IA mais inteligentes disponíveis (como GPT-5, Qwen e LLaVA) e os submeteram a este teste. Eis o que descobriram:

  • O Fenômeno do "Chute Afortunado": Muitos modelos acertaram a resposta (por exemplo: "A garrafa está na prateleira"), mas, quando perguntados por que, sua explicação estava errada. Eles podiam dizer: "Porque vi uma garrafa", quando o vídeo na verdade mostrava a garrafa sendo movida depois do horário da pergunta.
  • A Lacuna: Mesmo os melhores modelos de IA tiveram pontuação em torno de 60-70% de acertos. Humanos tiveram quase 96%. Isso significa que ainda há uma lacuna enorme entre a compreensão humana e a compreensão da IA quando se trata de observar mãos movendo coisas.
  • A Parte Mais Difícil: A IA estava ok em adivinhar o que acontece a seguir, mas péssima em rastrear a história de um objeto (como seguir uma etiqueta específica em uma camisa enquanto ela é puxada para fora).

A Conclusão

O artigo apresenta uma nova maneira de avaliar a IA. Em vez de apenas dar uma nota baseada na resposta final, eles agora avaliam o raciocínio também.

Eles descobriram que muitas IAs estão "corretas espúrias": elas acertam a resposta pelas razões erradas. Isso é perigoso porque, se você pedir a uma IA para ajudar um robô em uma cozinha, e a IA chutar a resposta certa, mas tiver a ideia errada de onde está a faca, o robô pode cortar algo que não deveria.

EgoCoT-Bench é uma ferramenta para forçar a IA a parar de chutar e começar a prestar atenção na evidência real do vídeo, passo a passo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →