← Últimos artigos
🤖 AI

DIPSER: A Dataset for In-Person Student Engagement Recognition in the Wild

Este artigo apresenta o DIPSER, um conjunto de dados inovador e abrangente para o reconhecimento de engajamento estudantil em situações reais, que combina de forma única dados de câmeras RGB multiview, métricas de sensores de smartwatch e diversas etiquetas validadas por especialistas para facilitar a análise da atenção e das emoções dos estudantes em vários contextos educacionais.

Autores originais: Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosabel Roig-Vila, Miguel Cazorla

Publicado 2026-05-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosabel Roig-Vila, Miguel Cazorla

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine tentar entender como um aluno está se sentindo ou quão focado ele está durante uma aula. Geralmente, os professores precisam adivinhar com base em um olhar rápido. Este artigo apresenta uma nova ferramenta chamada DIPSER, que é como um "superobservador" de alta tecnologia projetado para capturar exatamente o que está acontecendo em uma sala de aula real, não em uma falsa.

Aqui está uma explicação do que os pesquisadores construíram, usando analogias simples:

1. O Configuração "Olho que Tudo Vê"

Pense na sala de aula como um palco. No passado, os pesquisadores frequentemente estudavam alunos a partir de suas salas de estar (aulas online) ou em laboratórios científicos estéreis onde atores fingiam ser alunos.

DIPSER é diferente. Foi filmado em uma sala de aula universitária real com alunos reais. Para obter a imagem completa, eles montaram um "enxame de vigilância":

  • A Visão de Grande Angular: Eles penduraram câmeras no alto (como um guarda de segurança olhando de cima) para ver toda a sala, as posturas dos alunos e como eles interagem entre si.
  • A Visão de Close-up: Cada aluno tinha sua própria câmera dedicada em sua mesa, dando zoom em seu rosto para capturar expressões minúsculas (como uma sobrancelha levantada ou um franzir de testa).
  • O Relógio do "Pulso": Cada aluno usava um smartwatch. Isso age como um rastreador de fitness, registrando sua frequência cardíaca, o quanto se moveram (giroscópio) e o quão rápido estavam se agitando (acelerômetro).

2. O Sistema de Classificação "Cinco Estrelas"

Como saber se as câmeras e os relógios estão dizendo a verdade? Os pesquisadores não confiaram apenas em computadores; eles usaram um "painel de juízes".

Para cada aluno, eles reuniram cinco opiniões diferentes sobre o quão focado ou emocional o aluno estava a qualquer segundo:

  1. A Própria Voz do Aluno: Após a aula, o aluno revisou o vídeo e se avaliou.
  2. Quatro Juízes Especialistas: Quatro especialistas humanos diferentes assistiram às filmagens e deram suas próprias classificações.

Eles combinaram essas opiniões para criar um rótulo "padrão-ouro" para cada segundo do vídeo. Se um aluno disse que estava entediado e os especialistas concordaram, os dados são marcados como "entediado".

3. A Peça "Nove Cenas"

Os dados não foram apenas uma longa e chata aula expositiva. Os pesquisadores filmaram os alunos passando por nove tipos diferentes de atividades escolares, como cenas em uma peça:

  • Lendo notícias.
  • Brainstorming de ideias.
  • Ouvindo uma aula tradicional.
  • Fazendo um teste em seus telefones.
  • Apresentando projetos.
  • Brincando com robôs.
  • Projetando jogos educacionais.

Essa variedade é como testar um carro em uma rodovia, em uma estrada de terra e em uma pista de corrida para ver como ele lida com diferentes condições.

4. A Biblioteca Massiva

O resultado é uma biblioteca digital massiva contendo mais de 1,3 milhão de imagens e quase 52 horas de vídeo.

  • Inclui o vídeo bruto.
  • Inclui os dados do smartwatch (batimentos cardíacos, movimentos).
  • Inclui dados "pré-embalados" onde computadores já desenharam caixas ao redor dos rostos, estimaram idades e adivinharam emoções, economizando tempo para outros pesquisadores.

5. Por Que Isso Importa (De Acordo com o Artigo)

Os autores argumentam que conjuntos de dados anteriores eram como "provas de prática" (online ou laboratórios falsos) que não refletiam a vida real.

  • Realismo: Isso foi filmado "na natureza" (uma sala de aula real).
  • Diversidade: Inclui alunos de diferentes origens (notando especificamente sujeitos caucasianos nesta versão, embora planejem adicionar mais diversidade posteriormente).
  • Profundidade: É o primeiro a combinar vídeo, sensores de smartwatch e múltiplos especialistas humanos em um ambiente de sala de aula real.

A Conclusão

O artigo apresenta DIPSER como um novo conjunto de dados massivo e altamente detalhado. É uma caixa de ferramentas para cientistas da computação que desejam ensinar máquinas a entender a atenção e a emoção humanas em ambientes escolares do mundo real. Os autores tornaram esses dados disponíveis para outros pesquisadores para que possam construir melhores ferramentas de IA, desde que essas ferramentas sejam usadas para estudo acadêmico e não para venda de produtos.

Nota: O artigo foca inteiramente na criação e validação deste conjunto de dados. Não afirma que este sistema está sendo usado atualmente para classificar alunos, diagnosticar condições médicas ou alterar a forma como as escolas são administradas; é estritamente um recurso para pesquisa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →