← 최신 논문
🤖 AI

DIPSER: A Dataset for In-Person Student Engagement Recognition in the Wild

본 논문은 다양한 교육 맥락에서 학생의 주의와 감정을 분석하기 위해 다중 뷰 RGB 카메라 데이터, 스마트워치 센서 지표, 그리고 다양한 전문가 검증 라벨을 독창적으로 결합한 대면 학생 참여 인식을 위한 새로운 포괄적인 현장 데이터셋인 DIPSER를 소개합니다.

원저자: Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosabel Roig-Vila, Miguel Cazorla

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosabel Roig-Vila, Miguel Cazorla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

학생이 수업 중 어떻게 느끼고 있는지, 혹은 얼마나 집중하고 있는지 이해하려고 상상해 보세요. 보통 교사는 빠른 한눈에 대고 추측해야 합니다. 이 논문은 가상이 아닌 실제 교실에서 일어나는 일을 정확히 포착하도록 설계된 고기술 "초과관찰자"와 같은 새로운 도구인 DIPSER를 소개합니다.

연구자들이 구축한 내용을 간단한 비유로 설명하면 다음과 같습니다:

1. "전지전능한 눈" 설정

교실을 무대라고 생각하세요. 과거 연구자들은 종종 거실 (온라인 수업) 이나 배우들이 학생 역할을 연기하는 무균 상태의 과학 실험실에서 학생들을 연구했습니다.

DIPSER는 다릅니다. 실제 대학생들과 실제 교실에서 촬영되었습니다. 전체 그림을 얻기 위해 "감시 군집"을 설치했습니다:

  • 광각 뷰: 보안 요원이 내려다보듯 카메라를 높은 곳에 매달아 전체 교실, 학생들의 자세, 그리고 서로의 상호작용을 볼 수 있게 했습니다.
  • 클로즈업 뷰: 각 학생은 책상에 전용 카메라를 하나씩 배치하여 눈썹을 치켜올리거나 찡그리는 것과 같은 미세한 표정을 포착하기 위해 얼굴에 초점을 맞췄습니다.
  • "맥박" 시계: 모든 학생은 스마트워치를 착용했습니다. 이는 피트니스 트래커처럼 작동하여 심박수, 움직임 정도 (자이로스코프), 그리고 얼마나 빠르게 떨리는지 (가속도계) 를 기록합니다.

2. "5 성" 평가 시스템

카메라와 시계가 진실을 말하고 있는지 어떻게 알 수 있을까요? 연구자들은 컴퓨터에만 의존하지 않고 "심사 위원회"를 사용했습니다.

모든 학생에 대해, 특정 순간에 학생이 얼마나 집중했거나 감정 상태인지에 대한 다섯 가지 다른 의견을 수집했습니다:

  1. 학생 자신의 목소리: 수업 후 학생은 영상을 되돌아보며 스스로 평가했습니다.
  2. 네 명의 전문가 심사위원: 네 명의 다른 인간 전문가가 영상을 시청하고 각자의 평점을 매겼습니다.

이들을 결합하여 영상 매 초마다 "골드 스탠다드" 라벨을 만들었습니다. 학생이 지루하다고 말했고 전문가들이 동의하면, 데이터는 "지루함"으로 표시됩니다.

3. "아홉 장면" 연극

데이터는 단순히 하나의 긴 지루한 강연이 아니었습니다. 연구자들은 학생들을 아홉 가지 다른 유형의 학교 활동을 거치도록 촬영했는데, 이는 연극의 장면과 같습니다:

  • 뉴스 읽기.
  • 아이디어 브레인스토밍.
  • 전통적인 강연 듣기.
  • 스마트폰으로 퀴즈 풀기.
  • 프로젝트 발표하기.
  • 로봇과 놀기.
  • 교육용 게임 디자인하기.

이 다양성은 자동차가 고속도로, 흙길, 레이싱 트랙에서 주행하여 다양한 조건을 어떻게 처리하는지 테스트하는 것과 같습니다.

4. 거대한 도서관

결과는 130 만 장 이상의 이미지와 거의 52 시간 분량의 영상을 포함한 거대한 디지털 도서관입니다.

  • 원본 영상을 포함합니다.
  • 스마트워치 데이터 (심장 박동, 움직임) 를 포함합니다.
  • 컴퓨터가 이미 얼굴 주위에 상자를 그리고, 나이를 추정하며, 감정을 추측하여 다른 연구자들의 시간을 절약해 주는 "미리 포장된" 데이터를 포함합니다.

5. 이것이 중요한 이유 (논문에 따르면)

저자들은 이전 데이터셋이 실제 생활을 반영하지 않는 "모의고사"(온라인 또는 가짜 실험실) 와 같았다고 주장합니다.

  • 현실성: 이는 "야생에서"(실제 교실) 촬영되었습니다.
  • 다양성: 다양한 배경을 가진 학생들을 포함합니다 (이 버전에서는 구체적으로 백인 피험자를 언급하지만, 추후 더 많은 다양성을 추가할 계획입니다).
  • 심도: 실제 교실 환경에서 비디오, 스마트워치 센서, 그리고 여러 인간 전문가를 결합한 첫 번째 사례입니다.

결론

이 논문은 DIPSER를 새롭고 방대하며 매우 상세한 데이터셋으로 제시합니다. 이는 실제 학교 환경에서 인간의 주의와 감정을 이해하도록 기계를 가르치고자 하는 컴퓨터 과학자들을 위한 도구상자입니다. 저자들은 이 데이터를 다른 연구자들이 사용할 수 있도록 제공하여, 해당 도구들이 제품 판매가 아닌 학술 연구 목적으로 사용된다는 전제 하에 더 나은 AI 도구를 구축할 수 있도록 했습니다.

참고: 이 논문은 완전히 이 데이터셋을 생성하고 검증하는 데 초점을 맞추고 있습니다. 이 시스템이 현재 학생들을 평가하거나, 의학적 상태를 진단하거나, 학교 운영 방식을 변경하는 데 사용된다고 주장하지 않습니다. 이는 엄격히 연구를 위한 자원입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →