← 최신 논문
🤖 AI

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

이 논문은 기존의 시각 전용 데이터셋의 한계를 해결하면서 운전자 감정 인식, 피로 탐지 및 주의 분산 모니터링을 발전시키기 위해 대본이 있는 차량 내부 시나리오로부터 RGB, 적외선, 오디오 및 대화 텍스트를 통합한 포괄적인 멀티모달 데이터셋인 InCarEmo를 소개한다.

원저자: Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

게시일 2026-07-17
📖 2 분 읽기☕ 가벼운 읽기

원저자: Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 자동차를 운전하고 있다고 상상해 보세요. 그런데 단순히 핸들과 페달만 있는 것이 아니라, 당신의 차량이 성격을 갖기 시작했습니다. 이 차량은 당신이 행복한지, 피곤한지, 혹은 주의가 산만한지를 파악하여 당신의 안전을 지키는 데 도움을 주고 싶어 합니다. 이것이 바로 '감성 컴퓨팅(affective computing)'의 세계입니다. 이는 컴퓨터에게 인간의 감정을 이해하도록 가르치는 것을 뜻하는 멋진 용어입니다. 마치 단순한 내비게이션을 넘어, 도로뿐만 아니라 '당신'까지 읽어내는 초스마트 부조종사가 생기는 것과 같습니다. 오랫동안 과학자들은 당신의 얼굴을 보거나 목소리를 듣는 방식으로 이 부조립사를 만들려고 노력해 왔습니다. 하지만 문제가 하나 있습니다. 그들이 사용해 온 대부분의 학습 데이터는 흑백 영화와 같다는 점입니다. 얼굴만을 보여주거나 목소리만을 들려줄 뿐, 우리가 운전할 때 보통 누군가 혹은 무언가와 대화를 나누고 있다는 사실을 간과하곤 합니다. 이는 농담의 핵심인 결론(punchline)을 듣지 못한 채, 그저 말하는 사람의 입 모양만 보고 농담을 이해하려는 것과 같습니다. 진정으로 안전하고 공감 능력이 있는 자동차를 만들기 위해서는 전체적인 그림을 이해해야 합니다. 즉, 얼굴, 목소리, 단어, 그리고 심지어 대화의 분위기까지도 말입니다.

여기에 하얼빈 공업대학교와 SERES의 연구진이 개발한 새로운 프로젝트인 InCarEmo가 등장했습니다. 이 프로젝트는 자동차의 컴퓨터에 실제 운전 생활을 담은 풀 컬러 서라운드 영화를 건네주는 것과 같습니다. 연구팀은 기존의 데이터셋들이 중요한 퍼즐 조각 하나를 놓치고 있다는 사실을 깨달았습니다. 그것은 바로 차 안에서 실제로 일어나고 있는 '대화'입니다. 그들은 운전자가 도로를 바라보는 모습뿐만 아니라 교통 상황에 대해 이야기하거나, 여행 계획을 세우거나, 심지어 자동차 자체에 대해 논하는 순간들을 포착한 거대한 새로운 데이터 라이브러리인 InCarEmo를 구축했습니다. 그들은 고해상도 카메라(일반 카메라와 어둠 속에서도 볼 수 있는 적외선 카메라 모두 포함), 고품질 마이크, 그리고 실제로 발화된 정확한 텍스트를 사용하여 이 순간들을 기록했습니다.

이 논문은 이 데이터셋을 세 가지 주요 작업을 위한 도구 세트로 소개합니다. 운전자가 느끼는 감정(예: 분노나 불안)을 파악하는 것, 운전하기에 너무 피곤한 상태인지 포착하는 것, 그리고 휴대폰이나 음료로 인해 주의가 산만해졌는지 알아채는 것입니다. 이 새로운 데이터가 효과가 있는지 테스트하기 위해, 연구진은 CAMEL이라는 이름의 경량 AI 모델을 만들었습니다. 그 결과, AI가 시각, 청각, 텍 Medina(텍스트) 정보를 모두 함께 사용했을 때, 단 하나의 감각만을 사용할 때보다 운전자의 상태를 훨씬 더 잘 예측한다는 것을 발견했습니다. 예를 들어, 카메라가 어려움을 겪을 수 있는 저조도 환경에서도 오디오와 텍스트 단서들이 AI가 정확도를 유지할 수 있도록 도와주었습니다. 또한, 연구진은 전 세계 연구자들이 협력할 수 있도록 이 데이터의 특별한 영어 버전을 제작했으나, 언어 간에 감정을 번역하는 것이 까다롭다는 점도 언급했습니다. 궁극적으로 이 논문은 AI에게 운전자의 세계에 대한 더 풍부하고 현실적인 시야를 제공함으로써, 단순히 똑똑한 것을 넘어 진정으로 이해하고 모두를 위해 더 안전한 자동차를 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →