← 최신 논문
💻 computer science

YawDD+: Frame-level Annotations for Accurate Yawn Prediction

본 논문은 거친 비디오 수준 레이블의 한계를 극복하고 엔비지아 제트슨 나노 및 AGX 와 같은 엣지 장치에서 매우 정확하고 효율적인 실시간 운전자 피로도 감지를 가능하게 하기 위해 반자동 파이프라인을 통해 생성된 프레임 단위 주석이 포함된 데이터셋인 YawDD+ 를 소개합니다.

원저자: Ahmed Mujtaba, Gleb Radchenko, Marc Masana, Radu Prodan

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahmed Mujtaba, Gleb Radchenko, Marc Masana, Radu Prodan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차 운전자가 하품을 할 때 잠들고 있는지 로봇이 인식하도록 가르친다고 상상해 보세요. 문제는 로봇이 학습하는 데 사용된'교과서'가 매우 성급한 교사에 의해 작성되었다는 점입니다.

문제: "전체 영상"오류

과거 연구자들은 YawDD라는 데이터 세트를 사용했습니다. 이 데이터 세트를 마치 교사가 단순히"이 전체 영상은 하품에 관한 것이다"라고 버튼을 누른 영화 파일처럼 생각하세요.

하지만 실제로 운전자는 30 초 분량의 영상 내내 하품을 하지 않습니다. 2 초간 하품을 하다가 승객과 대화하고, 미소를 짓고, 정상적으로 운전할 수 있습니다. 전체영상을"하품"으로 라벨링함으로써 교사는 실수로 로봇에게 대화와 미소가 졸음의 징후라고 가르친 셈입니다. 이는 마치"식사"를"테이블에 앉아 있는 것"으로 아이에게 가르쳐, 아이가 그냥 앉아 있을 때도 식사를 한다고 생각하게 만드는 것과 같습니다.이"노이즈"는 로봇을 혼란스럽게 하여 정확도를 떨어뜨리고 실수를 유발했습니다.

해결책: "프레임별"수사관

이 논문의 저자들은 교과서를 수정하기로 결정했습니다. 그들은 **YawDD+**라는 새롭고 업그레이드된 데이터 세트를 만들었습니다.

전체 영상을 라벨링하는 대신, 그들은 반자동 파이프라인(스마트 조립 라인)을 구축하여 마치 단일 프레임을 하나씩살펴보는 (플립북의 개별 사진을 보는 것과 같은) 수사관처럼 작동하도록 했습니다.

  1. 로봇 보조원: 먼저 컴퓨터 프로그램이 영상을 스캔하여 운전자의 얼굴을 찾고, 구체적으로 입 주변으로 확대합니다.
  2. 빠른 분류: 경량 AI 모델이 그 입을 보고"하품처럼 크게 열려 있거나, 평소처럼 닫혀 있는가?"라고 추측합니다. 이 모델은 80% 의 경우 매우 확신을 가지고 판단합니다.
  3. 인간 확인: 로봇이 확신이 없는 어려운 20%(조명이 나쁘거나 입이 반쯤 열린 경우 등) 에는 인간이 개입하여 답변을 검증합니다.

이 과정을 통해 데이터가 정제되어"노이즈"가 제거되었고, 로봇은 하품이 언제 일어나고 언제 일어나지 않는지에 대해 결정적으로 명확한 그림을 갖게 되었습니다.

결과: 초고속 온보드 뇌

연구자들은 데이터 정제뿐만 아니라 이 새로운 방법이 클라우드의 거대하고 비싼 서버가 아닌 차량 내부의 작은 컴퓨터(구체적으로 NVIDIA Jetson 같은 장치) 에서 실행될 수 있는지 테스트했습니다.

구식 방법은 다른 나라의 슈퍼컴퓨터를 이용해 퍼즐을 푸는 것처럼, 데이터를 왕복시키는 데 시간이 걸리는 것과 같습니다. 반면 새로운 방법은 운전석 바로 옆에 퍼즐 해결 천재가 앉아 있는 것과 같습니다.

그들이 달성한 성과는 다음과 같습니다:

  • 높은 정확도: 정제된 프레임별 데이터를 사용하여 하품을 포착하는 모델의 성능이 크게 향상되었습니다. 하품 분류 정확도는 **99.34%**에 달했고, 입 위치 감지 정확도는 **95.69%**였습니다. 이는 이전의 노이즈가 많은 방법보다 최대 6% 까지 개선된 상당한 상승입니다.
  • 속도: 시스템은 놀라울 정도로 빠릅니다. 작은 차량 컴퓨터에서 초당 115 프레임을 처리할 수 있습니다. 이는 거의 즉시 결정을 내릴 수 있음을 의미하며, 이는 안전에 매우 중요합니다.
  • 효율성: 이 모델들은 작은 차량 컴퓨터에서 직접 훈련되었습니다. 모델 한 사이클을 훈련하는 데 9 분 미만이 걸렸습니다. 이는 거대한 클라우드 서버가 아닌 차량 내부에서 바로 스마트한 운전자가 모니터링 시스템을 구축할 수 있음을 입증합니다.

왜 중요한가

이 논문은 단순히"교과서"(데이터 라벨) 를 더 정밀하게 수정함으로써 가볍고 단순한 AI 모델이 챔피언처럼 수행할 수 있게 되었다고 결론지었습니다. 이는 자동차가 이제 오프라인에서 작동하고, 개인정보 보호를 존중하며(영상은 차량을 떠나지 않음), 운전자를 안전하게 유지하기 위해 즉시 반응하는 내장형 실시간"졸음 감지기"를 갖게 될 수 있음을 의미합니다.

저자들은 또한 이"정리"방법이 유사한 행동을 구별해야 하는 다른 작업에도 사용될 수 있다고 언급했지만, 여기에서의 주요 초점과 성공 사례는 엄격하게 에지 장치에서 운전 피로도 감지의 정확성과 속도를 높이는 것에 관한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →