HST-HGN: Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models for Global Fatigue Assessment
이 논문은 제한된 계산 자원 내에서 긴 시간적 의존성을 효과적으로 모델링하여 실시간 차량 내 운전자의 피로를 평가하기 위해, 고차원적 공간적 상호작용을 포착하는 이종 하이퍼그래프 네트워크와 선형 복잡도의 양방향 상태 공간 모델 (Bi-Mamba) 을 결합한 HST-HGN 을 제안합니다.
운전자의 피로를 감지하는 것은 마치 "잠들기 직전의 아주 작은 하품" 을 포착하는 것과 같습니다.
기존 방법 A (무거운 카메라): 고해상도 비디오를 계속 분석하려다 보니, 컴퓨터가 너무 많은 에너지를 써서 지쳐버립니다. (실시간으로 운전석에 달기엔 무겁습니다.)
기존 방법 B (단순한 연결): 눈과 입을 따로따로만 봅니다. 하지만 피로는 눈, 입, 얼굴 근육이 함께 움직일 때 나타납니다. 서로 연결된 관계를 제대로 보지 못해 "하품"을 "말하기"로 착각하기 쉽습니다.
🛠️ 2. 해결책: HST-HGN 의 3 단계 마법
이 새로운 시스템은 세 가지 핵심 기술로 구성되어 있습니다.
① "얼굴 지도"와 "감정 스티커"를 동시에 붙이다 (공간적 분석)
기존에는 얼굴의 뼈대 (점) 만 보거나, 피부 질감만 따로 봤습니다. 하지만 HST-HGN 은 두 가지를 한 번에 봅니다.
비유: 운전자의 얼굴을 지도 (Geometry) 와 스티커 (Texture) 로 생각해보세요.
지도: 입이 얼마나 벌어졌는지, 눈이 얼마나 감겼는지 (뼈대 구조).
스티커: 눈이 붉어졌는지, 입술이 떨리는지 (피부 질감).
초점 (Hypergraph): 보통은 "눈과 코"처럼 두 점만 연결하지만, 이 시스템은 "입, 볼, 눈"이 동시에 움직이는 그룹을 하나의 '초점 (Hyperedge)'으로 묶어 봅니다. 마치 여러 명이 손을 잡고 원을 이루는 것처럼, 얼굴 근육들이 어떻게 함께 움직이는지 파악하는 것입니다.
② "시간의 흐름"을 양방향으로 읽다 (Bi-Mamba)
피로는 갑자기 오는 게 아니라, "잠깐 눈을 감았다가" -> "하품을 시작해서" -> "다시 깨어남"까지 시간의 흐름이 중요합니다.
기존의 한계: 과거 (앞으로만 보는 것) 만 보면, "하품"이 시작되기 전의 신호를 놓치기 쉽습니다.
HST-HGN 의 방법:Bi-Mamba(양방향 상태 공간 모델) 를 사용합니다.
비유: 영화를 볼 때, 앞으로 재생도 하지만 뒤로 감기도 해보는 것과 같습니다.
과거의 신호와 미래의 신호를 모두 보고 "아, 이건 하품이구나!"라고 확신을 갖습니다. 또한, 이 방식은 계산량이 적어 컴퓨터가 가볍게 돌아갑니다. (마치 복잡한 수학 문제 대신 직관적인 추리로 빠르게 해결하는 것 같습니다.)
③ "불필요한 잡음"을 걸러내다 (스파스 샘플링)
운전 영상은 100% 피로한 게 아닙니다. 대부분은 평범한 운전 시간입니다.
비유: 긴 영화에서 하품이 나오는 장면 100 초만 잘라내어 분석하는 것과 같습니다.
전체 영상을 다 보는 게 아니라, 중요한 순간을 골라내어 분석하므로 속도가 매우 빠르고 정확합니다.
🎯 3. 왜 이 방법이 특별한가?
이 시스템은 두 가지 큰 장점을 가집니다.
정확도: "말하기"와 "하품하기"를 구별하는 데 탁월합니다. (예: 입을 벌리는 게 하품인지, 말인지 구분)
가벼움: 무거운 컴퓨터가 아니라, 차량 내부의 작은 칩 (에지 디바이스) 에도 설치할 수 있을 정도로 가볍습니다.
🏆 4. 결론: 운전자의 안전한 수호자
이 연구는 "얼굴의 미세한 움직임 (지도)" 과 "피부의 변화 (스티커)" 를 초연결 (Hypergraph) 로 묶고, 양방향 시간 분석 (Bi-Mamba) 으로 피로의 시작과 끝을 정확히 포착합니다.
결과적으로, 이 시스템은 가볍고 빠르면서도 매우 똑똑하여, 운전자가 졸음에 빠지기 직전에 "잠깐 멈추세요!" 라고 알려줄 수 있는 완벽한 실시간 피로 감지 시스템을 완성했습니다.
한 줄 요약:
"이 시스템은 운전자의 얼굴을 지도와 스티커로 동시에 분석하고, 과거와 미래를 모두 보며 피로를 감지하는 가볍고 똑똑한 AI입니다."
1. 연구 배경 및 문제 정의 (Problem)
배경: 운전 중 피로도 감지는 운전자와 보행자의 안전을 위해 필수적이지만, 하품 (yawning) 이나 미세 수면 (microsleep) 과 같은 행동은 점진적으로 발생하며 미묘한 얼굴 표정 변화를 동반합니다.
주요 문제점:
제한된 계산 자원: 엣지 디바이스 (차량 내장 시스템 등) 에서 실시간으로 작동하기 위해 경량화가 필요하지만, 기존 CNN 기반 모델은 계산 부하가 크고 머리 자세 변화에 민감합니다.
고차원 상호작용 모델링의 한계: 기존 GCN(그래프 합성곱 신경망) 은 쌍별 (pairwise) 관계만 모델링하여 얼굴 근육군의 고차원적 협력적 변형 (예: 하품 시 입과 눈의 동시 변화) 을 포착하는 데 한계가 있습니다.
장기 시간 의존성 및 효율성: Transformer 는 전역적 시간 의존성을 잘 포착하지만 O(T2)의 계산 복잡도로 인해 긴 비디오 처리 시 엣지 환경에 부적합합니다. 반면, RNN/LSTM 은 장기 기억 상실 (long-term forgetting) 문제가 있습니다.
행동 모호성: '말하기 (talking)'와 '하품 (yawning)'을 구별하는 것이 어렵고, 긴 시퀀스 내에서 중요한 순간을 정확히 식별하기가 힘듭니다.
2. 제안 방법론: HST-HGN (Methodology)
저자들은 **HST-HGN (Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models)**을 제안하여 위 문제들을 해결합니다. 전체 아키텍처는 세 가지 핵심 단계로 구성됩니다.
1 단계: 이종 특징 구성 (Heterogeneous Feature Construction)
글로벌 희소 샘플링 (Global Sparse Sampling): 긴 원본 비디오를 밀집된 슬라이딩 윈도우 대신, 전체 시퀀스를 대표할 수 있도록 균일하게 희소하게 샘플링하여 T프레임의 시퀀스를 생성합니다.
이중 스트림 특징 추출:
기하학적 스트림 (Geometry Stream): MediaPipe 를 통해 추출된 3D 얼굴 랜드마크 중 68 개 포인트를 선택하고, 3D 정규화 정렬 (3D Canonical Alignment) 기법을 적용하여 머리 회전 및 이동 (rigid pose) 을 제거하고 순수한 얼굴 근육 변형만 추출합니다.
텍스처 스트림 (Texture Stream): 눈 (좌/우) 과 입 주변 영역 (ROI) 을 잘라내어 경량 Micro-CNN 을 통해 텍스처 특징을 추출합니다. 이를 '텍스처 슈퍼 노드'로 정의합니다.
2 단계: 공간 동적 초그래프 모델링 (Spatial Dynamic Hypergraph Modeling)
이종 초그래프 (Heterogeneous Hypergraph): 68 개의 기하학적 노드와 3 개의 텍스처 슈퍼 노드를 결합하여 총 71 개의 노드로 구성된 이종 그래프를 형성합니다.
초엣지 (Hyperedge) 설계:
Geo-Geo Hyperedges: 기하학적 노드 간의 국소적 구조를 포착하기 위해 k-최근접 이웃 (k-NN) 기반의 초엣지를 구성합니다.
Tex-Geo Hyperedges (Star-topology): 텍스처 노드 (입, 눈) 를 중심으로 관련 기하학적 노드들을 연결하는 '별 (Star) 토폴로지'를 통해 국소적 텍스처 의미와 전역적 기하학적 구조를 융합합니다.
적응형 어텐션 풀링: 초그래프 합성곱 (HGNN Conv) 을 거친 후, 각 노드의 중요도를 학습하여 가중 합을 통해 프레임 단위의 특징 벡터로 압축합니다.
3 단계: 시간 진화 모델링 (Temporal Evolution Modeling)
Bi-Mamba 모듈: 기존 Transformer 의 O(T2) 복잡도 문제를 해결하기 위해 **Bidirectional State Space Model (Bi-Mamba)**을 도입합니다.
선형 복잡도: 선택적 스캔 (Selective Scan) 메커니즘을 사용하여 O(T)의 선형 복잡도로 긴 시퀀스를 처리합니다.
양방향 모델링: 순방향 (Forward) 과 역방향 (Backward) SSM 을 결합하여 과거와 미래의 문맥을 모두 고려합니다. 이는 하품의 시작, 정점, 종료와 같은 생리적 라이프사이클을 완전히 포착하고 '말하기'와 '하품'을 명확히 구분하는 데 기여합니다.
전역 최대 풀링: 128 프레임 시퀀스 내에서 가장 중요한 피로 신호를 추출하기 위해 평균 풀링 대신 전역 최대 풀링 (Global Max Pooling) 을 적용합니다.
최적화 전략
Focal Loss + Center Loss: 클래스 불균형 (피로도 데이터의 부족) 과 클래스 내 변이 (개인차, 자세) 를 해결하기 위해 두 손실을 결합합니다. Center Loss 는 클래스 내 특징을 밀집시키고 Focal Loss 는 분류가 어려운 경계 샘플에 가중치를 둡니다.
3. 주요 기여 (Key Contributions)
효율적인 전역 피로도 평가 프레임워크: 이종 초그래프와 양방향 SSM (Bi-SSM) 을 최초로 통합하여 선형 복잡도로 강력한 장기 비디오 모델링을 가능하게 함.
3D 정규화 기반 계층적 슈퍼 노드 토폴로지: 강체 자세 변형을 분리하고, 초엣지를 통해 국소적 텍스처 의미와 전역적 기하학적 구조를 고차원으로 융합하는 새로운 아키텍처 설계.
해석 가능성 및 모호성 해소: 약한 감독 하에서 피로 사건의 시간적 위치를 국소화할 수 있으며, '말하기'와 '하품' 간의 행동 모호성을 효과적으로 완화.
실시간 엣지 배포 가능성: 높은 정확도와 함께 극도로 낮은 계산 비용 (FLOPs) 을 달성하여 차량 내장 엣지 디바이스 배포에 적합함을 입증.
4. 실험 결과 (Results)
데이터셋: YawDD(주요), UTA-RLDD, FatigueView, DMD 등 다양한 실제 운전 피로도 데이터셋에서 평가.
성능 (YawDD 기준):
정확도 (Accuracy):98.57% (기존 SOTA 모델인 LiteFat 의 97.14% 보다 우위).
Macro F1-Score:98.28%.
기존 일반 비디오 모델 (VideoMAE, SlowFast) 과 도메인 특화 모델 (JHPFA-Net 등) 을 모두 압도했습니다.
효율성:
파라미터 수: 0.30 M (약 299K).
계산량 (FLOPs): 2.90 G (128 프레임 기준).
처리 속도: 26.45 Clips/s (25 FPS 실시간 요구사항 충족).
기존 모델 (VideoMAE 등) 에 비해 메모리 사용량과 지연 시간 (Latency) 이 획기적으로 감소했습니다.
Ablation Study:
3D 정렬, HGNN, 텍스처 융합, Bi-Mamba, 결합 손실 함수를 순차적으로 추가할수록 성능이 지속적으로 향상됨을 확인했습니다.
특히 Bi-Mamba 는 기존 RNN, Transformer 기반 모델보다 시간적 모델링에서 우월한 성능을 보였습니다.
t-SNE 시각화를 통해 Center Loss 가 클래스 간 거리를 벌리고 클래스 내 거리를 줄여 '말하기'와 '하품'을 명확히 분리함을 증명했습니다.
5. 의의 및 결론 (Significance)
이 논문은 **제한된 계산 자원 환경 (차량 엣지 디바이스)**에서 고정밀 실시간 피로도 감지를 실현하기 위한 새로운 패러다임을 제시합니다.
기술적 혁신: 고차원 상호작용을 모델링하는 초그래프와 장기 의존성을 효율적으로 처리하는 SSM(Mamba) 의 결합은 컴퓨터 비전 분야에서 새로운 접근법을 제시합니다.
실용성: 높은 정확도와 낮은 계산 비용의 균형을 이루어, 실제 차량 시스템에 적용 가능한 실용적인 솔루션을 제공합니다.
해석 가능성: 모델이 어떤 시점과 어떤 얼굴 부위에 집중하여 판단하는지 시각화함으로써, 블랙박스 모델의 한계를 극복하고 신뢰성을 높였습니다.
결론적으로 HST-HGN 은 복잡한 운전 환경에서 미세한 피로 신호를 포착하고 오인식을 줄일 수 있는 차세대 피로도 감지 시스템의 표준이 될 잠재력을 가지고 있습니다.