← 최신 논문
💻 computer science

Causal Supervision of Attention for Affective Behaviour Analysis

본 논문은 제11회 인더와일 정서적 행동 분석 경진대회에서 최첨단 성능를 달달성하기 위해, 피험자 불변의 집중을 강제하고, 교차 공분산 정규화를 통해 비중복 표현을 장려하며, 게이트형 비선형 변환을 통해 특징 표현력을 향상시키는 정서적 행동 분석을 위한 어텐션 메커니즘의 인과적 감독 프레임워크를 제안한다.

원저자: Nemanja Rašajski, Konstantinos Makantasis, Antonios Liapis, Georgios N. Yannakakis

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nemanja Rašajski, Konstantinos Makantasis, Antonios Liapis, Georgios N. Yannakakis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 당신의 얼굴을 읽고 당신의 기분을 추측하는 법을 가르치려 한다고 상상해 보세요. 로봇이 진정한 미소나 찌푸린 표정을 포착하기를 원하시겠죠? 하지만 여기 까다로운 문제가 있습니다. 로봇은 쉽게 주의가 산만해집니다. 로봇은 "오, 이 사람은 코가 커서 슬퍼 보여"라거나 "이 사람은 이마에 햇빛이 비치고 있어서 행복해 보여"라고 생각할 수도 있습니다. 이것들은 **가짜 상관관계(spurious correlations)**와 같습니다. 실제 감정과는 아무런 관련이 없지만 학습 데이터에 자주 등장하는 단서들 말이죠. 만약 로봇이 이런 나쁜 습관을 배우게 된다면, 다른 코를 가졌거나 다른 조명 아래 있는 새로운 사람을 만났을 때 처참하게 실패할 것입니다.

이 논문의 저자들은 로봇의 "주의력(attention)"을 훈련시키는 아주 영리한 새로운 방법을 제안합니다. 이를 통해 로봇이 엉뚱한 곳을 보지 않고, 누구를 마주하든 실제 정서적 신호에 집중할 수 있도록 만드는 것이죠. 그들은 이 방법을 **인과적 주의력 감독(Causal Supervision of Attention)**이라고 부릅니다.

세 가지 마법의 기술

로봇의 나쁜 습관을 고치기 위해, 팀은 학습 과정에 세 가지 특별한 재료를 추가했습니다.

1. "만약에?" 게임 (인과적 감독)
보통 로봇은 얼굴을 보고 그냥 추측합니다. 하지만 이 팀은 로봇에게 "만약에?" 게임을 시켰습니다. 그들은 로봇에게 물었습니다. "만약 내가 너에게 코를 무시하고 눈만 보라고 강요한다면, 네 감정 예측이 바뀔까?"
그들은 "반사실적(counterfactual)" 버전의 주의력(로봇이 무작위 지점을 보는 가짜 버전)을 만들었고, 이를 실제 주의력과 비교했습니다. 단순히 차이의 크기를 극대화하는 대신, 그들은 총 직접 효과(Total Direct Effect, TDE)—즉, 주의력이 예측에 기여하는 인과적 기여도를 측정하는 특정 척도—를 극대화했습니다. 이렇게 함으로써, 로봇이 특정 개인의 특징이 아닌, 여러 사람에게 걸쳐 일관되게 나타나는 **피험자 불변적(subject-invariant)**인 얼굴 영역, 즉 **불변적 예측 가치(invariant predictive value)**를 가진 영역에 집중하도록 유도했습니다. 이는 로봇이 정체성이나 조명 같은 가짜 요인을 구별하여, 정체성을 완전히 무시하지 않으면서도 정체성으로부터 독립된 실제 정서적 단서에 집중하게 함으로써 효과적으로 구분해 낼 수 있게 합니다.

2. "중복 금지" 규칙 (교차 공분산 정규화)
로봇의 뇌를 두 팀의 작업자가 있는 것으로 생각해 보세요: 무엇을 볼지 결정하는 키(Key) 팀과, 본 것의 세부 사항을 수집하는 밸류(Value) 팀입니다.
표준 모델에서는 이 두 팀이 서로 정보를 겹치게 말하거나 중복되는 정보를 전달하는 경우가 많습니다. 마치 방 안에 있는 두 사람이 입과 눈을 모두 무시한 채 "눈을 봐!"라고 동시에 소리치는 것과 같습니다. 저자들은 이 두 팀이 중복되는 것이 아니라 상호 보완적이 되도록 하는 규칙을 도입했습니다. 그들은 키 팀과 밸류 팀이 같은 것을 말하기 시작하면 벌칙을 주는 방식을 추가했습니다. 이는 그들이 역할을 나누도록 강제합니다. 예를 들어, 한 팀은 눈썹의 모양에 집중하고, 다른 팀은 턱의 긴장도에 집중하게 하여 최종적인 그림을 훨씬 더 풍부하게 만드는 것입니다.

3. "슈퍼 트랜스포머" (SwiGLU)
마지막으로, 팀은 로봇의 두뇌 능력을 업그레이드했습니다. 표준 모델은 수집한 세부 정보를 처리하기 위해 단순하고 직선적인 수학적 기법을 사용합니다. 저자들은 이 기법을 SwiGLU라고 불리는 화려하고 비선형적인 도구로 교체했습니다.
기존 방식이 단순한 미끄럼틀이라면, 새로운 방식은 구불구불하게 휘어지는 롤러코스터와 같습니다. 이를 통해 로봇은 단순한 미끄럼틀이 놓칠 수 있는 훨씬 더 미세하고 복複雑한 감정의 디테일을 포착할 수 있습니다. 이는 로봇이 "세밀한(fine-grained)" 감정을 이해하는 능력을 훨씬 더 날카롭게 만들어 줍니다.

효과가 있었나요?

팀은 이 방법을 사람들이 자연스러운 환경에서 다양한 행동을 하는 실제 영상 데이터셋인 s-Aff-Wild2에서 테스트했습니다. 그들은 로봇이 얼마나 잘했는지를 측정하기 위해 P라는 점수를 사용했는데, 이 점수는 Valence-Arousal(감정의 긍정/부정 및 강도), 표정 인식(기쁨이나 슬픔 등), 그리고 Action Units(얼굴의 미세한 근육 움직임)을 맞히는 세 가지 작업의 성과를 합산한 것입니다.

결과는 다음과 같습니다:

  • 베이스라인: 표준 로봇(ConvNeXt 모델 사용)은 공식 검증 세트에서 0.45를 기록했습니다.
  • 새로운 방법: 강력한 시각 인코더인 FRoundation과 함께 이 "인과적 감독" 기술을 사용했을 때, 점수는 1.2214로 급등했습니다.
  • 상세 내역: 구체적으로, Valence-Arousal 예측에서는 0.5123, 표정 인식에서는 0.3116의 F1 점수를, 근육 움직임 포착에서는 0.3974를 기록했습니다.

그들은 결과가 단순히 운이 아니라는 것을 확인하기 위해 다섯 번의 반복 테스트(5-fold cross-validation)도 수행했습니다. 새로운 방법은 기존 모델을 지속적으로 앞질렀으며, DINOv2라는 뇌를 사용했을 때는 평균 점수를 0.8730에서 0.9569로, FRoundation을 사용했을 때는 1.0524에서 1.1948로 향상시켰습니다.

핵심 요약

이 논문은 로봇에게 진짜 정서적 단서와 "가짜" 단서(정체성이나 조명 등)를 구분하게 하고, 다양한 피험자에게서 불변적 예측 가치를 갖는 얼굴 부위에만 집중하게 함으로써, 우리가 인간의 감정을 훨씬 더 잘 이해하는 시스템을 구축할 수 있음을 시사합니다. 그들은 단순히 추측한 것이 아니라, 수천 개의 이미지에 걸쳐 측정함으로써 세 가지 새로운 기술이 모두 로봇의 성능을 높이는 데 기여했음을 증명했습니다. 로봇이 아직 완벽하지는 않지만(점수를 높일 여지는 여전히 남아 있습니다), 이 접근 방식은 기계가 단순히 우리가 누구처럼 보이는지를 보고 추측하는 것이 아니라, 우리를 진정으로 "이해"하게 만드는 명확한 길을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →