← 최신 논문
💻 computer science

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

AffectFlow-DINO는 DINOv3 백본 위에 조건부 rectified-flow 헤드를 활용하여 불확실성을 인지하는 생성적 예측을 통해 얼굴 정동의 모호성을 모델링함으로써, 가치-각성 추정, 표정 분류 및 액션 유닛 탐지에서 상당한 성능 향상을 달성한 제11회 ABAW 챌린지용 멀티태스크 학습 시스템이다.

원저자: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid

게시일 2026-07-16
📖 6 분 읽기🧠 심층 분석

원저자: Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구의 얼굴 사진 한 장만 보고 그가 어떤 기분인지 추측하려고 한다고 상상해 보세요. 그것은 매우 까다로운 게임입니다. 아주 작은 미소는 행복함을 의미할 수도 있지만, 어쩌면 슬픈 감정을 느끼면서도 그저 예의를 차리고 있는 것일 수도 있습니다. 찌푸린 눈썹은 화남을 의미할 수도 있지만, 깊은 집중을 의미할 수도 있습니다. 이것이 바로 "감성 컴퓨팅(affective computing)"의 세계, 즉 컴퓨터에게 인간의 감정을 읽는 법을 가르치는 일입니다. 오랫동안 과학자들은 모든 얼굴을 "이것은 100% 행복이다" 또는 "이것은 100% 슬픔이다"와 같이 하나의 단일한 상자에 강제로 집어넣는 엄격한 판사처럼 행동하는 모델을 구축하려고 노력해 왔습니다. 하지만 인간의 얼굴은 복잡하고 모호합니다. 때로는 얼굴에 여러 감정이 섞여 있기도 하고, 조명 때문에 미묘한 표정을 읽기 어려울 때도 있습니다. 이 분야의 핵심적인 질문은 이것입니다: 어떻게 하면 컴퓨터가 얼굴이 단 하나의 정답이 아니라, 하나의 범위 내에 있는 수많은 가능성이라는 것을 이해하도록 가르칠 수 있을까?

이 논문은 바로 이 문제를 해결하기 위해 설계된 AffectFlow-DINO라는 새로운 시스템을 소개합니다. 모델이 사람의 기분에 대해 단 하나의 "최선의 추측"을 선택하도록 강요하는 대신, 이 팀은 컴퓨터가 동시에 여러 가지 가능한 기분을 상상하도록 학습하는 모델을 만들었습니다. 이것은 마치 일기 예보관과 같습니다. 전통적인 모델은 "오후 2시에 비가 올 것입니다"라고 말할 수 있습니다. 하지만 불확실성을 인지하는 더 나은 모델은 "비가 올 확률 70%, 구름 낄 확률 20%, 맑을 확률 10%"라고 말합니다. AffectFlow-DINO는 감정에 대해 이와 똑같은 일을 수행합니다. 이 모델은 "정류 흐름(rectified flow)"이라는 영리한 수학적 기법을 사용하여, 보이는 모든 얼굴에 대해 그럴듯한 감정 상태의 구름(cloud)을 생성합니다. 이러한 가능성들을 평균함으로써, 이 모델은 표준 모델이 결코 도달할 수 없는 더 정확한 답을 찾아내곤 합니다. 연구진은 이 시스템을 실제 세계의 얼굴이 담긴 방대한 데이터셋으로 테스트했으며, 불확실성을 수용함으로써 이 시스템이 특히 무시되기 쉬운 공포나 슬픔 같은 희귀한 감정을 포착하는 데 훨씬 더 뛰어나다는 것을 발견했습니다.

문제점: "일률적인 적용"의 함정

당신이 전화로 친구에게 복잡한 그림을 설명하려고 한다고 상상해 보세요. 만약 이미지 전체를 설명하기 위해 단 하나의 단어만을 골라야 한다면, 당신은 "파란색"이라고 말할 수도 있습니다. 하지만 그 그림은 사실 파란색, 회색, 그리고 아주 작은 빨간색의 조합입니다. 만약 당신이 "파란색"이라고만 말한다면, 당신은 그 미묘한 차이를 놓치게 됩니다.

얼굴 인식의 세계에서 컴퓨터는 이 "한 단어"의 함정에 빠져 있었습니다. 컴퓨터는 얼굴을 보고 "가치(Valence, 기분이 얼마나 긍정적인지 혹은 부정적인지)"와 "각성(Arousal, 얼마나 흥분했는지 혹은 차분한지)"에 대한 단일 숫자, 그리고 "액션 유닛(Action Units)"이라 불리는 얼굴 근육 움직임 목록을 출력하려고 시도합니다. 문제는 현실 세계에서 얼굴은 모호하다는 점입니다. 입가의 미세한 떨림은 미소일 수도, 찡그림일 수도, 혹은 단순한 근육 경련일 수도 있습니다. 표준 컴퓨터 모델은 그 모든 모호함을 하나의 경직된 예측으로 압축하여, 정답을 찾는 데 결정적인 단서가 될 수 있는 불확실성을 버려버립니다.

해결책: "만약에" 기계

저자들은 컴퓨터에게 "감정이 무엇인가?"라고 묻는 것을 멈추고, "감정이 무엇이 될 수 있는가?"라고 묻기로 했습니다.

그들은 AffectFlow-DINO라고 불리는 시스템을 구축했습니다. 이 시스템은 이미 얼굴을 인식하는 데 매우 뛰어난 강력한 사전 학습된 "두뇌"(DINOv3 시각적 백본)에서 시작합니다. 하지만 단순히 그 두뇌가 단 하나의 추측을 하게 두는 대신, 그 위에 특별한 "상상 엔진"을 추가했습니다. 이 엔진은 **정류 흐름(Rectified Flow)**이라 불리는 기술을 사용합니다.

작동 원리를 시각화하는 간단한 방법은 다음과 같습니다:

  1. 노이즈(The Noise): 정적 노이즈(TV의 지지직거리는 화면 같은)로 덮인 빈 캔버스에서 시작한다고 상상해 보세요.
  2. 여정(The Journey): 모델은 그 노이즈를 특정 감정으로 바꾸는 직선적이고 효율적인 경로를 학습합니다. 이는 "혼란"에서 "행복"으로 가는 직접적인 선을 그리는 것과 같습니다.
  3. 구름(The Cloud): 모델이 새로운 얼굴을 볼 때, 단순히 하나의 선을 그리는 것이 아닙니다. 노이즈로부터 감정 공간까지 이어지는 수많은 선을 그립니다. 각 선은 그 얼굴에 대한 서로 다른, 그럴듯한 해석을 나타냅니다.
  4. 평균(The Average): 마지막으로, 모델은 그 모든 선의 평균을 취합니다. 만약 얼굴이 명확하게 행복해 보인다면, 모든 선이 "행복"을 향할 것이고, 그 평균은 확신에 찬 강력한 "행복"이 됩니다. 만약 얼굴이 모호하다면, 선들이 넓게 퍼질 것이며, 그 평균은 불확실성을 담아낸 미묘한 답을 제공합니다.

결과: 어려운 과제에서 더 나아지다

연구팀은 실제 세계의 얼굴을 담은 수천 장의 정적 이미지가 포함된 s-Aff-Wild2 데이터셋을 통해 시스템을 테스트했습니다. 이 이미지들은 조명이 좋지 않거나, 일부가 가려져 있거나, 매우 미묘한 표정을 보여주는 등 까다롭습니다. 목표는 세 가지를 동시에 예측하는 것이었습니다:

  • 가치-각성(Valence-Arousal): 사람이 얼마나 긍정적/부정적인지, 그리고 얼마나 흥분/차분한지.
  • 표정(Expressions): 8가지 감정(기쁨, 공포, 슬픔 등) 중 어떤 것이 존재하는지.
  • 액션 유닛(Action Units): 12가지 특정 얼굴 근육 중 어떤 것이 움직이는지.

결과는 인상적이었습니다. "상상 엔진"을 사용함으로써, 모델은 가치-각성 점수를 예측하는 능력을 상당한 수준으로 개선했습니다(점수 개선 폭 +0.058). 하지만 진짜 마법은 희귀한 감정에서 일어났습니다.

현실 세계에서는 어떤 감정들은 매우 드뭅니다. 데이터셋에서 **공포(Fear)**는 레이블링된 이미지의 약 **3.8%**에서만 나타났으며, 슬픔(Sadness) 또한 꽤 드물었습니다. 표준 모델은 보통 이러한 희귀한 경우를 무시하고 대부분 "중립"이나 "기타"라고 추측합니다. 그러나 AffectFlow-DINO 시스템은 이러한 희귀한 감정을 포착하는 능력을 회복해 냈습니다.

특정 작업에 맞춰 **미세 조정(fine-tuned)**된 모델에 적용된 영리한 사후 처리 단계(각 감정에 대한 "결정 임계값"을 개별적으로 조정하는 과정)를 통해, 연구진은 모델이 공포를 감지하는 능력을 처참했던 **3.8%**의 F1 점수에서 **33.1%**까지 끌어올렸고, 슬픔은 **17.1%**에서 **28.2%**로 높였습니다. 이 특정 캘리브레이션 단계는 모델 전체를 처음부터 다시 학습시킬 필요 없이, 미세 조정된 모델이 이미 배우고 있는 신호에 더 귀를 기울이는 것만으로도 가능했습니다.

제외된 것들

연구진은 단순히 한 가지 방법만 시도한 것이 아니라, 실제로 무엇이 효과가 있는지 확인하기 위해 26가지의 서로 다른 설계 선택지를 테스트했습니다.

  • "단순 흐름(Just Flow)" 또는 "단순 결정론적(Just Deterministic)" 방식 제외: 그들은 만약 표준적인 "단일 추측" 헤드 없이 "상상 엔진(Flow)"만 사용한다면 모델이 실패한다는 것을 발견했습니다. 반대로, 흐름 없이 표준 헤드만 사용한다면 미묘한 차이를 놓치게 됩니다. 두 부분은 반드시 함께 작동해야 합니다.
  • 불균형에 대한 단순한 해결책 제외: 단순히 수학적 가중치를 변경하거나 "포컬 로스(Focal Loss)"를 사용하여 컴퓨터가 희귀한 감정에 더 주목하게 만드는 방법을 시도했습니다. 이러한 방법들은 단독으로는 잘 작동하지 않았으며, 때로는 다른 작업의 성능을 떨어뜨리기도 했습니다.
  • "모든 것을 다 집어넣는(Kitchen Sink)" 미세 조정 제외: 모든 가능한 기법(가중치 변경, 샘ло링 전략 등)을 한꺼번에 결합하는 시도를 했습니다. 놀랍게도 이러한 "모든 것을 다 집어넣는" 접근 방식은 최종 점수를 개선하지 못했으며, 오히려 기분(Valence)을 정확하게 예측하는 능력을 저해하기도 했습니다.

결론

이 논문은 더 나은 감정 인식을 위한 열쇠가 단순히 컴퓨터를 더 "똑똑하게" 하거나 "크게" 만드는 것이 아니라, 불확실성을 편안하게 받아들이도록 가르치는 데 있다는 점을 시사합니다. 모델이 다양한 가능성을 탐색하고 그 평균을 내도록 함으로써, AffectFlow-DINO는 공식 베이스라인 점수인 0.45의 두 배가 넘는 1.177이라는 최종 성능 점수를 달성했습니다.

저자들은 자신들의 시스템이 큰 진전이지만, 가장 큰 성과는 다음 두 가지에서 왔다고 결론지었습니다:

  1. 시각적 두뇌의 미세 조정: 사전 학습된 얼굴 인식기를 특정 작업에 맞게 조정하는 것.
  2. 결정 임계값 캘리브레이션: 컴퓨터가 실제로 희귀한 감정을 "보고" 있었지만, 자신의 직감을 믿도록 약간의 자극이 필요했다는 점을 깨달은 것.

이 연구는 감성 AI의 미래가 단 하나의 정답을 강요하는 것이 아니라, 인간 표현의 복잡하고 다면적인 현실을 수용하는 데 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →