← 최신 논문
💻 computer science

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

본 논문은 텍스트, 오디오, 시각적 특징을 양방향 교차 주의 집중(bidirectional cross-attention)과 게이트형 멀티모달 유닛(Gated Multimodal Unit)을 통해 융합함으로써, ECCV 2026의 ABAW11 챌린지에서 단일 모달 베이스라인 및 제로샷 모델을 크게 상회하는 0.7394의 Macro F1 점수를 달성하여 비디오 내 양가감정(ambivalence)과 망설임(hesitancy)을 인식하기 위한 멀티모달 프레임워크를 제시한다.

원저자: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구의 모습을 관찰하는 것만으로 그가 무엇을 느끼고 있는지 추측하려고 노력한다고 상상해 보세요. 때로는 쉽습니다. 큰 미소는 행복을 의미하고, 찌푸린 얼굴은 슬픔을 의미하죠. 하지만 마음이 갈팡질팡하는 까다로운 순간들은 어떨까요? 예를 들어, 누군가 울 것 같은 표정을 지으면서도 목소리는 떨리는 소리로 "괜찮아요"라고 말할 때처럼 말이죠. 이 혼란스러운 감정의 혼합을 양가감정(ambivalence) 또는 **망설임(hesitancy)**이라고 부릅니다. 그것은 무언가를 하고 싶은 마음과 그것을 하는 것이 두려운 마음 사이의 내부적인 줄다리기와 같습니다. 컴퓨터와 인간의 행동을 연구하는 과학자들(감성 컴퓨팅이라 불리는 분야)은 기계가 이러한 미묘하고 뒤섞인 신호들을 포착하도록 가르치기 위해 노력하고 있습니다. 그들은 단 하나의 단서, 즉 목소리만 듣거나 얼굴만 보는 것이 충분하지 않다는 것을 알고 있습니다. 사람을 진정으로 이해하기 위해서, 컴퓨터는 단어, 어조, 그리고 표정을 모두 한꺼번에 종합하여 무엇이 그 사람의 진심인지 밝혀내는 초스마트 탐정처럼 행동해야 합니다.

이 논문에서 오사마(Oussama), 야신(Yassine), 라르비(Larbi)라는 이름의 연구팀은 바로 이 퍼즐을 풀기 위해 초스마트 탐정 컴퓨터를 구축하기로 했습니다. 그들은 비디오 녹화물에서 양가감정과 망설임을 포착하는 것을 목표로 하는 ABAW11이라는 대회에 참가했습니다. 그들은 먼저 세 가지 서로 다른 "감각"을 개별적으로 테스트했습니다. 텍스트 전사본을 읽는 뇌, 오디오를 듣는 뇌, 그리고 얼굴 영상을 보는 뇌입니다. 그들은 텍스트 판독기가 단독 탐정으로서 가장 뛰어났으며, 약 **66.6%**의 정답률(Macro F1이라 불리는 점수로 측정됨)을 기록했다는 것을 발견했습니다. 오디오 청취기는 **62.8%**로 그 뒤를 바짝 쫓았고, 비디오 관찰기는 **57.3%**로 조금 더 약했습니다. 흥적으로, 그들은 유명한 "제로샷(zero-shot)" AI(이 특정 데이터에 대해 학습되지 않은 AI)를 테스트해 보았는데, 이 AI는 겨우 **28.3%**만을 맞혔으며, 이는 이 까다로운 작업을 위해 AI를 반드시 특화하여 학습시켜야 한다는 것을 증명했습니다.

하지만 진짜 마법은 탐정들이 혼자 일하는 것을 멈추고 그들을 한 팀으로 만들었을 때 일어났습니다. 연구진은 텍스트, 오디오, 비디오 뇌가 서로 대화할 수 있는 특별한 시스템을 구축했습니다. 그들은 각 탐정에게 무전기를 주어 "이봐, 여기 떨리는 목소리가 들리는데, 네 얼굴은 긴장한 표정을 보고 있니?"라고 묻거나 "나는 망설이는 단어를 발견했어, 네 오디오에서는 멈춤이 들리니?"라고 서로 묻게 하는 것과 같은 교차 주의 집중(cross-attention) 기법을 사용했습니다. 이를 통해 그들은 누군가 "예"라고 말하면서도 확신 없는 소리를 내는 것과 같은 모순을 포착할 수 있었습니다. 또한 그들은 스마트한 매니저 역할을 하는 **게이트형 다중 양식 유닛(Gated Multimodal Unit)**을 추가했습니다. 만약 한 탐정이 흐릿한 얼굴을 보고 있거나 좋지 않은 오디오를 듣고 있다면, 매니저는 "잠시 그 노이즈 섞인 신호는 무시하고, 대신 명확한 텍스트에 집중하자"라고 말할 수 있습니다.

최적의 설정을 찾기 위해 Optuna라는 스마트 검색 도구와 함께 이 팀을 훈련시킨 결과, 성과는 인상적이었습니다. 세 명의 팀이 협력하여 얻은 점수는 **73.9%**였으며, 이는 최고의 단일 탐정보다 11.0% 향상된 수치입니다. 이는 서로의 감각를 교차 확인하게 함으로써, 컴퓨터가 단일 감각만 사용할 때보다 양가감정을 구성하는 미묘하고 상충하는 단서들을 훨씬 더 잘 포착할 수 있음을 시사합니다. 연구진은 텍스트, 소리, 비디오 사이의 이러한 명시적인 팀워크가 어려운 인간의 감정을 여는 열쇠라고 확신하며, 다른 이들도 이를 시도해 볼 수 있도록 코드를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →