AffectVerse: Emotional World Models for Multimodal Affective Computing
AffectVerse 는 교차 모달 시간적 상상력과 신념 집적을 통해 단시간 잠정 정서 예측을 수행하는 정서 세계 모듈을 통합하여 정서 추론을 강화함으로써 정서 역동을 포착하고 아홉 가지 벤치마크에서 우수한 성능을 달성하는 다중 모달 대규모 언어 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
TV 에서 취업 면접을 지켜보고 있다고 상상해 보세요. 후보자가 말을 시작하자마자 목소리가 아주 살짝 떨리기 시작합니다. 그들의 미소는 가위처럼 너무 꽉 조여져 보입니다. 이를 지켜보는 인간은 문장이 끝날 때까지 기다리지 않고 그 사람의 감정을 추측합니다. 대신 우리 뇌는 즉시 "만약" 시뮬레이션을 시작합니다: "이대로 말을 계속한다면, 그들이 무너질까? 아니면 단순히 긴장한 걸까?" 우리는 새로운 단서가 도착함에 따라 실시간으로 우리의 추측 (즉, "신념") 을 업데이트합니다.
현재 감정 인식용 컴퓨터 모델은 사건이 끝난 후에만 사진을 찍는 사진사와 비슷합니다. 그들은 전체 비디오, 오디오, 텍스트를 살펴본 뒤 "좋아, 그것은 슬펐구나"라고 말합니다. 그들은 감정이 어떻게 형성되어 갔는지의 역동적인 과정을 놓칩니다.
이 논문은 인간 관찰자처럼 더 많이 생각하려는 새로운 AI 모델인 AffectVerse를 소개합니다. 단순히 일어난 일을 보는 대신, 지금까지 본 것을 바탕으로 앞으로 일어날 일을 상상하도록 학습합니다.
다음은 이를 간단한 단계로 분해한 작동 원리입니다:
1. 핵심 아이디어: "감정 세계 모듈 (Emotion World Module)"
AI 의 뇌를 **감정 세계 모듈 (EWM)**이라는 특별한 "상상 엔진"을 갖춘 것으로 생각하세요. 기존 AI 모델이 과거를 읽기만 한다면, 이 엔진은 세 가지 일을 합니다:
단계 1: 시간 여행자 (교차 모달 시간적 상상)
영화를 보고 있는데 화면이 1 초간 검게 변한다고 상상해 보세요. 인간은 음악과 배우의 표정을 바탕으로 다음에 무슨 일이 일어날지 추측할 수 있습니다. AffectVerse 는 이를 수학적으로 수행합니다. 지금까지 본 비디오와 오디오를 바탕으로 몇 초 후의 비디오와 오디오가 어떻게 보일지 예측해 봅니다. 실제로 미래를 보는 것은 아니며, 이해도를 테스트하기 위해 미래의 "유령" 버전을 생성합니다.- 비유: 체스 선수가 세 수 ahead 를 내다보는 것과 같습니다. 그들은 아직 그 수를 두지는 않지만, 게임의 흐름을 이해하기 위해 이를 시뮬레이션합니다.
단계 2: 요약자 (MAMA 신념 집계)
AI 는 이제 이러한 "유령" 미래 클립을 생성했습니다. 하지만 전체 영화를 다시 뇌에 입력할 수는 없습니다. 따라서 MAMA라는 스마트 필터를 사용하여 상상한 모든 미래 순간을 몇 개의 "신념 토큰"으로 압축합니다.- 비유: 이는 뉴스 앵커가 속보 기사를 요약하는 것과 같습니다. 전체 대본을 읽는 대신, 다음에 일어날 가능성이 높은 사건의 "헤드라인"을 전달합니다. 이러한 헤드라인이 바로 "신념"입니다.
단계 3: 주입 (신념 주입)
마지막으로 AI 는 이러한 "신념 헤드라인"을 주요 대화에 다시 삽입합니다. 이제 AI 가 사람이 어떤 감정을 느끼고 있는지 결정할 때, 과거만 보는 것이 아니라 미래에 대한 자신의 예측도 고려합니다.- 비유: 이는 수사관이 범죄 현장 (과거) 만 보는 것이 아니라 범인이 누구일지에 대한 직감 (미래 신념) 을 가진 탐정과 같습니다. 이러한 직감은 사건을 더 빠르고 정확하게 해결하는 데 도움이 됩니다.
2. 학습 방법 (훈련)
이 모델은 교묘한 트릭을 사용하여 훈련됩니다. 비디오 클립을 보여주지만, 화면은 일찍 잘립니다 (스폴리 없는 버전과 같습니다).
- AI 는 비디오의 나머지 부분이 어떻게 들리고 보일지 추측해야 합니다.
- 올바르게 추측하면 보상을 받습니다.
- 이를 통해 AI 는 시간이 지남에 따라 감정이 어떻게 변하는지 (예: 미소가 찡그림으로 변하거나, 차분한 목소리가 떨리는 목소리로 변하는 방식) 의 패턴을 학습하도록 강요받습니다.
한번 "미래 예측" 기술을 습득하면 화면이 잘릴 필요가 더 이상 없습니다. 전체 비디오를 볼 때, 동일한 기술을 사용하여 감정에 대한 더 강력하고 정확한 이해를 구축합니다.
3. 결과
연구진은 AffectVerse 를 오디오와 텍스트가 포함된 비디오 모음인 아홉 가지 다른 데이터셋에서 테스트했습니다.
- 결과: AffectVerse 는 다른 최상위 모델들 (AffectGPT 및 Qwen2.5-Omni 등) 보다 상당한 차이 (평균 약 2.5% 에서 5% 더 좋음) 로 더 좋은 성과를 거두었습니다.
- 중요성: 이 논문은 AI 에게 상호작용의 다음 몇 초를 "상상"하도록 가르침으로써 복잡한 변화하는 감정을 이해하는 능력이 크게 향상됨을 보여줍니다. 정적인 스냅샷만 보는 모델들보다 오디오나 비디오가 누락되거나 짧게 끊긴 상황을 훨씬 잘 처리합니다.
요약
간단히 말해, AffectVerse는 현재를 볼 뿐만 아니라 즉시 미래를 지속적으로 시뮬레이션하는 AI 입니다. 감정이 어떻게 전개될지 "상상"함으로써 그 사람이 느끼는 감정에 대한 더 견고한 "신념"을 구축하여, 더 지능적이고 정확한 감정 인식을 가능하게 합니다. 이는 정적인 사진에서 역동적인 영화로 감정 인식을 전환시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.