← 최신 논문
🤖 AI

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

이 논문은 심리학적 프레임워크를 기반으로 한 새로운 벤치마크인 MultivationBench를 소개하며, 이는 이야기 중심의 시각적 서사에서 멀티모달 거대 언어 모델이 순차적 동기 추론을 수행하는 능력을 평가하고, 현재의 모델들이 정적인 인식 능력에도 불구하고 역동적인 맥락 전반에 걸쳐 일관된 추론을 유지하는 데 어려움을 겪고 있음을 밝힌다.

원저자: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 하지만 단순히 일어나는 일을 보는 것이 아니라, 등장인물들이 '왜' 그런 행동을 하는지 추측하려고 노력하는 것입니다. 이것이 바로 인간이 가진 초능력이자, 행동 뒤에 숨겨진 감정과 목표를 이해하게 해주는 '사회적 지능'의 핵심입니다. 과학자들은 이를 '동기 추론(motivation reasoning)'이라고 부릅니다. 이는 단순히 누군가가 전화를 집어 드는 것을 보는 것이 아니라, 그가 도움을 요청하기 위해, 시간을 확인하기 위해, 혹은 세상을 떠난 사랑하는 이의 사진을 보기 위해 전화를 거는 것인지 파악하는 것입니다. 보통 우리는 정지된 사진 한 장만으로는 이를 추측하지 않습니다. 우리는 이야기의 전개를 지켜보며 시간이 흐름에 따라 단서를 수집합니다. 만약 등장인물이 첫 번째 장면에서 슬퍼 보이고, 두 번째 장면에서 사진을 본다면, 우리의 동기에 대한 추측은 변하게 됩니다. 이 논문은 최신형의 매우 똑똑한 컴퓨터 두뇌(멀티모달 거대 언어 모델, MLLM)가 이와 같은 방식의 '이야기 탐정 놀이'를 할 수 있는지 파고듭니다. 이 컴퓨터들은 이미지를 보고 묘사하거나 이야기를 읽고 질문에 답하는 데는 뛰어나지만, 본 연구는 더 어려운 질문을 던집니다. 과연 이들이 인간처럼 이야기 전체가 진행됨에 따라 변화하는 등장인물의 감정을 추적할 수 있는가 하는 점입니다.

홍콩 과학기술대학교와 아마존의 팀이 주도한 이 연구팀은 이를 알아보기 위해 거대한 테스트를 구축하기로 했습니다. 그들은 MultivationBench라고 불리는 것을 만들었습니다. 이것은 영화 클립과 소셜 미디어 게시물이 섞인 듯한 1,000개의 짧은 시각적 이야기 라이브러리로, 등장인물이 무언가를 하는 4,000개 이상의 구체적인 순간들을 포함하고 있습니다. 하지만 이것은 단순히 '무슨 일이 일어났는가'를 테스트하는 것이 아니라, '왜 일어났는가'를 테스트하는 것입니다. 테스트를 공정하고 과학적으로 만들기 위해, 연구진은 두 가지 유명한 심리학 법칙을 사용했습니다. 바로 생존과 같은 기본 욕구부터 사랑과 자기 계발 같은 높은 목표까지 인간의 욕구를 분류하는 **매슬로의 욕구 단계설(Maslow's Hierarchy of Needs)**과, 호기심, 명예, 가족과 같은 구체적인 개인적 동기를 살펴보는 **레이스의 16가지 기본 욕구(Reiss's 16 Basic Desires)**입니다.

연구팀은 컴퓨터 모델들에게 이 이야기들을 프레임 단위로 관찰하도록 요청했습니다. 매 단계마다 모델들은 지금까지 본 것만을 근거로 등장인물의 동기를 추측해야 했습니다. 까다로운 점은 무엇일까요? 이야기가 진행됨에 따라 새로운 정보가 나타나 이전의 행동에 대한 이유를 완전히 바꿔놓을 수 있다는 것입니다. 예를 들어, 어떤 인물이 전화를 향해 손을 뻗을 때, 처음에는 단순히 메시지를 확인하는 것(인지적 욕구)처럼 보일 수 있습니다. 하지만 나중에 이야기가 진행되면서 그가 파티에서 외로움을 느끼며 가족 사진을 보고 있다는 사실이 드러나면, 실제 이유는 '사랑과 소속감'에 관한 것이 됩니다. 컴퓨터는 "잠깐, 내가 이전에 틀렸었구나; 이제 진짜 이유를 알겠어"라고 말할 수 있을 만큼 똑똑해야 했습니다.

결과는 기술계에 다소 충격적인 것이었습니다. 논문에 따르면, 이러한 고급 AI 모델들은 짧고 단순한 이야기 속에서 동기를 추측하는 데는 어느 정도 능숙하지만, 이야기가 길어지면 정말 어려움을 겪습니다. 테스트된 1,000개의 이야기 중, 모델들이 이야기 시작부터 끝까지 추론의 일관성을 유지하는 경우는 거의 없었습니다. 실제로 이야기 전체에서 모든 동기를 정확히 맞히라는 요청을 받았을 때, 가장 뛰어난 모델들도 성공률이 1% 미만이었습니다. 이 연구는 이러한 AI 두뇌들이 사실을 암기하는 데는 뛰어나지만, 줄거리의 흐름을 이해하는 데는 서툰 학생과 같다고 시사합니다. 그들은 처음에 본 것에 갇혀 새로운 증거가 나타났을 때 생각을 업데이트하는 데 실패하곤 합니다. 또한 그들은 그럴듯하게 들리지만 이야기에서 뒷받ка지 않는 이유를 '환각(hallucinate)'하거나, 전체 서사를 관통하는 점들을 연결해야 하는 더 깊고 복잡한 정서적 이유를 놓치기도 합니다.

연구진은 또한 AI를 실제 인간과 비교했습니다. 대학원생들로 구성된 인간 그룹은 특히 이야기가 길고 복잡할 때 훨씬 더 뛰어난 성과를 보였습니다. 이 격차는 AI가 보고 읽는 능력은 좋아지고 있지만, 시간이 흐름에 따라 동기가 어떻게 변화하고 진화하는지를 이해하는 데 필요한 '사회적 두뇌'는 여전히 부족하다는 것을 보여줍니다. 이 논문은 우리가 여전히 이야기 속 인간 행동의 복잡하고 변화무쌍한 이유를 진정으로 이해할 수 있는 컴퓨터로부터 멀리 떨어져 있다는 결론을 내립니다. 이는 사람들이 왜 그렇게 행동하는지를 이해하는 것이, 그들이 무엇을 했는지를 아는 것보다 훨씬 더 어렵다는 사실을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →