← 최신 논문
💻 computer science

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

본 논문은 사회적 상호작용 과제를 평가하기 위해 2,792 개의 클립과 5,455 개의 질문 - 답변 쌍으로 구성된 포괄적인 비디오 벤치마크인 SIV-Bench 를 소개하며, 현재 모델들은 장면 이해에서는 뛰어나지만 인간 사고 과정과의 불일치로 인해 사회적 상태 추론 및 역동성 예측에는 어려움을 겪고 있음을 밝힙니다.

원저자: Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 좋은 친구가 되는 법을 가르치려 한다고 상상해 보세요. 개 사진을 보여주면 "그건 개예요"라고 말하고, 자동차 추락 영상을 보여주면 "차가 나무에 부딪혔어요"라고 말할 수 있습니다. 하지만 두 사람이 싸우는 영상이나 친구들이 농담에 웃는 영상을 보여준다면 어떻게 될까요? 로봇이 그들이 왜 싸우는지, 무엇을 느끼는지, 혹은 다음에 무엇을 할지 예측할 수 있을까요?

이것이 바로 논문 SIV-Bench가 해결하려는 문제입니다.

문제: 로봇은 "사회적으로 무지하다"

저자들은 인공지능 모델 (로봇과 챗봇의 "두뇌") 이 세상을 보고 묘사하는 데는 매우 능숙해졌지만, 인간의 사회적 상호작용을 이해하는 데는 매우 서툴다고 주장합니다.

이렇게 생각해보세요. 인공지능이 생일 파티 영상을 완벽하게 묘사할 수는 있습니다 ("케이크가 있고, 아이가 양초를 불고, 사람들이 모자를 쓰고 있어요"). 하지만 "그 아이는 행복해하거나 당황해하고 있을까요?" 또는 "왜 삼촌은 아이를 찡그리며 보고 있을까요?"라고 물으면, 인공지능은 종종 틀립니다. 그것은 행동은 보지만, 그 뒤에 숨은 이야기는 놓쳐버립니다.

해결책: 사회적 인공지능을 위한 "운전 면허"

이를 해결하기 위해 연구자들은 SIV-Bench라는 새로운 테스트를 개발했습니다. 이는 까다로운 "운전 면허" 시험과 같지만, 자동차가 도로를 달리는지 테스트하는 대신 인공지능이 복잡한 사회적 상황을 "운전"할 수 있는지 테스트합니다.

이 테스트는 단순한 아이디어에 기반합니다: 사회적 관계는 다양한 종류의 게임과 같습니다.

  • 가족/친구: 자유롭게 물건을 공유합니다 (피자를 나누는 것처럼).
  • 상사/직원: 한 사람이 지시를 내리고 다른 사람이 따릅니다 (코치와 선수처럼).
  • 낯선 사람/비즈니스: 가치에 기반해 물건을 거래합니다 (커피를 사는 것처럼).

이 테스트는 14 가지 다른 유형의 관계 (부모, 부부, 동료 등) 를 보여주는 인터넷 (틱톡과 유튜브 등) 의 2,792 개의 실제 영상 클립을 사용합니다. 각 영상마다 인공지능이 이 테스트를 통과할 수 있는지 확인하기 위해 5,455 개의 질문을 만들었습니다.

시험의 세 가지 수준

이 테스트는 세 가지 수준으로 나뉘며, 올라갈수록 어려워집니다:

  1. 1 단계: "무엇을 보나요?" 테스트 (사회적 장면 이해)

    • 과제: "그 남자는 무엇을 입고 있나요?" 또는 "그 여자는 손으로 무엇을 하고 있나요?"
    • 결과: 인공지능은 이 부분에서 꽤 잘합니다. 메뉴를 읽을 수 있는 로봇과 같습니다. 단어와 사물을 명확하게 봅니다.
  2. 2 단계: "그들은 무엇을 생각하고 있나요?" 테스트 (사회적 상태 추론)

    • 과제: "선생님이 왜 학생에게 미소 짓고 있나요?" 또는 "이 두 사람은 친구인가요, 적인가요?"
    • 결과: 인공지능이 여기서 고군분투합니다. 종종 혼란을 겪습니다. 예를 들어, 상사가 직원을 야단치는 것을 보고 단순히 시끄러운 대화를 나누는 "동료"라고 생각하며 권력 관계를 놓쳐버릴 수 있습니다. 폭풍을 보지만 사람들이 무서워한다는 것을 이해하지 못하는 로봇과 같습니다.
  3. 3 단계: "다음에 무슨 일이 일어날까요?" 테스트 (사회적 역동성 예측)

    • 과제: "상사가 야단치지 않았다면 직원은 무엇을 했을까요?" 또는 "다음에 무슨 일이 일어날까요?"
    • 결과: 이것이 가장 어려운 부분입니다. 인공지능은 사회적 규칙에 기반해 다른 현실을 상상하거나 미래를 예측해야 합니다. 인간 규칙을 진정으로 "이해"하지 못하기 때문에 여기서 종종 실패합니다.

발견: 테스트가 밝혀낸 것

연구자들이 오늘날 이용 가능한 가장 똑똑한 인공지능 모델로 이 테스트를 실행했을 때, 몇 가지 놀라운 사실을 발견했습니다:

  • 큰 두뇌는 도움이 되지만 모든 것을 해결하지는 못함: 가장 크고 강력한 인공지능 모델이 작은 모델보다 더 잘했지만, 가장 "똑똑한" 모델조차 사회적 질문의 많은 부분을 틀렸습니다. 교과서는 외웠지만 실제 세상에서 살아본 적이 없는 학생과 같습니다.
  • "관계" 혼란: 인공지능이 저지른 가장 큰 실수는 관계를 혼동하는 것이었습니다. 종종 "상사와 직원"을 "동료"와 혼동하거나, "부모와 자녀"를 "친구"와 혼동했습니다. 엄격한 선생님과 엄격한 부모의 차이를 구분하지 못했습니다.
  • 단어가 중요합니다: 연구자들은 인공지능에게 오디오(사람들이 말하는 내용) 나 자막을 제공하면 어려운 질문을 훨씬 잘 풀었다는 것을 발견했습니다. 이는 학생에게 힌트 시트를 주는 것과 같습니다. 단어가 없으면 인공지능은 종종 시각적 소음 속에서 길을 잃습니다.
  • "인간 간격": 최고의 인공지능 모델조차 실제 인간보다 훨씬 뒤처졌습니다. 인간이 이 테스트를 받았을 때 약 **74%**를 맞혔습니다. 최고의 인공지능은 약 **62%**를 맞혔습니다. 이 격차는 인공지능이 인간이 자연스럽게 가지고 있는 중요한 "사회적 직관" 조각을 여전히 놓치고 있음을 보여줍니다.

결론

이 논문은 인공지능이 세상을 보는 데는 나아지고 있지만, 사람을 이해하는 법은 여전히 배우고 있다고 결론 내립니다. 장면을 묘사할 수는 있지만, 종종 감정과 사회적 이야기를 놓쳐버립니다.

저자들은 이 테스트 (SIV-Bench) 를 공개함으로써 다른 과학자들이 표면에서 보이는 것만 보고 추측하는 것이 아니라, 인간의 감정, 관계, 행동을 진정으로 이해할 수 있는 사회적으로 지적인 인공지능을 만들기를 바라고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →