← 최신 논문
🧬 biology

Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception

본 논문은 임베딩 기하학을 인간의 유사성 판단과 일치하도록 제약함으로써 비디오 기초 모델을 인간의 사회적 지각과 정렬시키는 하이브리드 목적 함수인 행동 기하학적 감독 (BGS) 을 소개하며, 이를 통해 모델은 언어 기반 기준선보다 현저히 우수한 성능을 발휘하고 해석 가능한 사회 정서적 속성을 개발하며 해당 특징에 대한 명시적 훈련 없이도 사회적으로 정보적인 영역에 주의를 기울이게 됩니다.

원저자: Kathy Garcia, Leyla Isik

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kathy Garcia, Leyla Isik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

간단한 언어와 일상적인 비유를 사용하여 이 논문을 설명합니다.

큰 문제: AI 는 지켜보지만 사람을 "이해"하지 못함

두 사람이 싸우는 영상을 매우 똑똑한 AI 와 인간에게 보여준다고 상상해 보세요.

  • 인간은 사회적 뉘앙스를 즉각 이해합니다. "서로 화가 나 있지만 여전히 서로를 아끼고 있다"거나 "이것은 장난스러운 경쟁이다"라고 파악하는 식입니다.
  • AI(특히 현재 이용 가능한 최고의 비디오 모델)는 대부분 움직이는 픽셀만 봅니다. "한 사람이 손을 들고 있다"거나 "누군가 소리를 지르고 있다"는 정도는 인식할 수 있지만, 사람들 사이의 관계감정을 이해하지는 못합니다.

연구자들은 AI 에게 세 개의 비디오 클립 중 가장 유사한 두 개를 고르라고 요청했을 때, 비디오 캡션을 읽기만 하는 간단한 텍스트 기반 AI 보다 성능이 떨어졌음을 발견했습니다. 즉, AI 는 실제로 "영화를 보며 사회적 역학을 이해하는 것"보다 "영화 요약본을 읽는 것"에 더 능숙했습니다.

해결책: "다른 하나 찾기" 게임으로 AI 에게 가르치기

연구자들은 값비싼 뇌 스캔이나 막대한 양의 새로운 데이터 없이 이를 해결하고자 했습니다. 그들은 **행동 기하학적 감독 **(Behavioral Geometric Supervision, BGS)이라는 방법을 도입했습니다.

교과서를 주는 대신 게임을 통해 아이에게 감정을 인식하도록 가르치는 것과 같다고 생각해보세요:

  1. 게임: AI 에게 세 개의 짧은 비디오 클립을 보여줍니다. 그리고 묻습니다. "어떤 것이 다른 하나 (odd-one-out) 인가요?" (예: "두 개의 클립은 친구들이 포옹하는 모습을, 한 클립은 낯선 사람들이 싸우는 모습을 보여줍니다. 무엇이 다른가요?")
  2. 인간 교사: 인간들은 이 게임을 수천 번 플레이하여 우리가 사회적 유사성을 어떻게 보는지에 대한 거대한 지도를 만들었습니다.
  3. 수업: 연구자들은 AI 에게 정답만 알려주지 않았습니다. 대신 AI 의 내부 "뇌"를 조정하여 비디오 간의 "거리"에 대한 수학적 이해가 인간 지도와 일치하도록 했습니다. 만약 인간이 비디오 A 와 비디오 B 가 매우 유사하다고 생각했다면, AI 는 A 와 B 의 내부 표현을 서로 매우 가깝게 만들도록 강요받았습니다.

마법의 재료

이를 효율적으로 수행하기 위해 두 가지 주요 도구를 사용했습니다:

  • LoRA(Low-Rank Adaptation, 저랭크 적응) 비디오 AI 를 거대하고 무거운 도서관이라고 상상해 보세요. 도서관 전체를 다시 짓는 대신, 새로운 사회적 규칙을 학습하는 작고 가벼운 "공책"(AI 의 뇌의 2% 미만 업데이트) 을 추가했습니다. 이는 빠르고 저렴했습니다.
  • **하이브리드 로스 **(Local + Global, 지역적 + 전역적) 그들은 AI 에게 두 가지 방식으로 동시에 가르쳤습니다:
    • **지역적 **(Local) "이 특정 비디오 쌍이 저것보다 더 가깝도록 하라"(특정 게임 정답을 맞추는 것과 같음).
    • **전역적 **(Global) "관계의 전체 지도가 인간 지도처럼 보이도록 하라"(사회적 세계의 일반적인 형태를 이해하는 것과 같음).

결과: 무엇이 변했나요?

이 훈련 후 AI 는 단순히 게임에서 더 잘하게 된 것을 넘어, 세상을 "보는" 방식이 근본적으로 변했습니다.

  1. 텍스트 기반 AI 를 능가함: 훈련된 비디오 모델은 캡션을 읽는 텍스트 기반 모델보다 인간의 사회적 판단을 더 잘 맞추게 되었습니다. 이는 AI 가 단어만으로는 포착할 수 없는 시각적인 무언가를 학습했음을 증명합니다.
  2. "보이지 않는" 특성을 학습함: AI 는 "분노", "기쁨", "지배력"이 무엇을 의미하는지 단 한 번도 알려지지 않았음에도 불구하고, 이러한 개념들을 스스로 인식하기 시작했습니다. 마치 "우정"의 많은 예시를 공부한 학생이 아무도 그 단어를 정의해 주지 않았음에도 불구하고 갑자기 "신뢰"를 식별하게 되는 것과 같습니다.
  3. 올바른 것을 보게 됨: 훈련 전에는 AI 가 배경이나 무작위 신체 부위를 바라보았습니다. 훈련 후에는 얼굴, 눈, 손으로 주의가 옮겨졌습니다. 이는 인간이 사회적 상호작용을 이해하기 위해 바라보는 정확한 곳들입니다.
  4. 춤추는 법을 잊지 않음: 보통 AI 에게 새로운 기술을 가르치면 이전 기술을 잊게 됩니다. 하지만 이 AI 는 여전히 "춤추기"나 "달리기"와 같은 표준 행동을 이전과 마찬가지로 잘 인식했습니다. 이는 원래 기술을 잃지 않고 사회적 이해력을 추가한 것입니다.

결론

이 논문은 비디오 AI 모델이 이미 인간 사회적 상호작용을 이해할 수 있는 원시 데이터를 가지고 있지만, 그 데이터에 대해 "잠들어" 있음을 보여줍니다. 소량의 인간 행동 데이터 (사람들이 "다른 하나 찾기" 게임을 하는 것) 를 사용하여 연구자들은 이 사회적 이해력을 "깨울" 수 있었습니다.

그들은 인간 행동에 대한 복잡한 규칙으로 AI 를 프로그래밍할 필요가 없음을 증명했습니다. 단지 AI 에게 인간이 비디오를 어떻게 비교하는지 보여주면, AI 는 자연스럽게 우리가 세상을 보는 방식을 학습하게 된다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →