← 최신 논문
🤖 AI

Social Structure Matters in 3D Human-Human Interaction Generation

이 논문은 LLM이 근본적인 사회적 구조(단계 및 역할)를 추론하고 모션 실행기가 이 구조를 물리적으로 타당하고 조율된 2인 모션으로 구체화하는 플래너-실행기 패러다임을 채택함으로써, 텍스트 기반 3D 인간 간 상호작용 생성의 과제를 해결하는 "Solo-to-Social" 프레임워크를 제안한다.

원저자: Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: 두 사람, 하나의 텍스트

두 사람이 포옹하는 그림을 그려달라고 컴퓨터에게 요청한다고 상상해 보세요. 만약 단순히 "포옹"이라고만 요청한다면, 컴퓨터는 두 사람이 그냥 옆에 서 있게 그리거나, 한 사람이 벽을 껴안고 있는 모습을 그릴지도 모릅니다.

3D 애니메이션의 세계에서, 텍스트 설명(예: "한 사람이 다가가서, 껴안고, 그 다음 놓는다")을 바탕으로 두 사람이 함께 사실적으로 움직이게 만드는 것은 매우 어려운 일입니다. 기존의 방식들은 이를 동시에 일어나는 두 개의 별개인 솔로 댄스로 취급했습니다. 하지만 인간의 상호작용은 단순히 두 개의 솔로 댄스가 아니라, 움직임의 대화입니다.

저자들은 이러한 애니메이션에 빠져 있는 핵심적인 재료가 바로 **사회적 구조(Social Structure)**라고 주장합니다.

"사회적 구조"란 무엇인가?

사회적 상호작용을 연극 무대 위의 연극이라고 생각해 보세요.

  • 솔로 동작 (Solo Motion): 이것은 배우가 혼자서 대사를 연습하는 것과 같습니다. 그들은 걷기, 손 흔들기, 점프하기 등을 할 줄 압니다.
  • 사회적 구조 (Social Structure): 이것은 대본과 무대 지시문입니다. 이는 당신에게 다음을 알려줍니다:
    1. 단계 (Phases): 이야기는 막(Act)으로 구성됩니다 (예: 접근, 접촉, 해제). 누군가를 껴안기 전에 먼저 다가가는 단계가 필요합니다. 껴안기도 전에 먼저 껴안을 수는 없으니까요.
    2. 역할 (Roles): 모든 장면에서, 누가 무엇을 하고 있나요? A가 "껴안는 사람"이고 B가 "껴안기를 받는 사람"인가요? 아니로 A가 "공격자"이고 B가 "방어자"인가요?

이러한 구조가 없다면, 컴퓨터는 A가 껴안으려고 할 때 B는 걸어가고 있거나, 혹은 서로 엉뚱한 방향을 향하게 만들 수 있습니다. 그 결과는 서로를 모르는 두 사람이 움직이는 것처럼 보일 뿐, 서로 상호작용하는 것처럼 보이지 않게 됩니다.

발견: "생각하는 자" vs "춤추는 자"

연구진들은 매우 똑똑한 AI(대규모 언어 모델 또는 LLM)를 테스트하여 이 모든 작업을 혼자서 처리할 수 있는지 확인했습니다. 그들은 명확한 능력의 차이를 발견했습니다:

  1. LLM은 훌륭한 "감독" (생각하는 자):
    만약 LLM에게 장면을 계획하라고 요청한다면, 그것은 매우 뛰어납니다. LLM은 이야기를 단계별로 나누고("먼저 걷고, 그다음 접촉하고, 그다음 분리한다"), 역할을 할당할 수 있습니다("A가 시작하고, B가 받는다"). LL-M은 상호작용의 논리를 완벽하게 이해합니다.

  2. LLM은 형편없는 "무용수" (실행하는 자):
    하지만, LLM에게 실제 3D 움직임(뼈의 좌표값)을 생성하라고 요청하면 실패합니다. LLM은 딱딱하거나, 정적이거나, 흔들리는 움직임을 만들어냅니다. 이는 마치 장면이 어떻게 보여야 하는지는 정확히 알지만, 자신의 몸을 어떻게 움직여야 하는지는 배워본 적 없는 감독과 같습니다.

해결책: "플래너-실행자" 팀

LLM은 생각하는 데는 능숙하지만 움직이는 데는 서투르기 때문에, 저자들은 **"LLM으로 생각하고, 모션 스킬로 움직인다"**라는 두 부분으로 구성된 팀을 만들었습니다.

파트 1: 플래너 (The Planner - LLM)

LLM은 작가이자 감독 역할을 합니다.

  • 단순한 텍스트 프롬프트(예: "두 사람이 하이파이브를 한다")를 받습니다.
  • 이를 구조화된 계획으로 나눕니다:
    • 1단계 (접근): A가 B를 향해 걸어갑니다.
    • 2단계 (접촉): A가 손을 들고, B가 손을 듭니다.
    • 3단계 (해제): 그들이 손을 떼고 떨어집니다.
  • 결정적으로, 각자 무엇을 해야 하는지 알 수 있도록 구체적인 역할을 부여합니다.

파트 2: 실행자 (The Executor - 모션 모델)

실행자는 수천 시간의 솔로 인간 움직임(마치 수백만 번의 스텝을 연습한 전문 무용수와 같은)을 학습한 특화된 로봇입니다.

  • 이 로봇에게 처음부터 모든 것을 배우게 하는 대신, 저자들은 특수한 업그레이드(LoRA라고 불림)를 제공했습니다.
  • 이 업그레이드는 로봇이 감독의 계획을 경청할 수 있게 해줍니다.
  • 마법 같은 기술: 로봇은 단순히 움직이는 것이 아니라, 상대방을 기준으로 움직입니다.
    • 자기 조건화 (Self-Conditioning): 부드러운 전환을 보장하기 위해(단계 사이에서 덜컥거리는 현상을 방지하기 위해) 자신이 방금 무엇을 했는지 기억합니다.
    • 파트너 조건화 (Partner-Conditioning): 로봇은 상대방이 지금 당장 어디에 있는지 보고 자신의 움직임을 맞춥니다. 만약 파트너가 뒤로 물러나면, 로봇은 그들을 만나기 위해 앞으로 발을 내디딥니다.

결과: 조화로운 댄스

감독의 대본(사회적 구조)과 무용수의 근육 기억(모션 스킬)을 결합함으로써, 이 시스템은 다음과 같은 애니메이션을 만들어냅니다:

  • 타이밍이 완벽합니다 (서로의 손을 놓치지 않습니다).
  • 역할이 타당합니다 (껴안는 사람은 실제로 껴안고, 껴안기를 받는 사람은 실제로 받아들입니다).
  • 움직임이 자연스럽게 흐릅니다 (마치 실제 인간처럼).

요약 비유

당신이 집을 짓고 싶다고 상상해 보세요.

  • 기존 방식: 당신은 두 명의 벽돌공을 고용하고 "집을 지으세요"라고 말했습니다. 그들은 각자 벽을 쌓았지만, 벽들이 서로 연결되지 않았고 지붕은 공중에 떠 있었습니다.
  • LLM 단독 사용: 당신은 완벽한 청사진을 작성했지만 흙손을 잡을 줄 모르는 건축가를 고용했습니다. 청사진은 훌륭했지만, 집은 결코 지어지지 않았습니다.
  • 이 논문의 방식: 당신은 상세하고 단계적인 계획과 특정 작업자를 위한 역할을 담은 청사진을 작성하는 건축가를 고용했습니다. 그런 다음, 숙련된 기술을 가진 **마스터 빌더(숙련된 건설자)**를 고용했습니다. 건축가는 빌더에게 매 단계마다 정확히 무엇을 해야 하는지 알려주고, 빌더는 자신의 전문적인 기술을 사용하여 벽돌을 완벽하게 쌓습니다. 그 결과, 제대로 서 있고 의도한 대로 보이는 집이 완성됩니다.

이 논문은 두 사람이 3D에서 현실적으로 상호작용하기 위해서는, 텍キスト AI에게 물리적인 춤을 강요하는 것이 아니라, 사회적 대본(단계와 역할)을 명시적으로 모델링하고 특화된 모션 모델이 이를 실행하도록 해야 한다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →