← 최신 논문
💻 computer science

Generative Motion In-betweening by Diffusion over Continuous Implicit Representations

본 논문은 매우 희소한 키프레임으로부터 키프레임 정확도를 엄격히 유지하고 모션 연속성을 보장하면서도 매끄럽고 다양한 모션 전환을 효과적으로 재구성하는 운동 암시적 신경 표현 (INR) 기반의 새로운 잠재 확산 모델 파이프라인을 제안한다.

원저자: Shiyu Fan, Paul Henderson, Edmond S. L. Ho

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shiyu Fan, Paul Henderson, Edmond S. L. Ho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 A 지점에서 B 지점으로 걸어가는 캐릭터의 영화를 만들려는 애니메이터라고 상상해 보세요. 옛날에는 모든 프레임을 손으로 하나씩 그려야 했습니다. 이후에는 컴퓨터가 시작 자세와 끝 자세만 제공받으면 그 사이의 프레임을 '추측'할 수 있게 되었습니다. 이를 **모션 인-비트위닝 (motion in-betweening)**이라고 합니다.

하지만 현재 컴퓨터 프로그램은 몇 개의 '키프레임'(캐릭터 자세의 스냅샷) 만 제공받을 경우 종종 어려움을 겪습니다. 캐릭터의 발이 얼음 위를 미끄러지듯 바닥을 미끄러지거나, 움직임이 떨리거나 부자연스러워 보일 수 있습니다. 또한 시작점과 끝점에서 캐릭터가 있어야 할 정확한 위치를 잊어버리기도 합니다.

이 논문은 **연속적 암시적 표현을 통한 확산 기반 생성 모션 인-비트위닝 (Generative Motion In-betweening by Diffusion over Continuous Implicit Representations)**이라는 새로운 도구를 소개합니다. 이름이 길어 보이니 몇 가지 비유를 들어 설명해 보겠습니다.

1. 문제: '픽셀화된' 대 '부드러운' 지도

대부분의 애니메이션 컴퓨터는 시간을 구슬로 만든 목걸이처럼 다룹니다. 특정 시간의 특정 구슬 (프레임) 만 인식할 뿐입니다. 만약 구슬들이 멀리 떨어져 있다면, 그들을 연결하는 실을 추측해야 합니다. 종종 이 추측이 틀려서 움직임이 경직되거나 '발 미끄러짐'이 발생합니다.

저자들은 대신 부드러운 연속 지도를 사용할 것을 제안합니다. 그들은 **암시적 신경 표현 (Implicit Neural Representation, INR)**이라는 것을 사용합니다.

  • 비유: 저해상도 디지털 사진 (픽셀화되고 블록처럼 보이는) 과 고해상도 벡터 드로잉 (얼마나 확대해도 완벽해 보이는 부드러운 선) 의 차이를 상상해 보세요.
  • 작동 원리: 자세 목록을 저장하는 대신, 이 시스템은 전체 움직임을 단일하고 끊어지지 않는 곡선으로 설명하는 '부드러운 함수'를 학습합니다. 이는 컴퓨터가 움직임을 연결되지 않은 일련의 스냅샷이 아닌, 연속적인 흐름으로 이해하게 함을 의미합니다. 이는 자연스럽게 '떨림'을 방지하고 움직임을 훨씬 더 자연스럽게 만듭니다.

2. 엔진: '확산' 예술가

희소한 키프레임 사이의 간격을 채우기 위해 저자들은 **확산 모델 (Diffusion Model)**을 사용합니다.

  • 비유: 확산을 소음으로 가득 차고 혼란스러운 점토 덩어리로 시작하는 조각가에 비유해 보세요. 조각가는 소음을 천천히 깎아내어 형태를 정제하고 완벽한 동상이 드러날 때까지 다듬습니다.
  • 작동 원리: 컴퓨터는 무작위 소음으로 시작하여 이를 서서히 '소음 제거'하여 움직임을 생성합니다. 여기서의 과제는 이 새로운 움직임이 자연스러운 움직임의 다양성을 잃지 않으면서도 특정 시작점과 끝점 (키프레임) 과 일치하도록 보장하는 것입니다.

3. 비밀 재료: '암시적 매니폴드 가이드 (Implicit Manifold Guidance, IMG)'

여기가 가장 큰 혁신입니다. 보통 확산 모델이 "이 특정 시간에 이 특정 위치에 있어야 한다"와 같은 특정 규칙을 따르려고 할 때 혼란에 빠집니다. 규칙을 너무 엄격하게 따라 움직임이 경직되거나, 규칙을 무시하고 빗나갈 수 있습니다.

저자들은 **암시적 매니폴드 가이드 (IMG)**라는 새로운 조향 메커니즘을 고안했습니다.

  • 비유: 특정 목적지 (키프레임) 로 당신을 끌어당기는 무거운 추를 들고 있는 동안, 줄타기 (자연스러운 움직임의 '매니폴드' 또는 부드러운 경로) 를 하려고 한다고 상상해 보세요.
    • 목적지를 향해 너무 세게 당기면 줄에서 떨어질 수 있습니다 (움직임이 부자연스러워짐).
    • 줄 위에만 머무르면 목적지를 놓칠 수 있습니다.
    • IMG 는 균형입니다. 이는 두 가지를 지속적으로 확인합니다:
      1. 기하학적 오차: "우리가 올바른 위치에 있나요?" (발이 제자리에 떨어졌나요?)
      2. 매니폴드 오차: "우리는 여전히 자연스럽게 걷고 있나요?" (우리는 부드럽고 자연스러운 경로 위에 있나요?)
  • 결과: 이 시스템은 움직임을 부드럽게 밀어내어 키프레임을 정확하게 맞추면서도 물리 법칙을 깨거나 로봇처럼 보이게 하지 않습니다. '조각가'가 소음을 깎아내는 동안 경로를 실시간으로 수정합니다.

4. 왜 이것이 중요한가

이 논문은 이 세 가지 요소 (부드러운 연속 지도 + 확산 조각 + 스마트 조향) 를 결합함으로써 다음과 같은 효과를 거둔다고 주장합니다:

  • 정확성: 두세 개의 스냅샷만 제공받았더라도 캐릭터가 요청한 정확한 시작 및 끝 자세에 도달합니다.
  • 품질: 발 미끄러짐이나 떨림 없이 움직임이 부드럽습니다.
  • 다양성: 매번 똑같은 지루한 걸음을 만들어내는 이전 방법들과 달리, 이 시스템은 A 에서 B 로 가는 여러 가지 다른 사실적인 방법을 생성할 수 있습니다.
  • 텍스트 불필요: "행복한 걸음"과 같은 설명을 입력할 필요가 없습니다. 제공된 자세만 사용하면 작동합니다.

요약

이 논문은 컴퓨터에게 몇 개의 대략적인 스케치만 보고도 영화의 나머지를 부드럽고 사실적이며 다양한 연기로 채워 넣을 수 있는 마스터 애니메이터가 되도록 가르치는 것과 같습니다. 동시에 캐릭터가 당신이 지시한 정확한 위치에 착지하도록 보장합니다. 그들은 컴퓨터에게 움직임을 끊어지는 일련의 발걸음이 아닌, 부드럽고 연속적인 강으로 보게 한 다음, 코스에 머무르기 위한 특별한 나침반을 제공함으로써 이를 달성했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →