← 최신 논문
🤖 machine learning

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track은 공간 인지적 포인트 트랙 임베딩과 하이브리드 학습 전략을 도입함으로써, 비디오 시퀀스 전반에 걸쳐 정밀한 모션 제어와 고충실도 합성(high-fidelity compositing)을 가능하게 하기 위해 포인트 트래킹과 다중 참조 이미지를 결합한 통합 비디오 생성 프레임워크이다.

원저자: Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 편집하려는 영화 감독이라고 상상해 보십시오. 당신에게는 구체적인 비전이 있습니다. 사진 속의 캐릭터가 당신의 장면 속으로 걸어 들어와, 환경과 상호작용하며, 당신이 원하는 방식 그대로 움직이기를 바라는 것입니다.

현재 기존의 AI 비디오 도구들은 서투른 조수와 같습니다. 어떤 도구들은 캐릭터를 움직이게 할 수는 있지만, 캐릭터를 반드시 영상의 첫 프레임에서 시작하게만 할 수 있습니다. 만약 당신이 장면 중간에 캐릭터가 걸어 들어오길 원한다면, AI는 혼란에 빠집니다. 또 다른 도구들은 사진을 가져와 영상 속에 넣을 수는 있지만, 그 사진을 어떻게 자연스럽게 "춤추게" 하거나 움직이게 해야 하는지는 전혀 모릅니다. 그저 가만히 있거나 일반적이고 로봇처럼 움직일 뿐입니다.

**"Go-with-the-Track"**은 마스터 인형술사처럼 행동하는 새로운 AI 도구입니다. 이 도구는 **"포인트 트랙(point-tracks)"**이라 불리는 기술을 사용하여 이 두 가지 문제를 동시에 해결합니다.

핵심 아이디어: 보이지 않는 실

포인트 트랙을 영상 속 특정 지점(예: 코끝, 자동차 바퀴, 혹은 나뭇잎)에 묶인 보이지 않는 실이라고 생각하십시오. 영상이 재생됨에 따라, 이 실은 프레임 단위로 그 지점을 따라갑니다.

과거에는 이 실들이 오직 '첫 번째 프레임'에만 묶일 수 있었습니다. 만약 당신이 나중에 새로운 물체를 추가하고 싶다면, 그 물체에는 실을 묶을 수 없었습니다. 왜냐하면 그 물체가 처음부터 존재하지 않았기 때문입니다.

Go-with-the-Track은 규칙을 바꿉니다. 이 도구는 이러한 보이지 않는 실을 영상뿐만 아니라 당신의 **참조 사진(reference photos)**에도 묶을 수 있게 해줍니다.

  • 비유: 당신에게 빨간 공 사진이 있다고 가정해 봅시다. 당신은 사진 속의 공 위에 점을 하나 찍습니다. 그런 다음, 당신의 영상 속 공 위에도 점을 하나 찍습니다. 이제 AI는 이렇게 이해합니다: "사진 속의 빨간 공은 영상 속의 빨간 공과 동일하며, 반드시 이 특정 경로를 따라 움직여야 한다."

이를 통해 당신은 AI에게 이렇게 명령할 수 있습니다: "이 사진에서 빨간 공을 가져와서, 설령 장면 중간에 등장하더라도 영상 속의 이 경로를 따라 정확하게 굴러가게 만들어라."

작동 원리 (마법의 기술들)

이 논문은 AI가 이 작업을 매우 잘 수행하기 위해 사용하는 세 가지 주요 "기술"을 설명합니다.

1. "스마트 ID 카드" (공간 인식 임베딩 - Spatially-Aware Embeddings)
이전에는 AI가 수천 개의 점을 추적하려고 할 때, 각 점에 무의미한 랜덤 ID 번호(예: "ID #492")를 부여했습니다. 이는 군중 속에서 친구를 찾을 때 무작위 숫자를 외치는 것과 같았습니다.

  • 혁신: Go-with-the-Track은 각 점에 실제 위치와 움직임을 기반으로 한 "스마트 ID 카드"를 부여합니다. 이는 마치 친구에게 "나는 나무 근처를 걷고 있는 사람이야"라고 적힌 이름표를 달아주는 것과 같습니다. ID가 실제 위치를 기반으로 하기 때문에, AI는 두 점이 서로 멀리 떨어져 있더라도 사진 속의 점이 영상 속의 어느 점과 일치하는지 즉각적으로 이해할 수 있습니다. 이 덕분에 추적이 매우 정밀해집니다.

2. "압축 슈트" (어댑터 - The Adapter)
AI 비디오 모델은 에너지를 아끼기 위해 "압축된" 세상(저해상도 스케치와 같은 상태)에서 작동하지만, 당신의 포인트 트랙은 고해상도의 디테일입니다. 보통 고해상도 디테일을 저해상도 스케치로 압축하면 미세한 움직임(예: 미묘한 머리 돌림)을 놓치게 됩니다.

  • 혁신: 팀은 고해상도 포인트 트랙을 AI의 저해상도 세상에 완벽하게 맞출 수 있는 특별한 "어댑터(압축 슈트)"를 제작했습니다. 이는 정보의 손실 없이 미세하고 중요한 움직임의 디테일을 모두 유지하여, 캐릭터가 흐릿한 덩어리처럼 보이지 않도록 보장합니다.

3. "훈련 체육관" (하이브리드 데이터 - The Training Gym)
물체를 완벽하게 움직이는 법을 배우기 위해 AI는 연습이 필요합니다. 실제 영상은 무질서합니다. "실(포인트 트랙)"이 끊어지거나 길을 잃는 경우가 많기 때문입니다.

  • 혁신: 팀은 단순히 지저-한 실제 영상만으로 학습하는 대신, 다음과 같은 혼합 데이터를 사용하여 AI를 훈련시켰습니다:
    • 완벽한 합성 데이터(Perfect Synthetic Data): AI가 모든 점의 위치를 정확히 알고 있는 컴퓨터 생성 세계(완벽한 물리 법칙이 적용된 비디오 게임과 같은 환경).
    • 정적인 장면(Static Scenes): 아무것도 움직이지 않는 방 안에서, 카메라가 움직이는 상황을 다루는 법을 학습합니다.
    • 실제 영상(Real Videos): 실제 사람과 물체가 어떻게 보이는지 배우기 위한 데이터입니다.
      이러한 혼합 학습을 통해 AI는 합성 데이터로부터 '정밀함'을, 실제 데이터로부터 '사실감'을 배워 정밀하면서도 현실적인 움직임을 구현할 수 있게 되었습니다.

실제로 무엇을 할 수 있나요?

이 논문은 이 "인형술사" 기술이 빛을 발하는 몇 가지 구체적인 응용 사례를 보여줍니다:

  • 비디오 스타일 재구성 (Video Restylization): 사람이 걷는 영상을 가져와서 AI에게 "이 사람을 특정 사진 속의 그림처럼 만들어라"라고 명령할 수 있습니다. AI는 정확한 걷기 동작은 그대로 유지하면서, 외형만을 사진의 스타일과 일치하도록 변경합니다.
  • 메쉬 기반 합성 (Mesh-Driven Compositing): 3D 애니메이션(예: 움직이는 로봇 팔)을 가져와서 AI에게 로봇을 특정 캐릭터로 교체하도록 명령할 수 있습니다. 이때 캐릭터는 로봇의 움직임을 똑같이 따라 하게 됩니다.
  • 카메라 제어 (Camera Control): 정적인 방이나 움직이는 자동차가 담긴 영상을 가져와서 AI에게 "새로운 각도로 카메라를 이동시켜라"라고 명령할 수 있습니다. AI는 포인트 트랙을 사용하여 3D 공간을 이해하고, 물체들을 제자리에 둔 채 새로운 각도에서 본 영상을 생성합니다.
  • 멀티 레퍼런스 (Multi-Reference): 여러 장의 사진을 사용할 수 있습니다. 예를 들어, 캐릭터의 얼굴을 위한 사진, 옷을 위한 다른 사진, 그리고 배경을 위한 세 번째 사진을 각각 지정하여, AI가 이들을 하나의 움직임에 맞춰 자연스럽게 결합하도록 할 수 있습니다.

결론

Go-with-the-Track은 영상에 무엇이 나타날지와 그것이 어떻게 움직일지에 대해 영화 제작자와 크리에이터들에게 마침내 정밀한 통제권을 부여하는 도구입니다. 이는 AI가 추측하게 만드는 것을 멈추고, 단순한 점과 사진을 사용하여 복잡하고 영화적인 영상을 생성하도록 사용자가 직접 액션을 지시할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →