← 최신 논문
💻 computer science

Geometry-Instructed Video Editing

이 논문은 통합된 객체 상태 정식화와 깊이/방향 박스 스트림을 활용하여 신뢰할 수 있고 시간적으로 일관된 객체 수준의 기하학적 편집과 그림자 및 반사와 같은 일관된 부차적 효과를 달성하는 기하학 지시형 비디오 편집 프레임워크인 GIVE를 소개한다.

원저자: Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaojuan Qi

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaojuan Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 친구가 길을 걷고 있는 홈 비디오가 있다고 상상해 보세요. 당신은 이 영상을 편집하고 싶지만, 단순히 픽셀 위에 색을 덧칠하는 수준을 넘어 그 이상의 것을 원합니다. 친구를 왼쪽으로 세 걸음 이동시키거나, 카메라를 향하도록 회전시키거나, 장난감처럼 크기를 축소하고 싶습니다.

Blender나 Unreal Engine 같은 전통적인 영상 편집 소프트웨어에서는 컴퓨터가 모든 것의 3D 형태를 알고 있기 때문에 이런 작업이 쉽습니다. 하지만 생성형 AI(무에서 유를 창조하는 방식의 비디오 생성 AI)에서는 컴퓨터가 보통 영상이 어떻게 보여야 할지 단순히 "추측"할 뿐입니다. 만약 당신이 사람을 움직이라고 요청한다면, AI는 그 사람이 어색하게 미끄러지듯 움직이거나, 그림자가 잘못 변하거나, 혹은 사라졌다가 다시 나타나는 식의 오류를 범할 수 있습니다.

이 논문은 GIVE(Geometry-Instructed Video Editing, 기하학적 지시 기반 비디오 편집)를 소개합니다. 이는 3D로 전체 영상을 먼저 재구축하지 않고도, AI가 어떻게 정밀한 3D 움직임을 수행하도록 가르칠 수 있는지에 대한 새로운 방법을 제시합니다.

작동 원리는 다음과 같습니다.

1. 문제점: "눈먼" 편집자

현재의 AI 비디오 편집기는 캔버스의 표면만 볼 수 있는 화가와 같습니다. 만약 당신이 "컵을 옮겨줘"라고 말한다면, 그들은 컵의 3D 위치를 이해하지 못하기 때문에 페인트를 문지르거나 컵의 모양을 바꿔버릴 수도 있습니다.

  • 결과: 편집된 모습이 지저분해 보이고, 그림자가 물체와 함께 움직이지 않으며, 영상이 깜빡거릴 수 있습니다.
  • 기존의 해결책: 일부 방식은 비디오 전체를 먼저 완전한 3D 모델로 구축하려고 시도합니다. 하지만 이는 느리고 비용이 많이 들며, 복잡한 움직임(예: 춤을 추는 사람)이 있는 경우 제대로 작동하지 않는 경우가 많습니다.

2. 해결책: "전과 후"의 청사진

GIVE는 세상 전체를 재구축하려고 하지 않습니다. 대신 영리한 트릭을 사용합니다. 물체가 지금 어디에 있는지, 그리고 나중에 어디에 있어야 하는지에 대한 청사진을 요구하는 것입니다.

마치 감독에게 두 개의 간단한 스케치를 주는 것과 같습니다:

  1. 스케치 A ("깊이 박스"): 물체가 방 안의 어디에 놓여 있는지(얼마나 떨어져 있고 크기가 얼마인지) 보여주는 대략적인 윤곽선.
  2. 스케치 B ("방향 박스"): 물체가 어느 방향을 향하고 있는지 보여주는 간단한 화살표.

당신은 AI에게 "전"의 스케치와 "후"의 스케치를 제공합니다. AI의 임Задача는 스케치 A를 스케치 B로 바꾸는 마법 같은 변환 과정을 찾아내는 것이며, 이 과정에서 나머지 부분(배경, 조명, 다른 사람들)은 정확히 그대로 유지해야 합니다.

3. 핵심 비결: "트레이닝 체육관"

AI가 이 작업을 완벽하게 수행하도록 어떻게 가르칠 수 있을까요? 단순히 실제 영상을 보여주는 것만으로는 부족합니다. 실제 영상에는 단 하나의 물체만 움직이는 "전과 후"의 쌍(pair)이 존재하지 않기 때문입니다.

저자들은 게임 엔진(Unreal Engine)을 사용하여 가상 트레이닝 체육관을 구축했습니다.

  • 과정: 컴퓨터가 수천 개의 가짜 영상을 만들도록 프로그래밍했습니다. 이 영상들 속에서 로봇은 물체를 집어 들거나, 이동시키거나, 회전시키거나, 삭제한 뒤, "전" 버전과 "후" 버전을 즉시 렌더링합니다.
  • 이점: 게임 엔진을 사용하기 때문에, 컴퓨터는 그림자가 어떻게 변해야 하는지, 반사가 어떻게 보여야 하는지를 정확히 알고 있습니다. 따라서 AI가 학습할 수 있는 완벽한 "교사" 예시를 만들어냅니다.

4. 사용 방법 (사용자 인터페이스)

GIVE를 사용할 때 당신은 3D 아티스트가 될 필요가 없습니다.

  1. 영상을 업로드합니다.
  2. 움직이고 싶은 물체를 클릭합니다.
  3. 무엇을 할지 명령합니다 (예: "90도 회전").
  4. 시스템은 기존의 도구들을 자동으로 사용하여 3D 형태와 방향을 추측하고, 그 "전과 후"의 스케치(기하학적 스트림)를 생성하여 AI에 입력합니다.
  5. AI가 새로운 영상을 생성합니다.

5. 할 수 있는 작업들

논문은 GIVE가 다음과 같은 다양한 "디지털 콘텐츠 제작(DCC)" 작업을 처리할 수 있음을 보여줍니다:

  • 이동(Translation): 물체를 새로운 위치로 미끄러지듯 옮기기.
  • 회전(Rotation): 물체를 다른 방향을 향하도록 돌리기.
  • 크기 조절(Scaling): 물체를 더 크게 또는 더 작게 만들기.
  • 복제(Duplication): 물체의 복사본 만들기.
  • 제거(Removal): 물체를 사라지게 만들기 (그리고 배경을 올바르게 채우기).
  • 궤적(Trajectory): 특정 경로를 따라 물체 이동시키기.

요약

GIVE는 AI에게 3D 안경과 자를 쥐여주는 것과 같습니다. 물체를 어떻게 움직일지 추측하는 대신, 물체의 위치와 방향에 대한 간단한 "전"과 "후"의 지도를 활용합니다. 이를 통해 전체 영상을 3D로 재구축하지 않고도 그림자, 반사, 배경을 일관되게 유지하며 물체를 사실적으로 움직일 수 있습니다.

이 논문은 이 방식이 특히 정밀한 3D 움직임이 필요한 작업에서 현재의 상용 영상 편집기보다 더 정확하고 신뢰할 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →