← 최신 논문
💻 computer science

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

본 논문은 정적 카메라 비디오-비디오 생성에서 정적 카메라 비디오-비디오 생성의 장기적 드리프트와 연속성 문제를 완화하기 위해 순차적 자기회귀 롤아웃을 위계적 앵커 경계 추정 전략으로 대체하는 훈련 없는 추론 스케줄러인 앵커드 트리 샘플링 (ATS) 을 소개하며, 이를 통해 정적 카메라 비디오-비디오 생성에서 우수한 품질과 안정성을 달성합니다.

원저자: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

40 분 분량의 이야기 벽화를 그리는 상상을 해보세요. 하지만 한 번에 10 초 분량의 예술만 담을 수 있는 작은 캔버스만 가지고 있습니다.

기존 방식 (자기회귀 생성): "도미노 효과"
현재 대부분의 AI 비디오 생성기는 도미노 줄처럼 작동합니다. 긴 비디오를 만들기 위해 AI 는 먼저 10 초 분량을 그리고, 그 그림을 바탕으로 다음 10 초가 어떻게 보여야 할지 추측한 뒤, 다시 그 결과를 바탕으로 다음 10 초를 추측하는 식으로 이어집니다.

이 논문은 이를 "드리프트 (Drift)" 라고 부릅니다. "전화 게임"과 마찬가지로, 매 10 초 구간마다 사소한 실수가 발생합니다. AI 가 30 분 지점에 도달할 때쯤이면 캐릭터의 얼굴이 괴물로 변형되거나, 배경 색상이 바뀌거나, 이야기가 줄거리를 잃어버릴 수 있습니다. 또한 AI 는 다음 구간을 시작하기 전에 이전 구간이 완료될 때까지 기다려야 하므로 과정이 매우 느립니다.

새로운 방식 (고정된 트리 샘플링): "건설 발판"
Descript, Inc. 의 저자들은 Anchored Tree Sampling(ATS, 고정된 트리 샘플링) 이라는 더 지적인 방식을 제안합니다. 벽화를 한 줄씩 작은 조각으로 그려나가는 대신, 그들은 발판을 세웁니다.

건설 비유를 통해 작동 원리를 설명하면 다음과 같습니다:

  1. 루트 호출 (기둥 세우기): 먼저, AI 는 40 분 분량의 전체 이야기를 한 번에 봅니다. 모든 프레임을 그리려고 시도하지 않습니다. 대신 시작점, 끝점, 그리고 그 사이의 몇몇 지점에 "앵커 기둥 (희소 프레임)"을 배치합니다. 이들을 다리를 지탱하는 주요 기둥으로 생각하세요.
  2. 정제 (간격 채우기): 이제 AI 는 첫 번째 기둥과 두 번째 기둥 사이의 간격을 봅니다. 시작과 끝이 어떻게 생겼는지 정확히 알고 그 사이 공간을 채웁니다. 두 번째 기둥과 세 번째 기둥 사이의 간격도 마찬가지입니다.
  3. 잎 (최종 세부 사항): 마지막으로, 새로 그려진 섹션 사이의 작은 간격들을 채워 전체 비디오를 완성합니다.

이것이 게임 체인저인 이유

  • 드리프트 사라짐: 비디오의 모든 구간이 알려진 시작점과 끝점으로 "고정"되어 있기 때문에 AI 는 길을 잃지 않습니다. 시작과 끝에서 빨간 차를 그리라고 지시하면, 중간에서도 차는 빨간색을 유지합니다. 흐릿하고 실수가 많은 이전 프레임을 바탕으로 추측할 필요가 없습니다.
  • 초고속: 기존 방식은 한 사람이 벽을 왼쪽에서 오른쪽으로 칠하는 것과 같습니다. 새로운 방식은 화가 팀이 협력하는 것과 같습니다. "기둥"이 세워지면, 서로 다른 팀이 벽의 다른 구간을 동시에 칠할 수 있습니다. 이로 인해 긴 비디오를 생성하는 속도가 훨씬 빨라집니다.
  • 일관성: 캐릭터가 갑자기 옷을 바꾸거나 배경이 이동하는 일 없이, 비디오는 시작부터 끝까지 특정 포즈나 엣지 드로잉과 같은 원래 지시사항을 충실히 따릅니다.

어디서 가장 잘 작동하고 (어디서 어려움을 겪는지)
이 논문은 이 방법이 정적 카메라 비디오 (사람이 카메라를 향해 말하거나 장면의 고정된 샷처럼 카메라가 격렬하게 움직이지 않는 경우) 에서는 놀라울 정도로 잘 작동한다고 보여줍니다. 이러한 경우 배경이 크게 변하지 않기 때문에 AI 가 "앵커 기둥"을 쉽게 예측할 수 있습니다.

그러나 저자들은 현재 한계가 있다고 인정합니다:

  • 동적 카메라: 카메라가 도시를 날아다니거나 빙글빙글 돌면, 시야가 너무 많이 변하기 때문에 AI 가 때때로 "앵커 기둥"을 올바르게 추측하는 데 어려움을 겪습니다.
  • 새로운 캐릭터: 시작이나 끝 "앵커"에 없던 새로운 사물이나 사람이 비디오 중간에 등장하면, AI 가 그것이 일찍 등장했을 때보다 약간 다르게 그릴 수 있습니다.
  • 텍스트 - 비디오: 현재 이 방법은 AI 에게 수정할 비디오를 제공하는 경우 (비디오 - 비디오) 가장 잘 작동합니다. 텍스트 프롬프트만 입력하는 경우 사용이 더 어렵습니다. AI 가 시작하기 위해 "앵커 기둥"이 필요하기 때문입니다.

결론
이 논문은 긴 비디오를 관리 가능하고 연결된 조각들로 나누는 "트리" 구조를 소개합니다. 비디오를 특정 지점에 고정하고 빈칸을 병렬로 채움으로써, 시간이 지남에 따라 비디오가 "부실"해지는 문제를 해결하고 과정을 훨씬 더 빠르게 만들었습니다. 이전 방법들은 오류 없이 이를 수행하는 데 어려움을 겪었던 40 분 분량의 일관성 있고 고품질의 비디오를 성공적으로 생성했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →