← 최신 논문
💻 computer science

EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

EverAnimate 는 지속적 잠재 전파와 복원 흐름 매칭을 결합하여 잠재적 컨텍스트 메모리에 생성을 고정함으로써 분 단위 인간 애니메이션을 가능하게 하는 효율적인 사후 학습 방법으로, 이를 통해 누적된 시각적 및 의미적 편향을 제거하면서도 캐릭터 정체성과 배경 품질을 유지합니다.

원저자: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 무용수가 복잡한 안무를 수행하는 장편의 연속 영상을 촬영한다고 상상해 보세요. 무용수의 사진 (참고 자료) 과 동작 대본 (포즈) 이 있습니다. 목표는 90 초 동안 춤을 추더라도 사진 속 사람과 정확히 동일한 외모를 유지하면서 대본을 완벽하게 따르는 영상을 생성하는 것입니다.

이 논문인 EverAnimate는 AI 가 이러한 장편 영상을 만들 때 발생하는 특정 문제를 다룹니다. 즉, AI 는 시간이 지남에 따라 '이탈'하는 경향이 있는데, 이는 복사본을 계속 복사하다 보면 결국 흐릿하고 알아볼 수 없게 되는 것과 매우 유사합니다.

다음은 이 논문이 간단한 비유를 사용하여 문제를 설명하고 해결책을 제시한 내용입니다:

문제: "복사 - 붙여넣기" 결함

현재의 방법들은 짧은 클립 (조각) 들을 이어붙여 장편 영상을 만들려고 시도합니다. 마치 문단 하나를 복사한 뒤, 그 복사본을 다시 복사하여 다음 문단을 만들고, 이를 반복하는 것과 같습니다.

  • 배경 이탈 (저수준): 벽이나 나무와 같은 배경은 고정되어야 합니다. 하지만 AI 가 다음 클립을 시작하기 위해 이미지를 계속 재복사하다 보니, 벽은 흐릿해지고 색상이 변하며 결국 나쁜 복사본처럼 보입니다.
  • 정체성 이탈 (고수준): 무용수는 동일하게 보여야 합니다. 하지만 영상이 길어질수록 무용수의 얼굴 모양이 서서히 변하거나, 옷 색깔이 바뀌거나, 머리가 다르게 보일 수 있습니다. 그들은 자신의 '정체성'을 잃게 됩니다.

이 논문은 기존 방법들이 AI 에게 원본 사진을 반복해서 보여줌으로써 (마치 '싱크'나 닻처럼) 이를 해결하려 하지만, 이는 충분하지 않다고 주장합니다. AI 는 여전히 반복되는 복사 과정에 혼란을 겪기 때문입니다.

해결책: EverAnimate

저자들은 영상을 다시 촬영하는 방식이 아닌, AI 의 '뇌' (잠재 공간) 내부에서 완전히 이루어지는 새로운 영상 생성 방식을 제안합니다. 그들은 두 가지 주요 기법을 사용합니다:

1. "영구적인 배낭" (지속적 잠재 전파)

영상 출력을 가져와 다시 이미지로 변환한 뒤, 그 이미지를 다음 클립을 위한 입력으로 다시 AI 에게 제공하는 방식 (이는 '복사 - 붙여넣기' 오류를 유발함) 대신, EverAnimate 는 AI 내부에 기억의 배낭을 유지합니다.

  • 작동 원리: AI 가 영상 한 조각을 완료하면 최종 이미지를 보지 않습니다. 대신 다음 조각으로 '배낭' 형태의 원시 데이터 (잠재 코드) 를 전달합니다.
  • 배낭 안에는 무엇이 들어있을까요?
    • 단기 기억: 춤을 매끄럽게 이어가기 위한 최근 몇 초간의 움직임.
    • 장기 기억: 무용수의 얼굴과 옷에 대한 '신분증' (다중 뷰 이미지) 컬렉션으로, 외모가 절대 변하지 않도록 보장합니다.
  • 비유: 릴레이 경주를 상상해 보세요. 이전 주자가 흐릿한 사진을 건네받아 복사하는 대신, 직접적이고 고품질의 데이터 칩을 건네받아 원래 주자의 특징을 잃지 않고 경주를 정확히 이어갈 수 있게 됩니다.

2. "자기 수정 나침반" (복원 흐름 매칭)

훌륭한 배낭이 있더라도 AI 는 단일 클립 생성 중 가끔 잘못된 방향으로 나아갈 수 있습니다.

  • 문제: AI 가 약간 길을 잃기 시작하면 (예: 무용수의 팔이 약간 이상해 보임), 기존 방법들은 오류가 더 커질 때까지 그냥 진행합니다.
  • 해결: EverAnimate 는 AI 에게 특별한 '나침반'으로 훈련시킵니다. 훈련 중 AI 는 의도적으로 약간 '고장 난' 또는 왜곡된 경로를 따르도록 주어집니다. 이를 통해 AI 는 자신이 길을 잃었음을 인식하고, 올바르게 깨끗한 경로로 되돌아가도록 스스로 적극적으로 조정하는 법을 배웁니다.
  • 비유: 안개 속에서 걷는 등산객을 생각해 보세요. 일반적인 등산객은 길을 볼 수 없어 절벽으로 떨어질지도 모릅니다. EverAnimate 는 트레일에서 벗어나면 진동하는 GPS 를 가진 등산객과 같습니다. 길을 잃기 전에 안전한 경로로 부드럽게 다시 밀어줍니다.

결과

이 논문은 이러한 두 가지 방법 (기억 배낭과 자기 수정 나침반) 을 사용하여 EverAnimate 가 배경이 흐릿해지거나 캐릭터의 얼굴이 변하는ことなく 수 분 동안 (테스트에서는 최대 90 초까지) 영상을 생성할 수 있다고 주장합니다.

  • 짧은 영상 (10 초): 이미 기존 최첨단 방법들보다 우수합니다.
  • 긴 영상 (90 초): 개선 폭이 매우 큽니다. 영상은 선명하게 유지되고, 배경은 안정적이며, 캐릭터는 시작부터 끝까지 정확히 동일하게 보입니다.

요약

간단히 말해, EverAnimate는 AI 가 영상의 '복사본의 복사본'을 만들지 않도록 막습니다. 대신 캐릭터와 장면의 고품질 디지털 기억을 유지하고, AI 가 진행 과정에서 실수를 스스로 수정하도록 훈련시켜, 무너지지 않는 매끄럽고 고품질의 분 단위 애니메이션을 가능하게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →