← 최신 논문
💻 computer science

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy는 디퓨전 트랜스포머(Diffusion Transformers) 내에서 레이어별 시간 제어를 활용하여 선형적 시간 인식을 원형적 인식으로 변환하는 앵커링된 위치 임베딩 이동 전략을 도입함으로써 고품질의 매끄러운 비디오 루프 생성을 달성하는 새로운 프레임워크이다.

원저자: Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세계에서 매끄러운 루프(seamless loop)는 연속성의 작은 기적입니다. 그것은 마지막 프레임이 첫 번째 프레임으로 완벽하게 흘러 들어가 무한한 시간의 환상을 만들어내며, 아무런 끊김 없이 영원히 재생되는 영상입니다. 우리는 웹사이트 배너의 보글보글 올라오는 탄산음료, 게임 배경의 흔들리는 풀, 또는 소셜 미디어의 애니메이션 스티커 등 도처에서 이러한 루프를 볼 수 있습니다. 수십 년 동안 이러한 루프를 만드는 데는 편집자가 영상을 공들여 이어 붙이는 과정이 필요했으며, 이는 느리고 비용이 많이 드는 작업이었습니다. 최근에는 인공지능이 단순한 텍스트 설명으로부터 영상을 생성함으로써 이를 자동화할 것을 약속했습니다. 하지만 연구자들이 이 강력한 AI 모델들에게 완벽한 루프를 만들라고 요청했을 때, 그들은 종-종 실패했습니다. 영상은 버벅거리거나, 움직임이 멈추거나, 끝과 시작이 일치하지 않았습니다. 문제는 AI가 창의성이 부족한 것이 아니라, 시간이 원형으로 흐르는 방식을 이해하지 못했다는 점이었습니다.

이제 한 연구팀이 AI가 시간을 인식하는 방식을 바꿈으로써 이 퍼즐을 풀었습니다. 그들은 현재의 비디오 생성 AI 모델들이 트랜스포머(transformers)라고 불리는 복잡한 내부 구조에 의존하며, 시간을 직선으로 취급한다는 사실을 발견했습니다. 이 모델들은 마치 사람이 열까지 숫자를 세는 것처럼, 각 프레임이 시퀀스의 어디에 위치하는지를 추적하기 위해 특정 메커니즘을 사용합니다. 이는 시작과 끝이 명확한 영화에는 잘 작동하지만, 영상이 다시 시작점으로 돌아와야 할 때는 무너집니다. 연구자들은 이 AI 모델 내에서 모든 부분이 시간을 추적하는 데 똑같이 능숙하지 않다는 것을 발견했습니다. 어떤 레이어는 프레임의 순서에 매우 엄격한 반면, 어떤 레이어는 더 유연합니다. 결정적으로, 그들은 전체 시스템의 마스터 참조점 또는 닻(anchor) 역할을 하는 특정 레이어를 식선별해 냈습니다.

하오티안 동(Haotian Dong)과 동료들이 이끄는 이 팀은, 단순히 첫 번째 프레임을 마지막에 반복하도록 명령하여 AI에게 루프를 강요하는 방식이 효과가 없다는 것을 깨달았습니다. AI는 종종 가장 쉬운 길을 택하여 정지된 이미지를 만들어내거나, 마지막과 첫 프레임 사이에 격한 도약을 만들어내곤 했습니다. 연구진은 AI에게 루프를 강요하는 대신, AI의 내부 시간 지도를 바꾸기로 했습니다. 그들은 AI 모델의 각 부분에 대한 타이밍 신호를 특정 방식으로 조정하는 전략을 개발했습니다. 그들은 영상의 의미와 내용을 보존하기 위해 '닻' 레이어는 그대로 유지하여 AI가 여전히 자신이 전달하는 이야기를 이해할 수 있도록 했습니다. 나머지 레이어들에 대해서는, 영상의 끝이 수학적으로 시작과 연결되도록 타이밍 신호를 이동시켰습니다. 이는 AI의 시간 인식을 직선에서 완벽한 원형으로 변모시켰습니다.

연구진이 "앵커드 포지션 임베딩 시프팅(anchored position embedding shifting)"이라고 부르는 이 조정은, AI가 시작부터 끝, 그리고 다시 처음까지 자연스럽게 흐르는 영상을 생성할 수 있게 해주었습니다. 그들이 이 방법을 테스트했을 때 결과는 놀라웠습니다. AI는 이제 전사가 검을 휘두르는 모습, 결로 현상이 있는 콜라 한 잔, 또는 눈 속을 뛰어다니는 여우의 모습을 눈에 보이는 끊김 없이 고품질의 루프로 만들어낼 수 있었습니다. 또한 팀은 이 기술이 투명한 배경을 가진 영상에도 작동함을 보여주었는데, 이는 움직이는 물체를 고정된 상자 형태 없이 다양한 장면 위에 배치해야 하는 게임 개발자와 디지털 아티스트들에게 필수적인 기능입니다. 연구진은 이렇게 새로 생성된 루프의 작은 세트를 통해 AI를 학습시킴으로써, 이전의 시도들을 괴롭혔던 글리치(glitch) 없이 다양하고 현실적인 움직임을 생성할 수 있는 시스템을 만들었습니다.

이 접근 방식의 성공은 AI의 내부 논리에 대한 존중을 바탕으로 합니다. 연구진은 시간을 선형적으로 보려는 모델의 자연스러운 경향에 맞서 싸우기보다, 닻 레이어를 안정적인 참조점으로 활용하면서 나머지 시스템을 원형 패턴으로 부드럽게 유도함으로써 모델과 협력했습니다. 이 방법은 기존의 다른 기술들과 비교 테스트되었으며, 매끄럽고 연속적인 움직임을 만드는 데 있어 우수함이 입증되었습니다. 이는 시각적으로 일관될 뿐만 아니라 디테일과 움직임이 풍부한 영상을 생성할 수 있게 해줍니다. 연구진은 자신들의 모델을 대중에 공개하여, 시간의 경계가 보이지 않고 루프가 진정으로 매끄러운 새로운 디지털 콘텐츠의 물결을 열었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →