← 최신 논문
💻 computer science

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong 는 추가적인 모델 학습 없이 시간적 일관성과 시각적 충실도를 보장하기 위해 매니폴드 제약 Tweedie 매칭과 확률적 초기 단계 샘플링을 통해 중첩되는 슬라이딩 윈도우를 혼합하여 장편 영상을 생성하는 학습이 불필요하고 아키텍처에 구애받지 않는 추론 시 방법입니다.

원저자: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능 있는 화가가 아름답고 고해상도의 장면을 그릴 수 있다고 상상해 보세요. 하지만 그들에게는 엄격한 규칙이 하나 있습니다. 한 번에 포스트카드 크기의 캔버스 하나만 작업할 수 있다는 것입니다. 만약 그들에게 영화 전체를 그려달라고 요청하면, 그들은 지쳐버리고 스타일이 변하거나 캐릭터들이 같은 동작을 반복하기 시작합니다.

이것이 현재 AI 비디오 생성기들이 직면한 문제입니다. 그들은 짧은 클립 (포스트카드 같은) 을 만드는 데는 뛰어나지만, 긴 영화를 만들어보려고 하면 품질이 무너지고 이야기가 흐트러지거나 움직임이 로봇처럼 반복적이 됩니다.

FlowLong은 이러한 화가들이 재학습을 하거나 스타일을 바꾸지 않고도 긴 영화를 만들 수 있도록 돕는 새로운 "감독"입니다. 이는 **겹침 블렌딩 (Overlap Blend)**과 **새로운 시작 (Fresh Start)**이라는 두 가지 교묘한 기법을 통해 이루어집니다.

1. 겹침 블렌딩 (Tweedie Matching)

화가가 한 번에 10 피트 구간만 칠할 수 있다고 가정해 보세요.

  • 기존 방식: 화가에게 먼저 10 피트를 칠하게 한 다음, 캔버스를 이동시켜 다음 10 피트를 칠하게 합니다. 문제는 첫 번째 구간의 끝이 두 번째 구간의 시작과 약간 다르게 보일 수 있다는 점입니다. 색상이 변하거나 캐릭터의 팔 위치가 달라질 수 있습니다.
  • FlowLong 방식: 화가에게 첫 10 피트를 칠하되, 동시에 다음 10 피트도 함께 칠하게 합니다. 이때 첫 번째 구간의 마지막 2 피트와 두 번째 구간의 처음 2 피트가 겹치도록 합니다.
  • 마법: FlowLong 은 두 겹치는 구간에서 가장 "깨끗한" 이미지 버전을 가져와 영화의 자연스러운 크로스 페이드처럼 완벽하게 섞어줍니다. 이를 통해 두 구간 사이의 전환이 매끄럽고 일관되게 유지됩니다. 이는 두 개의 분리된 그림이 공유되는 부분이 어떻게 보여야 하는지에 대해 일치하도록 강제합니다.

2. 새로운 시작 (확률적 초기 단계 샘플링)

여기가 까다로운 부분입니다. 겹침 부분을 완벽하게 섞더라도 화가가 여전히 "고정관념"에 갇힐 수 있습니다. 두 번째 구간의 시작을 약간 다른 아이디어로 시작하면, 뇌가 원래의 분리된 경로로 다시 흘러가 영화가 나중에 단절되어 보일 수 있습니다.

  • 문제: 두 명의 등산객이 다른 등산로에서 출발한다고 생각해 보세요. 그들이 다리 (겹침 부분) 에서 만나더라도, "관성" 때문에 즉시 각자의 분리된 길로 돌아갈 수 있습니다.
  • FlowLong 해결책: 과정의 아주 초기 단계 (이미지가 여전히 흐릿한 소음 구름일 때) 에 FlowLong 은 화가에게 부드러운 "흔들림"을 줍니다. 혼합물에 약간의 새로운 무작위성 (소음) 을 주입하는 것입니다.
  • 결과: 이 흔들림은 등산객들이 옛길을 고수하는 습관을 깨뜨립니다. 두 개의 분리된 구간이 여전히 흐릿할 때 서로 섞이고 어울리게 강제합니다. 일단 일반적인 방향에 합의하면, FlowLong 은 그들을 더 이상 흔드는 것을 멈추고 결정론적으로 (매끄럽게) 결승점까지 걷게 합니다. 이를 통해 선명하고 고품질의 디테일을 잃지 않으면서도 전체 영화가 동일한 궤도를 유지하도록 보장합니다.

왜 이것이 중요한가

  • 재학습 불필요: 화가에게 새로운 기술을 가르칠 필요가 없습니다. 단지 작업 방식을 조직하는 새로운 지시사항을 주면 됩니다. 이는 기존에 존재하는 모든 비디오 AI 모델과 즉시 호환됩니다.
  • 다용도: 비디오뿐만 아니라 다음과 같은 작업에도 작동합니다:
    • 비디오와 오디오를 함께 생성 (사운드트랙이 있는 영화처럼).
    • 텍스트를 3D 세계로 변환 (설명에서 3D 장면을 생성).
  • 더 나은 품질: 다른 방법들은 비디오를 길게 만들지만 반복적인 루프나 흐트러진 오류로 가득 차 있는 반면, FlowLong 은 일관성 있고 다양하며 고품질인 긴 비디오를 생성합니다.

요약

FlowLong 은 AI 화가들을 위한 스마트한 프로덕션 매니저와 같습니다. 그들이 혼자 긴 영화를 그리려고 애쓰게 두는 대신, 작업을 겹치는 조각으로 나누고 가장자리를 완벽하게 섞으며, 시작 시 약간의 밀어주기를 통해 모두가 같은 페이지에 있도록 합니다. 그 결과, 하부 AI 를 재학습시킬 필요 없이 길고 일관되며 고품질의 비디오가 생성됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →