← 최신 논문
💻 computer science

Train Short, Inference Long: Training-free Horizon Extension for Autoregressive Video Generation

이 논문은 3D 위치 임베딩의 주파수 편향과 노이즈 샘플링의 동적 사전 지식 부재를 해결하기 위해 주파수 인식 RoPE 변조, 반위상 노이즈 샘플링, 추론 전용 어텐션 싱크를 결합한 FLEX 를 제안하여, 추가 학습 없이 기존 오토레거시 비디오 생성 모델의 추론 시계열 범위를 4 분까지 확장하고 성능을 획기적으로 개선합니다.

원저자: Jia Li, Xiaomeng Fu, Xurui Peng, Weifeng Chen, Youwei Zheng, Tianyu Zhao, Jiexi Wang, Fangmin Chen, Xing Wang, Hayden Kwok-Hay So

게시일 2026-03-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jia Li, Xiaomeng Fu, Xurui Peng, Weifeng Chen, Youwei Zheng, Tianyu Zhao, Jiexi Wang, Fangmin Chen, Xing Wang, Hayden Kwok-Hay So

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 왜 필요한가요? (기존 AI 의 문제점)

지금까지의 AI 비디오 생성 모델들은 마치 **"10 분짜리 연극만 연습한 배우"**와 같습니다.

  • 훈련 (Training): AI 는 짧은 영상 (예: 5 초~10 초) 만 보고 학습합니다.
  • 추론 (Inference): 하지만 사용자는 긴 영상 (예: 30 초, 60 초, 심지어 4 분) 을 원합니다.

이때 AI 는 **"연기 실수"**를 범합니다.

  1. 시간이 흐를수록 얼굴이 변하거나 사라짐: (주인공이 중간에 다른 사람으로 변하거나, 얼굴이 뭉개짐)
  2. 동작이 멈춤: (처음엔 활발히 움직이다가 나중엔 마치 동상처럼 굳어버림)
  3. 화질이 떨어짐: (영상 길이가 길어질수록 그림이 흐릿해지고 깨짐)

기존에는 이 문제를 해결하기 위해 AI 를 다시 긴 영상으로 **재학습 (Fine-tuning)**시켜야 했습니다. 하지만 이는 엄청난 비용과 시간이 들고, 여전히 한계가 있었습니다.


🚀 FLEX 가 해결한 3 가지 핵심 문제 (비유로 설명)

FLEX 는 AI 를 다시 가르치지 않고, 생성할 때 (Inference) 쓰는 방법을 바꿈으로써 이 문제를 해결했습니다. 마치 배우에게 새로운 연기 가이드를 주는 것과 같습니다.

1. "시간의 리듬을 조절하는 안경" (Frequency-aware RoPE Modulation)

  • 문제: AI 는 영상 속 '시간'을 숫자로 인식합니다. 짧은 영상만 봤기 때문에, 긴 시간 (예: 100 초 뒤) 을 인식하는 '저주파' 감각은 훈련이 안 되어 있습니다. 반면 '고주파' (세부적인 움직임) 는 잘 알고 있죠.
  • 해결: FLEX 는 AI 에게 안경을 씌워줍니다.
    • 긴 시간 (저주파): AI 가 익숙하지 않은 긴 시간을 이해할 수 있도록 **보정 (Interpolation)**해 줍니다. (멀리 있는 산을 잘 보이게 하는 것)
    • 짧은 시간 (고주파): AI 가 잘 아는 세부적인 움직임 (손가락 움직임, 표정) 은 **원래대로 유지 (Extrapolation)**합니다. (가까운 꽃의 디테일을 흐트러뜨리지 않는 것)
    • 결과: 시간이 지나도 영상의 전체적인 구조는 무너지지 않고, 세부적인 움직임은 선명하게 유지됩니다.

2. "지루함을 깨우는 에너지 주입" (Antiphase Noise Sampling)

  • 문제: 기존 AI 는 영상이 흐트러지지 않게 하려고 처음부터 끝까지 너무 비슷하게 시작합니다. (예: 모든 프레임이 거의 같은 상태) 이러면 영상이 지루하고 움직임이 없게 됩니다. 마치 같은 동작을 반복하는 로봇처럼요.
  • 해결: FLEX 는 영상 생성의 시작점 (노이즈) 에 의도적으로 반대되는 에너지를 넣습니다.
    • 비유: 춤을 출 때, 처음부터 끝까지 같은 템포로 뛰는 게 아니라, 박자에 맞춰 강약을 조절하는 것입니다.
    • 효과: AI 가 처음부터 다양한 움직임의 씨앗을 품게 되어, 시간이 지나도 동적인 움직임이 살아있는 생동감 있는 영상을 만듭니다.

3. "초반의 닻을 내리기" (Inference-only Attention Sink)

  • 문제: 긴 영상을 만들다 보면 AI 가 "내가 지금 처음에 뭘 그렸지?" 하고 잊어버립니다. (시간이 흐를수록 기억이 흐려짐)
  • 해결: FLEX 는 **영상의 첫 번째 장면들을 '닻 (Anchor)'**처럼 고정시킵니다.
    • 비유: 배가 바다를 항해할 때, 초기 위치를 기억하기 위해 닻을 내리는 것과 같습니다.
    • 효과: 시간이 아무리 흘러도 (4 분이 되어도) 처음의 주인공 얼굴이나 배경이 변하지 않고 일관성을 유지합니다.

🌟 FLEX 의 성과 (결과)

이 방법은 재학습 없이 (Training-free) 적용할 수 있어 매우 효율적입니다.

  • 30 초 영상 (기존 6 배): 최신 모델들보다 훨씬 더 선명하고 자연스러운 영상을 만듭니다.
  • 60 초 영상 (기존 12 배): 기존에 60 초를 만들려면 AI 를 다시 학습시켜야 했지만, FLEX 를 쓰면 기존 모델로도 그 성능을 따라잡습니다.
  • 4 분 영상 (초장기): 기존에는 상상도 못 했던 4 분짜리 영상에서도 주인공의 얼굴이 변하지 않고, 배경이 자연스럽게 움직이는 것을 보여줍니다.

💡 한 줄 요약

"짧은 영상만 배운 AI 에게, 긴 영상을 만들 때 필요한 '리듬 조절 안경', '에너지 주입', '기억 닻'을 무료로 달아주니, 4 분짜리 영화도 완벽하게 찍어낸다는 이야기!"

이 기술은 앞으로 우리가 AI 로 긴 영화를 만들거나, 긴 애니메이션을 생성할 때 비용과 시간을 획기적으로 줄여줄 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →