← 최신 논문
💻 computer science

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

이 논문은 과거 컨텍스트를 유지하면서도 고정된 캐시 크기를 통해 무한한 길이의 비디오 생성 시 발생하는 일관성 저하와 정체성 이탈 문제를 해결하기 위해, 과거 키를 압축하는 '메모리 토큰'과 동적 위치 인코딩을 적용하는 '온라인 RoPE 인덱싱'을 결합한 훈련 불필요 (training-free) 프레임워크인 MemRoPE 를 제안합니다.

원저자: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 MemRoPE: 1 시간 동안 멈추지 않는 '완벽한' 비디오를 만드는 마법

이 논문은 **"오래된 영상을 만들 때, 캐릭터의 얼굴이 변하거나 배경이 뭉개지는 문제"**를 해결한 획기적인 기술, MemRoPE를 소개합니다.

기존 기술은 영상을 길게 만들면 기억력이 나빠져서 (캐릭터가 바뀌거나, 배경이 사라지는 등) 10 분만 넘어가도 퀄리티가 떨어졌습니다. 하지만 MemRoPE 는 훈련 없이 (Training-Free) 기존 모델을 그대로 쓰면서 1 시간짜리 영상도 완벽하게 만들어냅니다.

이 복잡한 기술을 쉽게 이해할 수 있도록 세 가지 핵심 비유로 설명해 드릴게요.


1. 문제: "기억력 감퇴"와 "고정된 사진"의 함정

기존의 긴 영상 생성 기술들은 두 가지 큰 실수를 저질렀습니다.

  • 과거를 완전히 잊어버리는 경우 (FIFO 방식):
    • 비유: 영화 감독이 촬영을 계속하는데, 어제 찍은 필름을 다 태워버리고 오늘 찍은 것만 가지고 계속 촬영하는 상황입니다.
    • 결과: 10 분 지나면 주인공이 누구였는지, 어떤 옷을 입었는지 까맣게 잊어버려서 얼굴이 변하거나 옷이 바뀝니다.
  • 과거를 '고정된 사진'으로만 기억하는 경우 (기존 방법):
    • 비유: 감독이 "시작할 때 찍은 주인공 사진 한 장"만 벽에 걸어두고, 그 사진만 보고 계속 촬영합니다.
    • 결과: 주인공이 걷거나 표정이 변해도, 벽에 걸린 사진은 그대로라 동작이 뻣뻣해지거나 (정지된 느낌), 갑자기 사진이 바뀌면 영상이 깜빡입니다.

2. 해결책: MemRoPE 의 두 가지 마법

MemRoPE 는 이 문제를 해결하기 위해 두 가지 똑똑한 장치를 도입했습니다.

🧠 마법 1: "기억의 두 가지 흐름" (Memory Tokens)

기존의 '고정된 사진' 대신, 기억을 두 개의 흐름으로 나누어 관리합니다.

  • 장기 기억 (Long-term Memory):
    • 비유: 주인공의 '본질'을 기억하는 오래된 일기장입니다. "이 사람은 금발이고, 붉은 드레스를 입었다"는 핵심 정보만 꾸준히 요약해서 저장합니다. 시간이 지나도 주인공의 정체성 (얼굴, 옷차림) 이 변하지 않게 지켜줍니다.
  • 단기 기억 (Short-term Memory):
    • 비유: 최근 10 분간의 '생생한 상황'을 기록하는 메모장입니다. "주인공이 지금 웃고 있다", "바람이 불어 머리카락이 날린다" 같은 최근의 변화를 빠르게 반영합니다.
  • 효과: 이 두 가지를 섞어서 기억하므로, 주인공의 얼굴은 변하지 않으면서도 움직임은 자연스럽게 이어집니다.

📍 마법 2: "위치 번호를 매기는 순간" (Online RoPE Indexing)

기존 기술은 영상을 저장할 때 이미 '시간 위치 (1 초, 2 초...)'를 붙여놔서, 나중에 기억을 합치면 위치가 꼬이는 문제가 있었습니다.

  • 비유:
    • 기존 방식: 책장에 책을 꽂을 때 이미 책등에 '1 번, 2 번'이라는 번호가 박혀있는 책을 가져와서 섞으려니, 번호가 꼬여서 내용이 엉망이 됩니다.
    • MemRoPE 방식: 책을 책장에 꽂을 때는 **번호를 붙이지 않은 상태 (순수한 내용)**로 저장해둡니다. 그리고 책을 읽을 때 (생성할 때) 그 순간에 맞춰서 "이건 1 번, 저건 2 번"이라고 실시간으로 번호를 매겨줍니다.
  • 효과: 이렇게 하면 과거의 기억 (장기/단기) 과 현재의 장면을 섞어도 시간 순서가 완벽하게 맞고, 위치가 꼬이지 않아 영상이 매끄럽게 이어집니다.

3. 결과: 1 시간 동안 멈추지 않는 영상

이 두 가지 기술을 합치면 어떤 일이 일어날까요?

  • 기존 방식: 10 분 지나면 주인공이 다른 사람으로 변하거나, 배경이 뭉개져서 쓰레기처럼 보입니다.
  • MemRoPE: 1 시간 동안 영상을 만들어도, 처음에 설정한 주인공의 얼굴, 옷, 배경의 분위기가 끝까지 변함없이 유지됩니다. 마치 한 번 찍은 영화처럼 자연스럽습니다.

💡 요약: 왜 이것이 중요한가요?

MemRoPE 는 새로운 AI 모델을 훈련시킬 필요 없이 (Training-Free), 기존에 있는 모델에 이 '기억 관리 시스템'만 추가하면 됩니다.

"오래된 영상을 만들 때, 더 많은 정보를 저장하는 게 아니라, 정보를 '더 잘' 기억하는 법을 터득한 기술"

이 기술 덕분에 앞으로 1 시간짜리 다큐멘터리, 지속되는 가상 세계 시뮬레이션, 긴 영화 등을 AI 가 실시간으로, 그리고 완벽하게 만들어낼 수 있는 길이 열렸습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →