← 최신 논문
💻 computer science

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

이 논문은 학습-추론 간의 격차 없이 고품질의 초장기 비디오 생성을 위해 효과적인 전역 메모리 유지와 국소적 세부 사항 보존을 가능하게 하도록 디퓨전 트랜스포머에 LSTM 기반 순환 레이어를 통합한 새로운 프레임워크인 Recurrent Autoregressive Diffusion(RAD)을 제안한다.

원저자: Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 타이핑한 마지막 몇 문장만을 기억할 수 있는 상태에서 소설을 쓰는 상황을 상상해 보십시오. 만약 책 한 권을 쓰려고 한다면, 당신은 곧 줄거리와 등장인물의 이름, 그리고 왜 주인공이 퀘스트를 수행 중인지조차 잊어버리게 될 것입니다. 이것이 현실을 시뮬레이션하고 영상을 생성하도록 설계된 AI 시스템인 현대적 "월드 모델(world models)"이 겪는 일상적인 고충입니다. 이 디지털 스토리텔러들은 짧은 클립을 만드는 데는 점점 더 능숙해지고 있지만, 몇 시간 동안 지속되는 영상을 상상해 보라고 요청하면, 방금 전 무슨 일이 있었는지 잊어버리거나 장면의 세부 사항을 놓치는 "건망증"을 앓곤 합니다. 이를 해결하기 위해 과학자들은 두 가지 강력한 아이디어를 결합하고 있습니다. 하나는 마치 예술가가 흐릿한 정적의 구름을 선명한 그림으로 서서히 바꾸는 것과 같은 **확산(Diffusion)**이며, 다른 하나는 AI가 이미지의 특정 부분에 집중하여 요소들이 어떻게 연관되어 있는지 이해하는 방식인 **어텐션(Attention)**입니다. 여기서 큰 질문은, 이 AI 예술가들에게 전체 이야기를 기억할 수 있을 만큼 길면서도, 그들의 뇌가 과부하로 멈추지 않을 만큼 작은 기억력을 어떻게 부여할 것인가 하는 점입니다.

**재귀적 자기회귀 확산(Recurrent Autoregressive Diffusion, RAD)**이라는 새로운 프레임워크를 만나보십시오. 이는 AI가 정신을 놓지 않고 길고 일관된 영상을 생성하도록 돕기 위해 설계된 영리한 시스템입니다. 연구진은 이 기억력 문제를 해결하는 가장 좋은 방법이 반드시 최신 기술이나 화려한 기술이 아니라, 오히려 고전적이고 신뢰할 수 있는 도구인 **LSTM(Long Short-Term Memory)**이라는 유형의 메모리 루프라는 것을 발견했습니다. LSTM을 이야기의 지금까지의 내용을 요약하여 기록해 두는 성실한 사서라고 생각하십시오. 논문은 이 "사서"를 AI의 뇌에 추가함으로써, 시스템이 과거를 기억하면서도 동시에 현재에 밀접하게 주의를 기울일 수 있음을 보여줍니다. 하지만 주의할 점이 있습니다. 만약 사서에게 몇 장(chapter)마다 한 번씩만 이야기를 요약하라고 요청한다면("청크 단위(chunk-wise)" 방식), 그 사이의 간극에서 세부 사항이 유실됩니다. 논문은 비결이 바로 AI가 매 문장마다 노트를 업데이트하게 만드는 것("프레임 단위(frame-wise)" 방식)이며, 또한 디테일을 날카롭게 유지하기 위해 겹치는 장면들을 살펴보게 하는 것에 있다는 것을 증명합니다.

기억력 문제: 줄거리를 잊다

당신이 영화를 보고 있는데, 화면이 1초간 검게 변할 때마다 그 이전에 일어났던 모든 일을 잊어버린다고 상상해 보십시오. 이것이 현재 많은 비디오 생성 AI 모델에서 발생하는 현상입니다. 이들은 비디오를 보기 위해 "슬라이딩 윈도우(sliding window)"를 사용하는데, 이는 한 번에 아주 작은 프레임 뭉치에만 주의를 기울인다는 것을 의미합니다. 일단 프레임이 그 윈도우 밖으로 밀려나면, 그것은 영원히 사라집니다. 만약 AI가 미로를 통과하는 캐릭터의 긴 영상을 생성하고 있다면, 캐릭터가 어디서 시작했는지 혹은 5분 전에 미로가 어떤 모습이었는지 잊어버릴 수 있으며, 이는 벽의 색이 변하거나 캐릭터가 갑자기 순간 이동하는 것과 같은 이상한 오류로 이어집니다.

이를 해결하기 위해 연구진은 AI에게 "글로벌 메모리(global memory)"를 부여하는 실험을 진행했습니다. 그들은 이 메모리를 구축하기 위해 세 가지 서로 다른 방법을 테스트했습니다:

  1. Mamba: 전체 이야기를 작고 효율적인 요약본으로 압축하려고 시로하는 매우 현대적이고 하이테크한 접근 방식입니다.
  2. TTT (Test-Time Training): AI가 영상을 생성하는 동안 실시간으로 자신의 메모리 가중치를 학습하고 업데이트하는 방법입니다.
  3. LSTM: 단기적인 세부 사항(방금 일어난 일)과 장기적인 맥락(전체적인 줄거리)을 분리하는 오래되고 고전적인 유형의 메모리 시스템입니다.

발견: 구식이 신식을 이기다

연구진은 매우 다른 두 세계, 즉 에이전트가 항해하는 단순한 미로와 복잡하고 블록으로 이루어진 마인크래프트(Minecraft) 세계에서 실험을 수행했습니다. 그들은 놀라운 사실을 발견했습니다. 밀도가 높은 텍스처와 빠른 움직임이 특징인 마인크래프트 세계에서, 화려한 신기술들(Mamba와 TTT)은 고전했습니다. 이들은 너무 많은 정보를 메모리에 압축하려 했고, 그 결과 장면의 레이아웃이 무너지는 흐릿하고 일관성 없는 영상이 만들어졌습니다.

그러나 고전적인 LSTM은 놀라울 정도로 뛰어난 성능을 보였습니다. 왜일까요? LSTM은 두 가지를 동시에 처리하도록 설계되었기 때문입니다. 즉, 큰 그림을 위한 "셀 상태(cell state)"와 직전의 과거를 위한 "은닉 상태(hidden state)"를 유지합니다. 이러한 분리는 AI가 미로나 마인크래프트 세계의 일반적인 레이아웃을 기억하는 동시에, 마지막 몇 프레임의 구체적인 디테일을 추적할 수 있게 해주었습니다.

진짜 돌파구: 이야기를 읽는 방식이 중요하다

이 논문의 가장 중요한 발견은 어떤 메모리 도구를 사용하는가뿐만 아니라, 그 도구를 어떻게 사용하는가에 있습니다. 연구진은 이야기를 AI에게 전달하는 두 가지 방식을 비교했습니다:

  • 청크 단위 (The "Chapter" Method): AI가 한 블록의 프레임(예: 20프레임)을 생성하고, 이를 요약한 다음 다음 블록으로 넘어갑니다. 여기서 문제는 블록 사이의 간극이 "사각지대"가 된다는 점입니다. AI는 이 간극을 메우기 위해 오로지 자신의 메모리 요약본에만 의존해야 하며, 만약 그 요약본이 아주 작은 디테일(예: 특정 나무나 벽의 질감)을 놓친다면 영상은 깨지게 됩니다. 실험 결과, 이 모드에서는 최고의 메모리 도구들조차 복잡한 장면에서 어려움을 겪었습니다.
  • 프레임 단위 (The "Sentence" Method): AI가 매 프레임마다 하나씩 생성하며, 매 프레임마다 메모리를 업데이트합니다. 결정적으로, "윈도우"가 서로 겹칩니다. 이는 AI가 항상 현재 프레임과 이전 몇 개의 프레임을 동시에 바라보고 있음을 의미합니다.

논문은 프레임 단위 방식이 게임 체인저였다는 것을 밝혀냈습니다. 윈도우를 겹치게 함으로써, AI는 영상을 일관되게 유지하기 위해 오로지 메모리 요약본에만 의존할 필요가 없게 되었습니다. 대신, 프레임 간의 연결을 직접 "볼" 수 있게 된 것입니다. 이는 메모리 시스템의 부담을 줄여주었습니다. AI가 직전의 과거를 볼 수 있게 되자, 더 단순한 메모리 도구들도 훨씬 더 잘 작동했으며, 복잡한 도구들도 마침내 LSTM을 따라잡았습니다.

비밀 소스: "프리페치(Prefetch)" 기술

프레임 단위 방식에는 한 가지 큰 장애물이 있었습니다. 바로 훈련 속도가 매우 느리다는 점입니다. 보통 AI는 프레임 2를 계산하기 전에 프레임 1이 끝날 때까지 기다려야 하는데, 이는 마치 도미노가 하나씩 쓰러지기를 기다리는 것과 같습니다. 이를 해결하기 위해 연구진은 "은닉 상태 프리페치(hidden state pre-fetch)" 기술을 발명했습니다.

요리를 준비하는 요리사를 상상해 보십시오. 양파를 썰고 나서 당근을 썰고, 그다음 감자를 하나씩 써는 것이 아니라, 냄비가 가열되는 동안 채소를 미리 다 썰어두는 것과 같습니다. 마찬가지로, RAD 모델은 먼저 깨끗한 비디오를 빠르게 한 번 훑어서 모든 메모리 상태를 "프리페치(미리 가져오기)"합니다. 일단 이러한 상태들이 준비되면, AI는 일반적인 비디오 생성기처럼 메모리 루프의 이점을 잃지 않으면서도 전체 비디오를 병렬로 처리할 수 있습니다. 이 덕분에 훈련 과정이 긴 시퀀스에 대해서도 실행 가능할 만큼 빨라졌습니다.

결론

논문은 긴 영상을 일관되게 생성하기 위해서는 고전적인 LSTM 메모리 시스템과 겹치는 윈도우를 가진 프레임 단위 생성 스타일을 결합하는 것이 최선의 전략이라고 결론짓습니다. 이 설정은 AI가 전체적인 줄거리에 대한 글로벌 메모리를 유지하면서도 국소적인 디테일에 날카로운 시선을 유지할 수 있게 해줍니다.

결과는 명확했습니다. 마인크래프트 데이터셋에서 프레임 단위 RAD 모델은 기존의 "청크 단위" 방식보다 훨씬 더 높은 품질과 일관성을 가진 영상을 생성했습니다. 영상은 원래의 장면을 충실히 유지했으며, 오류가 적고 환경에 대한 기억력이 더 좋았습니다. 이 방법은 표준 모델보다 더 많은 컴퓨팅 파워를 요구하지만, AI가 자신의 줄거리를 잊어버리지 않고 길고 일관된 이야기를 생성할 수 있다는 점에서 그만한 가치가 있습니다. 연구진은 이 접근 방식이 큰 그림을 기억하는 것과 작은 디테일을 포착하는 것 사이의 완벽한 균형을 맞춤으로써, AI 비디오 생성 분야의 주요 병목 현상을 해결한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →