← 최신 논문
🤖 AI

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

이 논문은 시각적 품질을 유지하면서도 메모리 사용량을 일정하게 유지하며 5~10배의 속도 향상을 달성하는, 시간적 캐시를 압축하고 근사 최근접 이웃 매칭을 통해 어텐션을 희소화함으로써 자기회귀 비디오 확산 및 월드 모델을 가속화하는 학습이 필요 없는 프레임워크인 FAST-AR을 소개한다.

원저자: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 긴 이야기를 한 번에 한 문장씩 써 내려가려고 한다고 상상해 보세요. 새로운 문장을 쓸 때마다, 당신은 그 문장이 완벽하게 어울리는지 확인하기 위해 이전에 썼던 모든 문장을 다시 읽어야 합니다.

AI 비디오 생성 기술의 세계에서는 정확히 이런 일이 일어납니다. AI가 프레임 단위로 비디오를 생성함에 따라, 지금까지 생성한 모든 것을 담은 "메모리 뱅크"(KV 캐시라고 불림)를 계속 유지합니다. 다음 프레임을 만들기 위해 AI는 이 거대해지는 전체 메모리 뱅크를 읽어야 합니다.

문제는 무엇일까요? 비디오가 길어질수록 이 메모리 뱅크는 거대해집니다. AI는 다음 문장을 쓰기 위해 점점 더 많은 텍스트를 읽어야 합니다. 이로 인해 과정이 다음과 같이 변합니다:

  1. 점점 더 느려집니다 (매초 새로운 책이 추가되는 도서관에서 특정 단어를 찾으려는 것과 같습니다).
  2. 더 비싸집니다 (가방이 너무 무거워져서 들 수 없게 되는 것처럼, 컴퓨터 메모리가 바닥납니다).

이 논문은 이를 해결하기 위해 FAST-AR라는 새로운 방법을 소개합니다. 이것을 AI에게 긴 이야기를 쓰면서도 지치거나 기억을 잃지 않도록 하는 "슈퍼 스마트한 지름길"을 제공하는 것이라고 생각하면 됩니다.

FAST-AR가 사용하는 세 가지 "마법 기술"은 다음과 같습니다:

1. "중복 찾기" (TempCache)

문제: 비디오 속의 많은 것들은 오랫동안 변하지 않고 유지됩니다. 만약 고양이가 정원을 걷고 있다면, 100번째 프레임과 101번째 프레임의 배경 나무와 고양이의 털은 거의 동일하게 보입니다. 기존의 AI는 똑같은 것을 두 번 기억하느라 시간을 낭비하고 있었습니다.
해결책: FAST-AR는 "잠깐, 이 나무의 완벽한 복사본을 이미 내 메모리에 가지고 있네. 이걸 다시 기록할 필요는 없어"라고 알아차리는 스마트한 사서처럼 행동합니다.
이 방식은 "유사 중복"되는 순간들을 병합하여 메모리를 압축합니다. 모든 프레임을 하나하나 기억하는 대신, 장면의 본질을 기억합니다. 이를 통해 비디오가 아무리 길어져도 메모리 크기를 작고 일정하게 유지합니다.

2. "관련된 것만 읽기" (AnnCA)

문제: 매우 긴 프롬프트(상세한 설명)를 바탕으로 이야기를 쓰고 있다고 상상해 보세요. 프롬프트에는 "고양이가 걷고, 승용차가 지나가고, 그다음 개가 나타난다"라고 적혀 있을 수 있습니다. AI가 현재 "고양이"를 그리고 있을 때, 프롬프트에 있는 "승용차"나 "개"라는 단어를 볼 필요는 없습니다. 하지만 기존의 AI 모델은 매번 프롬프트 전체를 읽으며 에너지를 낭비했습니다.
해결책: FAST-AR는 "빠른 검색" 도구(근사 근접 이웃, Approximate Nearest Neighbor이라 불림)를 사용하여 "이 특정 프레임을 위해 프롬프트의 어떤 단어가 실제로 중요한가?"를 즉각적으로 파악합니다.
관련 없는 단어들은 무시합니다. 고양이가 화면에 있다면, 오직 "고양이"라는 단어에만 집중합니다. 이는 엄청난 양의 컴퓨팅 전력을 아껴줍니다.

3. "집중 필터" (AnnSA)

문제: 비디오 내부에서 AI는 모든 픽셀을 다른 모든 픽셀과 연관 지어 살펴봅니다. 이는 마치 옆 사람과 대화만 하면 되는데, 경기장에 있는 모든 사람에게 동시에 말을 걸려는 것과 같습니다.
해결책: FAST-AR는 유사한 것들을 그룹으로 묶습니다. 만약 어떤 픽셀이 "고양이"의 일부라면, 그 픽ç은 고양이의 일부인 다른 픽셀들과만 대화합니다. 배경이나 관련 없는 다른 물체들은 무시합니다. 이는 하나의 거대하고 시끄러운 군중 대신, 작고 집중된 대화 모임 속에 사람들을 배치하는 것과 같습니다.

결과: 단거리 선수가 아닌 마라톤 선수

이 논문은 이 세 가지 기술을 통해 AI가 이전보다 5~10배 더 빠르게 비디오를 생성할 수 있음을 보여줍니다.

  • 기존 방식: 비디오가 길어질수록 AI는 점점 더 느려지며, 결국 메모리가 부족해집니다 (달리다가 지쳐서 멈춰버리는 러너와 같습니다).
  • FAST-AR 방식: AI는 영원히 일정하고 빠른 속도로 달립니다. 비디오가 10초든 2분이든 속도와 메모리 사용량은 동일하게 유지됩니다.

요약하자면: FAST-AR는 AI에게 똑같은 옛날 노트를 다시 읽는 것을 멈추고, 필요 없는 단어는 무시하며, 자신이 대화하고 있는 대상에게만 집중하는 법을 가르칩니다. 이를 통해 AI는 자신의 메모리에 발목 잡히지 않고 길고 고품질인 비디오를 제작할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →