← 최신 논문
🤖 machine learning

Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion

본 논문은 선형 시간 확장성과 일정한 메모리 사용량을 달성하면서도 시간적 일관성과 생성 품질을 유지하거나 향상시키기 위해 이차적 프레임 간 어텐션을 고정 크기의 순환 상태로 대체하는 자기회귀 비디오 확산을 위한 하이브리드 어텐션 아키텍처인 ARL2 를 소개합니다.

원저자: Kunyang Li, Mubarak Shah, Yuzhang Shang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kunyang Li, Mubarak Shah, Yuzhang Shang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Attend Locally, Remember Linearly" 논문을 쉬운 언어와 창의적인 비유로 설명합니다.

큰 문제: "끝없는 배낭"

당신이 한 장 한 장 프레임별로 매우 긴 영화를 그리려는 화가라고 상상해 보세요. 영화가 매끄럽고 일관되게 보이게 하려면 지금까지 그린 모든 것을 기억해야 합니다.

현재의 비디오 AI 모델에서 "기억"하는 방식은 점점 무거워지는 배낭을 들고 다니는 것과 같습니다.

  • 첫 번째 프레임에서는 배낭에 작은 메모를 넣습니다.
  • 두 번째 프레임에서는 첫 번째 메모를 유지한 채 또 다른 메모를 추가합니다.
  • 100 번째 프레임이 되면 배낭은 거대해집니다. 1,000 번째 프레임이 되면 너무 무거워 움직일 수조차 없습니다.

기술적인 용어로 이는 KV Cache라고 합니다. 비디오가 길어질수록 컴퓨터는 이러한 과거 메모들을 모두 저장하기 위해 점점 더 많은 메모리 (RAM) 가 필요합니다. 결국 컴퓨터의 공간이 부족해지고 비디오 생성이 멈추게 됩니다. 이것이 이 논문이 해결하려는 "확장성 병목 현상"입니다.

해결책: ARL2 (Attend Locally, Remember Linearly)

저자들은 영화를 그리는 새로운 방식을 제안합니다. 이를 ARL2라고 부릅니다. 커지는 배낭을 대신하여 똑똑하고 고정된 크기의 노트를 사용합니다.

그들은 화가의 작업을 두 가지 다른 과업으로 나눕니다.

1. "Attend Locally" (세부 작업)

화가가 단일 프레임을 그릴 때, 세부 사항이 일치하도록 해당 특정 그림의 모든 부분을 살펴봐야 합니다 (예: 왼쪽 눈과 오른쪽 눈이 일치하도록 하거나, 스카프가 자연스럽게 흐르도록 하는 것).

  • 비유: 이는 앞의 캔버스 전체를 바라보는 것과 같습니다. 세부 사항을 정확히 잡기 위해서는 한 번에 모든 것을 봐야 합니다.
  • 논문의 해결책: 이 부분에는 기존에 강력했던 "Softmax" 방법을 유지합니다. 이는 지역적 세부 사항에 탁월하므로 변경하지 않습니다.

2. "Remember Linearly" (장기 기억)

화가가 다음 프레임으로 이동할 때, 이야기의 일관성을 유지하기 위해 이전 프레임에서 무슨 일이 있었는지 기억해야 합니다 (예: 등장인물의 스카프 색상이 갑자기 빨간색에서 파란색으로 변하지 않도록 하는 것).

  • 과거의 방식: 지금까지 만들어진 모든 프레임의 목록을 보관하는 것 (무거운 배낭).
  • 새로운 방식 (ARL2): 목록 대신 화가는 단 하나의 마법 같은 요약 카드를 사용합니다.
    • 새로운 프레임이 완성되면, 화가는 이 한 장의 카드를 가장 중요한 정보로 업데이트합니다.
    • 이 카드는 영화가 1 분이든 1 시간이든 크기가 일정하게 유지됩니다.
    • 이것이 "Recurrent State"입니다. 이는 무엇을 기억하고 무엇을 잊을지 결정하여 기억이 깔끔하고 관리 가능하도록 하는 "Gated Delta Network"와 같습니다.

어떻게 작동하게 했는지 (학습 과정)

무거운 배낭을 작은 노트로 갑자기 바꾸면 화가가 혼란스러울 수 있습니다. 논문은 모델에게 이 새로운 기술을 가르치기 위한 이 단계 학습 과정을 설명합니다.

  1. 1 단계 (실습): 원래의 무거운 배낭 모델을 가져와서 레이어별로 작은 노트를 사용하는 법을 가르칩니다. 어떤 레이어는 "민감한" (완벽한 세부 사항을 위해 무거운 배낭이 필요한) 레이어이고, 어떤 레이어는 "유연한" (작은 노트를 사용할 수 있는) 레이어인지 테스트합니다.
  2. 2 단계 (최종 시험): 두 가지를 혼합합니다. 유연한 레이어에는 작은 노트를 사용하고 민감한 레이어에는 무거운 배낭을 유지하도록 모델이 연습하게 합니다. 모델이 원래 모델만큼 훌륭해지지만 훨씬 가벼워질 때까지 이를 반복합니다.

결과: 더 빠르고 가벼움

논문에 따르면 이 하이브리드 방식을 사용하면 다음과 같은 결과가 나옵니다.

  • 메모리: 비디오가 길어질수록 컴퓨터의 메모리 사용량이 증가하지 않고 일정하게 유지됩니다. 긴 비디오의 경우 메모리 사용량을 54% 줄였습니다.
  • 속도: 컴퓨터가 무거운 배낭을 들고 고생하지 않기 때문에 더 빠르게 그립니다. 매우 긴 비디오의 경우 2.26 배 속도 향상 (2 배 이상 빠른 속도) 을 보였습니다.
  • 품질: 비디오 품질은 그대로 유지되었으며, 어떤 경우에는 "요약 카드"가 메모 목록의 혼란스러움보다 장기적인 이야기를 더 잘 기억했기 때문에 움직임이 더 매끄러웠습니다.

요약 비유

과거의 모델을 책 한 권을 통째로 외우기 위해 종이에 단어를 하나씩 적어 나가는 학생이라고 생각해 보세요. 그 종이는 점점 길어져 방을 가득 채울 때까지 계속 늘어납니다.

새로운 ARL2 모델은 다음과 같은 학생과 같습니다:

  1. 현재 페이지를 꼼꼼히 읽어서 세부 사항을 이해합니다 (Attend Locally).
  2. 지금까지의 줄거리를 기억하기 위해 스티커 노트에 완벽한 요약 문장 하나를 씁니다 (Remember Linearly).
  3. 다음 페이지로 넘어갈 때마다 그 스티커 노트를 업데이트하여 영원히 작고 관리하기 쉽게 유지합니다.

이를 통해 그들은 책상 공간이 부족해지지 않고 어떤 길이의 책이든 읽을 (생성할) 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →