← 최신 논문
🤖 AI

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

본 논문은 사전 학습된 어텐션이 본질적으로 저랭크가 아님에도 불구하고 성공하는 방법임을 보여주면서, 분 단위 자동회귀 비디오 확산에 멀티헤드 잠재 어텐션을 적용하여 KV 캐시 메모리를 92.7% 줄이고 처리량을 1.23 배 향상시키면서도 기준선 품질을 유지하거나 능가하는 새로운 아키텍처인 VideoMLA 를 소개합니다.

원저자: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1 시간 동안 이어지는 이야기를 들려주려는데, 그것을 적을 수 있는 작은 공책 하나만 있다고 상상해 보세요. 새로운 문장을 추가할 때마다 이야기가 논리적으로 이어지도록 이전에 쓴 모든 내용을 기억해야 합니다.

AI 비디오 생성 세계에서는 이 '공책'을 KV 캐시라고 부릅니다. 이는 AI 가 이미 생성한 비디오 프레임에 대한 정보를 저장해 두어 다음 프레임을 생성할 수 있도록 하는 메모리 뱅크입니다.

문제: 공책이 너무 무겁습니다

현재의 AI 비디오 모델은 1 시간 분량의 이야기를 쓰려 노력하는 학생과 같지만, 공책이 너무 무거워 거의 들어 올릴 수조차 없습니다.

  • 기존 방식: AI 가 기억하는 비디오 프레임 하나마다 네트워크 내의 모든 '뇌 세포'(헤드) 에 대해 방대하고 상세한 설명을 적어냅니다.
  • 결과: 비디오 길이가 길어질수록 (수 분 단위) 이 공책은 메모리를 초과할 정도로 거대해집니다. 이를 해결하기 위해 대부분의 시스템은 오래된 페이지를 버리는 방식 (슬라이딩 윈도우) 을 사용하지만, 유지하는 페이지들조차 여전히 매우 무겁고 읽는 속도가 느립니다.

해결책: VideoMLA ('요약' 공책)

이 논문은 공책의 크기를 92.7% 줄이는 새로운 이야기 작성 방식인 VideoMLA를 소개합니다.

다음은 간단한 비유를 통해 그 작동 원리를 설명한 것입니다:

1. '공유된 요약' (저랭크 잠재 변수)
12 명의 친구 (AI 의 12 개 '헤드') 에게 장면을 설명한다고 상상해 보세요.

  • 기존 방식: 각 친구에게 128 페이지 분량의 고유하고 상세한 보고서를 작성합니다. 프레임당 12×128=1,53612 \times 128 = 1,536페이지의 정보가 필요한 셈입니다!
  • VideoMLA: 모든 친구가 같은 이야기를 듣고 있다는 사실을 깨닫습니다. 12 개의 별도 보고서를 작성하는 대신, 장면의 핵심 본질을 담은 단 하나의 압축된 요약 (잠재 변수) 을 작성합니다. 12 명의 친구가 이 하나의 요약을 공유합니다.
  • 마법 같은 점: 이 요약은 훨씬 작습니다 (1,536 페이지 대신 192 페이지). 중복 없이 '무엇' (내용) 을 포착합니다.

2. '분리된 지도' (분리된 3D-RoPE)
요약은 무엇이 일어나고 있는지는 알려주지만, 어디서언제는 알려주지 않습니다.

  • 기존 방식: 위치와 시간 정보가 그 거대하고 무거운 보고서들에 섞여 있었습니다.
  • VideoMLA: 위치와 시간 정보 (예: "오후 2 시에 왼쪽에서 비가 오고 있다") 를 작은 별도의 스티커 메모에 적습니다. 이 메모 또한 모두에게 공유됩니다.
  • 결과: 이제 12 개의 거대한 보고서 대신 작은 요약과 작은 스티커 메모만 있게 됩니다.

큰 놀라움: '불가능할 것'일 때도 작동합니다

보통 과학자들은 원래 정보가 본질적으로 단순하고 요약하기 쉽다고 (저랭크 수학 문제처럼) 믿기 때문에 이 '요약' 트릭 (멀티헤드 잠재 어텐션) 을 사용합니다.

논문의 발견:
저자들은 원래 AI 모델을 조사하여 놀라운 사실을 발견했습니다: 원래 정보는 단순하지 않습니다. 실제로는 매우 복잡하고 엉망입니다 (높은 '랭크').

  • 퍼즐: 복잡하고 엉망인 그림을 간단한 스케치로 요약하려 하면 보통 많은 디테일을 잃게 됩니다.
  • 현실: VideoMLA 는 그럼에도 작동합니다! 원래 데이터가 엉망이더라도 AI 는 전체 이야기를 작은 요약 공간에 맞추는 법을 배웁니다. 결국 한계는 이야기가 얼마나 엉망인지가 아니라 공책이 얼마나 큰지에 달려 있습니다. AI 는 전체 이야기를 작은 공간에 완벽하게 맞추도록 적응할 뿐입니다.

왜 이것이 중요한가

공책을 줄임으로써:

  1. 더 긴 비디오: AI 는 이제 메모리 부족 없이 1 분 길이의 비디오를 생성할 수 있습니다.
  2. 더 빠른 속도: 작은 요약을 읽는 것은 12 개의 거대한 보고서를 읽는 것보다 훨씬 빠릅니다. 논문은 이를 통해 AI 가 1.23 배 더 빨라진다고 보여줍니다.
  3. 더 나은 품질: 압축이 극심함에도 비디오 품질은 높게 유지됩니다. AI 가 '노이즈'가 생기거나 흐려지지 않으며, 움직임은 매끄럽고 캐릭터는 일관성을 유지합니다.

한 마디로 요약하자면

VideoMLA 는 이야기를 전달하기 위해 도서관의 책들을 모두 들고 다닐 필요가 없다는 사실을 깨닫는 것과 같습니다. 잘 쓰인 요약 하나와 작은 지도만 있으면 됩니다. 이를 통해 AI 는 슈퍼컴퓨터로 메모리를 보유할 필요 없이 더 길고 매끄러운 이야기를 훨씬 빠르게 전달할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →