← 최신 논문
💻 computer science

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

본 논문은 폐쇄형 가중치 변조(closed-form weight modulation)를 통해 과거의 컨텍스트를 모델 가중치로 증류함으로써 자기회귀적 비디오 생성에서의 메모리 병목 현상을 완화하고, 이를 통해 거의 손실 없는 시각적 품질을 유지하면서 최대 50%의 KV 캐시 절감을 가능하게 하는 새로운 프레임워크인 인스턴스별 파라메트릭 흡수(Instance-Specific Parametric Absorption, ISPA)를 제안한다.

원저자: Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 긴 이야기를 한 문장씩 써 내려가려 한다고 상상해 보세요. 이때 처음부터의 모든 세부 사항을 기억하여 플롯의 일관성을 유지해야 합니다.

AI 비디오 생성 분야에서도 정확히 이런 일이 일어납니다. AI는 프레임 단위로 비디오를 생성합니다. 캐릭터의 얼굴이 갑자기 변하거나 배경이 심하게 깜빡거리는 것을 방크하기 위해, AI는 지금까지 생성한 모든 것을 담은 "기억 저장소"(KV 캐시라고 불림)를 유지합니다.

문제점: 기억 저장소가 너무 무겁습니다
비디오가 길어질수록 이 기억 저장소는 점점 더 커집니다. 결국, 이 저장소는 너무 무거워져서 컴퓨터의 메모리(RAM)를 가득 채우게 되고, 시스템이 느려지거나 충돌을 일으킵니다. 이는 마치 걸음을 옮길 때마다 배낭에 벽돌을 계속 추가하여, 결국 더 이상 걸을 수 없게 되는 것과 같습니다.

보통 이를 해결하기 위해 사람들은 배낭에서 오래된 벽돌(토큰)을 버리려고 시도합니다. 하지만 비디오 생성에서 오래된 기억을 버리는 것은 위험합니다. 만약 10초 전의 캐릭터가 어떻게 생겼는지 잊어버린다면, 캐릭터의 모습이 변하거나 배경이 흔들릴 수 있습니다.

해결책: ISPA ("내부 기억" 기술)
이 논문의 저자들은 ISPA(Instance-Specific Parametric Absorption, 인스턴스별 매개변수 흡수)라고 불리는 새로운 방법을 제안합니다. ISPA는 오래된 기억을 버리는 대신, AI가 그 기억들을 자신의 뇌 속에 암기하도록 가르칩니다.

작동 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. "웜업(Warm-Up)" 단계 (학습 세션)

AI가 시험을 치르는 학생이라고 상상해 보세요. 비디오의 초기 몇 초 동안("웜업" 기간), AI는 두 가지 일을 동시에 수행합니다.

  • 전체 역사(전체 배낭)를 살펴봅니다.
  • 최근의 과거(작은 공책)만을 살펴봅니다.

그 후 AI는 이 둘을 비교합니다. AI는 스스로에게 묻습니다: "만약 내가 전체 배낭이 아니라 이 작은 공책만 보았다면, 내 답안이 어떻게 달라졌을까?"

2. "흡수(Absorption)" 단계 (컨닝 페이퍼)

이 짧은 웜업 단계를 통해 충분한 데이터를 수집하면, AI는 수학적인 트릭을 수행합니다. AI는 특별한 "조정 계수"(내부 가중치에 대한 미세한 변화)를 계산합니다.

이 조정 계수를 학생의 뇌 속에 붙여놓은 **"영구적인 컨닝 페이퍼"**라고 생각하면 됩니다. 이 컨닝 페이퍼는 "사라진" 역사를 완벽하게 요약해 줍니다. 이것은 AI에게 다음과 같이 알려줍니다: "이제 더 이상 무거운 배낭을 들여다보지 않더라도, 이 컨닝 페이퍼에 답이 있으니 마치 배낭을 보고 있는 것처럼 행동하라."

3. "효율적(Efficient)" 단계 (가벼워진 배낭)

그 시점부터 AI는 무거운 배낭을 들고 다니는 것을 멈춥니다. AI는 오래된 기억 토큰을 버리고(엄청난 양의 공간을 확보함), 대신 "컨닝 페이퍼"(조정된 가중치)를 사용하여 과거를 기억합니다.

  • 기존 방식: 벽돌이 든 무거운 배낭을 메고 가는 것.
  • ISPA 방식: 벽돌의 설계도를 암기한 뒤, 작고 가벼운 종이 한 장을 들고 가는 것.

왜 특별한가

  • 품질 저하 없음: AI가 단순히 기억을 삭제한 것이 아니라 역사를 "학습"했기 때문에, 비디오의 일관성이 유지됩니다. 캐릭터의 얼굴이 변하지 않고 배경도 안정적입니다.
  • 각 비디오에 맞춤화됨: 논문은 이 "컨닝 페이퍼"가 생성되는 각각의 비디오마다 고유하다는 점을 명시합니다. 춤추는 고양이 비디오는 달리는 자동차 비디오와는 다른 컨닝 페이퍼를 갖게 됩니다.
  • 속도: 무거운 메모리 뱅크를 제거함으로써 AI는 훨씬 더 빠르게 작동합니다. 저자들은 메모리 사용량을 50% 줄이면서도 원래의 무거운 버전과 거의 동일한 영상을 만들 수 있다는 것을 발견했습니다. 어떤 경우에는 이 기술을 다른 기법들과 결합하여 AI를 거의 2배 더 빠르게 만들기도 했습니다.

"싱크(Sink)" 토큰 (닻)

논문은 또한 작지만 결정적인 세부 사항 하나를 언급합니다. AI는 첫 번째 프레임으로부터 오는 작고 변하지 않는 "닻"(sink token이라고 불림)을 유지합니다. 이것은 등대 역할을 합니다. AI가 중간의 세부 사항들을 잊더라도, 이 등대는 AI가 길을 잃거나 경로를 벗어나지 않도록 하여 비디오의 안정성을 유지해 줍니다.

요약하자면:
ISPA는 긴 비디오를 제작할 때 발생하는 "메모리 부족" 문제를 해결합니다. 오래된 기억을 삭제하여 글리치(오류)를 일으키는 대신, 그 기억들을 AI 자신의 뇌 속에 가볍고 영구적인 형태로 압축합니다. 이를 통해 AI는 모든 데이터를 보유하기 위한 슈퍼컴퓨터 없이도 길고 매끄러운 비디오를 생성할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →