← 최신 논문
💻 computer science

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

집중적 강제 (Focused Forcing) 는 프레임별 관련성과 헤드별 중요도에 기반하여 고유한 과거 프레임을 동적으로 선택하고 KV 캐시 예산을 할당함으로써 시각적 품질을 향상시키고 최대 1.48 배의 가속을 달성하는 훈련이 불필요한 효율적인 자기회귀 비디오 확산 방법입니다.

원저자: Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 친구에게 매우 길고 복잡한 이야기를 전하려는데, 엄격한 규칙이 하나 있습니다: 이미 말한 내용 중 제한된 양만 기억할 수 있다는 것입니다. 이야기 시작부터 지금까지 말한 모든 단어를 기억하려 한다면, 당신의 뇌 (이 경우 컴퓨터) 는 압도당해 느려지고 결국 멈추게 됩니다.

이것이 자기회귀 비디오 확산 모델이 직면한 문제입니다. 이러한 AI 시스템은 이야기꾼이 문장을 하나씩 이어 붙이듯, 프레임 하나씩을 생성하며 비디오를 만들어냅니다. 다음 프레임이 올바르게 보이게 하려면 AI 는 모든 이전 프레임을 '기억'해야 합니다. 비디오가 길어질수록 이 기억 (KV 캐시라고 함) 은 거대해져 프로세스를 느리게 하고 비용이 많이 들게 만듭니다.

이 논문은 이를 해결하기 위해 **포커스드 포싱 (Focused Forcing)**이라는 새로운 방법을 소개합니다. 단순히 공간을 절약하기 위해 오래된 기억을 무작위로 삭제하는 대신, 포커스드 포싱은 AI 를 재학습시킬 필요 없이 무엇을 유지하고 무엇을 잊어야 할지 정확히 아는 스마트한 편집자처럼 행동합니다.

다음은 세 가지 간단한 비유를 통해 그 작동 원리를 설명한 것입니다:

1. '개인 맞춤 플레이리스트' 대 '공유 플레이리스트'

기존 방식: 새로운 비디오 프레임들 (친구들) 이 과거의 노래들 (역사) 을 듣는다고 상상해 보세요. 이전 방법에서는 친구 각자가 현재 부르고 있는 노래와 상관없이, 전체 그룹이 과거의 동일한 5 곡을 강제로 듣도록 했습니다. 만약 친구 A 가 음정을 맞추기 위해 10 분 전의 특정 노래가 필요했는데, 그룹이 2 분 전의 노래만 들을 수 있다면 음악은 어색하게 들릴 것입니다.

포커스드 포싱: 이 방법은 각 친구에게 자신만의 개인 맞춤 플레이리스트를 제공합니다. 지금 생성 중인 프레임이 과거의 특정 순간을 돌아봐야 할 필요가 있을 수 있으며, 이는 다음 프레임이 필요로 하는 것과 다를 수 있음을 인식합니다. 각 특정 순간에 가장 관련성 높은 역사적 프레임을 선택하여 이야기가 일관되게 유지되도록 합니다.

2. '하이라이트 릴' 대 '지루한 반복'

기존 방식: 긴 영화를 기억하려 한다고 상상해 보세요. 기존 방법은 장면이 얼마나 크게 '외쳤다'는 주의 점수 (Attention Score) 를 기준으로 중요성을 판단했습니다. 하지만 때로는 장면이 현재 진행 중이기 때문에 크게 들릴 뿐, 실제 줄거리와 중요한 연관이 없을 수 있습니다. 또한, 장면이 이전 장면과 매우 유사하다면 (중복), 기존 방법은 그것이 크게 들렸다는 이유만으로 이를 유지하여 공간을 낭비할 수 있습니다.

포커스드 포싱: 이 방법은 두 가지 점수를 사용합니다:

  • 관련성: 이 과거 장면이 현재 우리가 하고 있는 일과 얼마나 연결되는가?
  • 다양성: 이 장면은 실제로 다르고 흥미로운가, 아니면 이미 본 것의 지루한 복사본인가?
    이 두 가지를 결합하여 비디오의 '하이라이트 릴'을 유지합니다. 즉, 독특하고 중요한 순간은 남기고, 반복적이고 지루한 것은 버립니다.

3. 'VIP 패스' 대 '균일한 티켓'

기존 방식: 이야기를 촬영하는 여러 개의 다른 카메라 (주의 헤드) 가 있는 극장을 상상해 보세요. 일부 카메라는 '메인 감독 (매우 중요)'이고, 다른 일부는 단순히 '보조 영상 (덜 중요)'입니다. 이전 방법에서는 모든 카메라에 정확히 동일한 양의 필름 (메모리 예산) 을 할당했습니다. 이로 인해 메인 감독은 필름이 부족해지고, 보조 영상 카메라들은 사용하지 않는 필름이 많이 남게 되었습니다.

포커스드 포싱: 이 방법은 스마트한 티켓 관리자처럼 행동합니다. 먼저 특정 카메라를 끄면 이야기가 얼마나 손상되는지 확인하여 어떤 카메라가 '메인 감독'인지 테스트합니다. 그런 다음 중요한 카메라에는 **VIP 패스 (더 많은 메모리)**를, 덜 중요한 카메라에는 **일반 티켓 (덜 많은 메모리)**을 부여합니다. 이를 통해 비디오 생성의 가장 중요한 부분에 필요한 자원을 확보합니다.

결과

이 세 가지 트릭을 사용하여 포커스드 포싱은 AI 가 품질을 잃지 않고 1.48 배 더 빠르게 (거의 50% 속도 향상) 긴 비디오를 생성할 수 있게 합니다. 사실, 기억의 '지루하고' '중복된' 부분을 제거하기 때문에, 비디오는 종종 이전보다 더 좋아 보이고 스토리 지시를 더 충실히 따릅니다.

간단히 말해: 이는 지저분하고 과부하된 등짐 가방에서 스마트하고 정리된 서류 가방으로 업그레이드하는 것과 같습니다. 당신은 더 적은 무게를 지지만, 일을 완벽하게 끝내기 위해 필요한 것은 정확히 가지고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →