← 최신 논문
💻 computer science

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda 는 통계 인식 점수 매기기와 헤드 인식 타일링을 통해 전체 어텐션 기하학과 타일 선택을 정렬함으로써 확장 가능한 비디오 확산을 가속화하는 증류된 희소 어텐션 프레임워크로, 생성 품질을 저해하지 않으면서 상당한 속도 향상을 달성합니다.

원저자: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

10 초 동안 지속되는 거대하고 초고해상도의 벽화를 그리려고 상상해 보세요. 이를 위해 120 억 명의 작은 예술가들 (토큰) 로 구성된 팀이 있으며, 이들은 색상이 완벽하게 섞이고 움직임이 매끄럽게 보이도록 서로 소통해야 합니다.

현재의 최첨단 기술에서는 각 예술가가 다음에 무엇을 그려야 할지 결정하기 위해 다른 모든 예술가에게 멈춰서 비밀을 속삭여야 합니다. 이를 '전체 주의 (Full Attention)'라고 합니다. 이는 아름다운 결과를 만들어내지만, 매우 느리고 비용이 많이 듭니다. 벽화의 크기를 두 배로 늘리면 조정하는 데 걸리는 시간이 단순히 두 배가 되는 것이 아니라 네 배가 됩니다. 마치 음악이 시작되기 전에 모든 사람이 서로 악수를 해야 하는 파티를 조직하려는 것과 같습니다.

"절충안"의 문제점
연구자들은 예술가들이 몇몇 이웃과만 대화하도록 지시함으로써 (희소 주의, Sparse Attention) 이를 가속화하려고 시도했습니다. 그러나 이전 방법들은 마치 "당신 바로 옆 줄에 있는 사람들과만 대화하세요"라고만 지시하는 어설픈 관리자처럼 행동했습니다. 이로 인해 벽화가 이상하게 보였습니다. 그림 속의 물결이 이상하게 일렁이고, 얼굴이 왜곡되며, 영상이 깜빡였습니다. 예술가들은 그림의 일관성을 유지하는 데 필요한 중요한 대화들을 놓치고 있었던 것입니다.

해결책: Veda (현명한 감독)
이 논문은 Veda라는 새로운 시스템을 소개합니다. 이는 천재적이고 매우 관찰력이 뛰어난 감독 역할을 합니다. Veda 는 누가 누구와 대화해야 할지 추측하는 대신 '증류 (distillation)'라는 트릭을 사용합니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

  1. '오라클' 지도: 느리지만 완벽한 '전체 주의' 방법은 발생해야 하는 모든 대화에 대한 완전한 지도를 그리는 마스터 건축가와 같습니다. 이 지도는 완벽하지만 그리는 데 영원히 걸립니다.
  2. 현명한 학생: Veda 는 마스터 건축가의 지도를 보고 누가 누구와 대화하는지 그 패턴을 학습하도록 가볍고 빠른 '학생' (소형 고속 AI) 을 훈련시킵니다.
  3. 'Tripool' 트릭: 이전의 학생들은 대화의 '평균'을 취하여 지도를 요약하려고 시도했습니다. 하지만 영상에서 가장 중요한 것은 종종 평균적인 수다음이 아니라 단일하고 큰 외침 (피크 신호) 입니다. Veda 의 학생은 더 똑똑합니다. 대화의 최댓값, 최솟값, 그리고 평균을 모두 살펴봅니다. 이를 통해 영상의 안정성을 유지하는 중요한 '큰' 순간들을 놓치지 않도록 보장합니다.
  4. 헤드 인식 타일링: 영상에는 여러 가지 다른 '헤드 (전문 팀)'가 있습니다. 어떤 팀은 시간에 따른 움직임 (시간적) 을 중시하는 반면, 다른 팀은 공간적 모양 (공간적) 을 중시합니다. Veda 는 '일률적인 규칙'이 작동하지 않는다는 것을 깨닫습니다. 각 팀이 특정 업무에 맞는 맞춤형 퍼즐 조각 (타일링) 을 부여받아 중요한 세부 사항을 놓치지 않도록 합니다.

결과: 흐림 없이 속도를 내다
Veda 가 지도를 학습한 후, 예술가들에게 다음과 같이 말합니다. "이 특정 5% 의 사람들과만 대화하면 됩니다. 나머지는 무시하세요."

Veda 는 중요한 연결고리를 잃지 않고 정확히 누가 무시되어야 하는지 알기 때문에, 영상 생성이 놀라울 정도로 빨라집니다:

  • 속도: 고해상도 10 초 영상을 생성하는 속도가 5.1 배 빨라집니다.
  • 품질: 이전 방법들이 영상을 결함이 있거나 왜곡되게 만든 것과 달리, Veda 의 영상은 느리지만 완벽한 버전만큼이나 훌륭하게 보입니다.
  • 확장성: 영상이 길고 디테일해질수록 Veda 의 성능이 더욱 빛을 발합니다. 이는 추가 작업을 거의 선형적으로 처리하는 반면, 기존 방법들은 교통 체증에 빠지게 됩니다.

요약
Veda 는 완벽한 계획을 연구하고, 어떤 대화가 중요한지 정확히 학습한 후 팀이 지루한 잡담을 건너뛰도록 지시하는 초지능 감독과 같습니다. 이를 통해 그림이 무너지지 않으면서도 거대하고 고품질의 벽화를 단시간에 그릴 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →