← 최신 논문
💻 computer science

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

본 논문은 새로운 KV 캐시 동기화 메커니즘과 캐시된 오일러 업데이트를 통해 전역적 맥락과 품질을 유지하면서 저속 토큰에 대해 적은 디노이징 단계를 동적으로 할당함으로써 비디오 생성용 디퓨전 트랜스포머의 추론 속도를 가속화하는 학습이 불필요한 추론 알고리즘인 이질적 단계 할당 (HSA) 을 소개한다.

원저자: Ernie Chu, Vishal M. Patel

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ernie Chu, Vishal M. Patel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고예산 영화 제작을 지휘한다고 상상해 보세요. 이 영화에서 모든 등장인물, 배경의 나무, 바닥의 먼지 한 알까지 모두 배우입니다. 표준 확산 트랜스포머 (영상을 만드는 AI 모델) 에서는 감독이 이러한 '배우'들 하나하나를 완전히 동일하게 대우합니다.

대본에 장면을 완벽하게 만들기 위해 40 회의 리허설 (노이즈 제거 단계) 이 필요하다고 명시되어 있다면, 감독은 배경 벽을 40 회 리허설하게 하고, 정지된 나무를 40 회 리허설하게 하며, 화면을 가로지르는 영웅도 40 회 리허설하게 합니다.

문제는 무엇일까요? 벽과 나무는 거의 움직이지 않습니다. 이들에게 40 회의 리허설이 필요하지 않으며, 5 회면 충분합니다. 하지만 AI 는 그들을 리허설하게 함으로써 막대한 시간과 에너지를 낭비하는 반면, 빠르게 움직이고 형태가 변하는 영웅에게도 똑같이 40 회를 할당합니다. 이는 슈퍼스타 배우와 판화 카드를 같은 시간당 임금으로, 똑같은 양의 작업에 대해 똑같이 대우하는 것과 같습니다.

해결책: 이질적 단계 할당 (HSA)

이 논문의 저자인 어니 추 (Ernie Chu) 와 비샬 파텔 (Vishal Patel) 은 **이질적 단계 할당 (HSA)**이라는 더 지능적인 영화 세트 운영 방식을 제안합니다.

HSA 를 배우들을 관찰하며 다음과 같이 말하는 지능형 감독으로 생각해보세요:

  • "당신, 배경 벽이죠? 지루하고 정적입니다. 5 회의 리허설만 필요해요."
  • "당신, 달리는 영웅이죠? 역동적이고 복잡합니다. 40 회의 리허설이 모두 필요해요."
  • "당신, 흔들리는 나무이죠? 20 회의 리허설이 필요해요."

이는 지루한 부분에 에너지를 낭비하는 것을 AI 가 멈추게 함으로써 막대한 시간을 절약합니다.

그들이 해결한 두 가지 까다로운 문제

"좋습니다, 하지만 벽이 5 회 리허설 후 멈춘다면, 40 회 리허설 때 영웅이 무엇을 하는지 어떻게 알 수 있을까요? 같은 장면에 있기 위해 서로를 보아야 합니다."라고 생각하실 수 있습니다.

이 논문은 이를 해결하기 위한 두 가지 교묘한 트릭을 제시합니다.

1. "유령 기억" 트릭 (KV-Cache 동기화)
AI 에서 배우들은 동기화를 유지하기 위해 서로를 '봐야' 합니다 (이를 어텐션이라고 합니다). 일반적으로 한 배우가 리허설을 중단하면 그 배우는 방에서 사라지고 다른 배우들은 그들을 볼 수 없습니다.

  • 해결책: AI 는 벽과 나무의 '유령 기억' (캐시) 을 유지합니다. 그들이 적극적으로 리허설하지 않더라도 그들의 '유령'은 방에 남아 있습니다. 활동 중인 배우 (영웅) 는 여전히 비활동 중인 배우들의 유령을 바라보며 그들이 어디에 있는지 알 수 있습니다.
  • 결과: 벽이 실제로 어떤 작업도 수행하지 않아도 영웅은 집중적으로 리허설하면서도 벽이 정확히 어디에 있는지 알 수 있게 됩니다.

2. "시간 여행" 트릭 (캐시된 오일러 업데이트)
벽이 휴식을 취하는 동안 벽의 위치는 어떻게 됩니까? 그냥 얼어붙는 걸까요?

  • 해결책: AI 는 벽이 마지막으로 움직인 시점과 그 속도를 기억합니다. 단순한 수학 공식을 사용하여 건너뛴 시간 동안 벽의 위치를 '앞당겨' 계산합니다. 마치 "벽은 지난번에 초당 1 인치씩 움직였으니, 실제로 움직이게 하지 않고 지금 위치를 계산해 보자"라고 말하는 것과 같습니다.
  • 결과: 벽은 AI 가 복잡한 시뮬레이션을 실행할 필요 없이 배경에서 즉시 업데이트됩니다.

결과: 더 빠르고, 더 저렴하며, 똑같이 훌륭함

연구진들은 Wan-2 와 LTX-2 와 같은 강력한 영상 제작 AI 모델에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  • 속도: 영상 제작에 소요되는 시간을 **50% 또는 심지어 75%**까지 단축할 수 있었습니다 (원래 시간의 25% 만 소요되도록).
  • 품질: 시간을 이렇게 많이 줄였음에도 불구하고, 영상은 느리고 풀스피드 버전과 거의 동일하게 보였습니다. '영웅'은 여전히 선명했고 '벽'은 여전히 견고하게 보였습니다.
  • 비교: 이전 방법들은 모두를 위해 리허설 라운드를 통째로 건너뛰는 방식으로 속도를 높이려 했습니다. 이러한 방법들은 너무 빠르게 시도할 때 영상이 무너지게 만들었습니다 (건물이 무너지는 것처럼). HSA 는 작업이 필요 없는 부분만 건너뛰었기 때문에 영상이 안정적으로 유지되었습니다.

요약하자면

이 논문은 모든 픽셀을 동일하게 대우하지 않는 것에 관한 것입니다. 영상의 일부는 지루하고 정적인 반면 다른 일부는 흥미롭고 움직인다는 사실을 깨닫음으로써, AI 는 지루한 부분에 시간을 낭비하지 않게 됩니다. '유령 기억'과 '수학적 단축키'를 사용하여 모든 것을 동기화함으로써, 우리는 원래 시간의 일부만으로 고품질 영상을 생성할 수 있게 됩니다.

이는 자동차의 모든 나사를 동일한 정밀도로 가공하는 공장과, 엔진에 90% 의 시간을 할애하고 시트 커버를 고정하는 나사에는 10% 만 할애하는 공장의 차이와 같습니다. 자동차는 여전히 완벽하게 작동하지만 훨씬 더 빠르게 제작됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →