CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
CoReDiT 은 확산 트랜스포머를 위한 효율적인 토큰 가지치기 프레임워크로, 공간적 일관성을 활용하여 중복 토큰을 식별하고 건너뛰는 동시에 이웃 토큰을 통해 해당 토큰의 출력을 재구성함으로써 시각적 품질을 훼손하지 않으면서도 상당한 계산 속도 향상과 메모리 절감을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 벽에 엄청나게 디테일한 벽화를 그리려 한다고 상상해 보세요. 벽 앞에 예술가 팀 (이들은 '토큰'이라고 불립니다) 이 서 있으며, 각 예술가는 자신의 특정 위치에 어떤 색을 칠할지 결정하기 위해 다른 모든 예술가와 대화해야 합니다. 이로써 그림이 완벽해지지만, 이는 매우 피곤한 일입니다. 만약 1 만 명의 예술가가 있다면, 다음 붓질에 합의하기 위해 1 억 번의 대화를 나누어야 합니다. 이것이 현재 AI 이미지 생성기 (Diffusion Transformers 라고 불림) 가 작동하는 방식입니다: 이들은 훌륭하지만 매우 느리고 컴퓨터 성능을 많이 요구합니다.
이 논문은 그림을 망치지 않으면서 이 과정을 더 빠르게 만들기 위한 새로운 방법인 CoReDiT를 소개합니다. 작동 원리는 다음과 같이 세 가지 간단한 단계로 나뉩니다:
1. "지루한 예술가" 탐지기 (공간적 일관성)
일반적인 그림에서는 얼굴이나 나무처럼 매우 바쁘고 디테일한 영역이 있는 반면, 푸른 하늘이나 매끄러운 벽처럼 평범하고 지루한 배경 영역도 있습니다.
- 문제점: 기존 AI 는 모든 예술가를 동일하게 취급하여, 지루한 푸른 하늘을 그리는 예술가들이 얼굴을 그리는 예술가들과 똑같이 치열한 대화를 나누도록 강요합니다.
- CoReDiT 의 해결책: CoReDiT 는 예술가들을 살펴보고 "누가 자신과 정확히 똑같은 옆에 서 있는가?"라고 묻습니다. 만약 한 예술가가 지루하고 균일한 영역에 있다면, 그 이웃들은 사실상 복제본과 같습니다. CoReDiT 는 이러한 "지루한" 예술가들에게 높은 **일관성 점수 (Coherence Score)**를 부여합니다.
- 조치: 이는 점수가 높은 (중복된) 예술가들에게 "지금 모든 사람과 대화할 필요가 없어. 잠시 쉬어."라고 말합니다. 이로써 이미지의 지루한 부분에 대한 비싼 대화들을 건너뛰어 막대한 시간을 절약합니다.
2. "빈칸 채우기" 예술가 (재구성)
만약 "지루한" 예술가들에게 집으로 돌아가 일을 멈추라고만 한다면, 벽화에는 구멍이 생길 것입니다. 그림은 깨지고 patchy 해 보일 것입니다.
- 문제점: 단순히 토큰 (예술가) 을 제거하면 시각적 결함이 발생합니다.
- CoReDiT 의 해결책: 구멍을 남기는 대신, CoReDiT 는 남아 있는 예술가들을 이용해 빈칸을 채웁니다. "지루한" 예술가들은 이웃들과 매우 유사했기 때문에, 남은 예술가들은 빠진 예술가들이 무엇을 그렸을지 쉽게 추측할 수 있습니다.
- 조치: 이는 남은 예술가들이 올바른 색을 빈 공간에 속삭이는 "전화 게임"과 같습니다. 이로 인해 실제로 무거운 작업을 수행한 예술가는 적었지만, 최종 이미지는 매끄럽고 완전하며 눈에 띄는 간격 없이 완성됩니다.
3. 스마트 관리자 (점진적 가지치기)
그림 제작 과정의 모든 부분이 동일한 것은 아닙니다.
- 문제점: 이미지 제작 초기에는 그림이 TV 화면의 눈 (static noise) 과 같은 정적 잡음일 뿐이므로, 거의 모든 것이 동일하고 중복됩니다. 하지만 마지막 단계인 디테일이 선명해질 때는 모든 단일 붓질이 중요합니다. 너무 일찍 너무 많은 예술가를 잘라내면 AI 가 혼란을 겪습니다. 너무 늦게 너무 많은 예술가를 잘라내면 그림이 흐려집니다.
- CoReDiT 의 해결책: CoReDiT 는 완벽한 일정을 학습하는 스마트 관리자처럼 행동합니다. 이미지가 잡음일 때는 AI 가 많은 중복 예술가를 제거하도록 허용하는 것으로 시작합니다. 이미지가 더 선명하고 디테일해짐에 따라, 관리자는 점점 더 적은 예술가를 잘라내도록 하여 중요한 디테일이 충분한 주의를 받도록 합니다.
- 조치: 이는 AI 뇌 (블록) 의 어느 부분과 과정의 어느 단계 (시간 단계) 가 가장 많은 절단을 견딜 수 있는지 자동으로 파악하여, 품질을 높게 유지하기 위해 계획을 실시간으로 조정합니다.
결과
이 방법을 사용함으로써 저자들은 다음과 같은 사실을 발견했습니다:
- 속도: 강력한 클라우드 컴퓨터에서 AI 는 1.33 배 더 빠르게 실행되며, 모바일 폰 칩에서는 1.72 배 더 빠르게 실행됩니다.
- 효율성: 무거운 수학 작업 (연산) 을 최대 **55%**까지 줄입니다.
- 품질: 이미지는 느린 버전과 똑같이 보이며, 눈에 띄는 균열이나 기괴한 아티팩트가 없습니다.
- 보너스: 메모리를 더 적게 사용하므로, 일반적으로 메모리 부족으로 인해 충돌하는 폰에서도 더 높은 해상도의 이미지를 생성할 수 있습니다.
요약하자면, CoReDiT 는 crew 가 언제 쉬게 하고 언제 열심히 일하게 할지 정확히 아는 스마트한 현장 관리자를 고용하는 것과 같아, 훨씬 더 빠르게 완성된 걸작을 만들어냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.