← 최신 논문
💻 computer science

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

이 논문은 학습 가능한 토큰 희소성과 동적 프로그래밍 기반의 최적화를 통해 확산 트랜스포머 모델의 추론 비용을 획기적으로 줄이면서도 생성 품질을 유지하거나 오히려 향상시키는 'DiffSparse'라는 새로운 가속화 프레임워크를 제안합니다.

원저자: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

DiffSparse: AI 그림 그리기 속도를 2 배로, 화질은 그대로!

이 논문은 AI 가 그림을 그릴 때 얼마나 많은 전력을 쓰고 시간이 걸리는지를 해결하는 새로운 방법인 **'DiffSparse'**를 소개합니다.

마치 고급 레스토랑의 요리사가 있다고 상상해 보세요. 이 요리사 (AI) 는 아주 정교한 요리를 만들지만, 한 접시를 완성하려면 20 번이나 재료를 다듬고, 맛을 보고, 다시 다듬는 과정을 반복해야 합니다. 이 과정은 시간이 너무 오래 걸리고, 주방 (컴퓨터) 을 뜨겁게 만듭니다.

기존의 방법들은 "아, 이 단계는 대충 해도 되겠지"라고 사람이 직접 정해둔 규칙대로 재료를 버리거나 건너뛰었습니다. 하지만 이 방법은 요리사가 실수를 하거나, 요리의 맛 (화질) 이 떨어지는 문제가 있었습니다.

DiffSparse는 이 문제를 스마트한 주방 도우미처럼 해결합니다.

1. 핵심 아이디어: "무엇을 버리고, 무엇을 살릴까?"

AI 가 그림을 그릴 때, 그림의 모든 부분 (픽셀이나 토큰) 을 매번 처음부터 다시 계산할 필요는 없습니다. 이미 계산된 부분은 기억해 두었다가 (캐싱) 다시 쓸 수 있거든요.

하지만 어떤 부분을 기억하고, 어떤 부분을 다시 계산할지를 정하는 것이 가장 어렵습니다.

  • 기존 방법: "1 단계와 2 단계는 다 계산하고, 3 단계부터는 50% 만 계산하자"라고 사람이 미리 정해둔 규칙을 따릅니다. (비효율적임)
  • DiffSparse: AI 스스로 **"지금 이 순간, 이 부분만 계산하면 되고 나머지는 기억해 둔 게 충분해!"**라고 스스로 판단하게 합니다.

2. DiffSparse 의 마법 같은 세 가지 도구

이 시스템은 세 가지 도구로 작동합니다.

① '스마트한 점수판' (Token Selector)

그림을 그리는 과정에서 AI 는 수천 개의 작은 조각 (토큰) 을 다룹니다. 이 조각들 중 어떤 것이 중요한지 점수를 매깁니다.

  • 비유: 요리사가 재료를 다듬을 때, "이 고기는 중요하니까 잘라야 하고, 저 건초는 그냥 버려도 돼"라고 판단하는 것과 같습니다. DiffSparse 는 중요한 재료만 정성스럽게 다듬고, 중요하지 않은 재료는 이미 준비된 것 (캐시) 을 그대로 사용합니다.

② '예측하는 두뇌' (Sparsity Cost Predictor)

이게 가장 중요한 부분입니다. "어떤 단계를 건너뛰면 그림이 망가질까?"를 미리 학습합니다.

  • 비유: 요리사가 "오늘은 손님이 급해서 3 단계만 건너뛰면 될 것 같아"라고 직관적으로 예측하는 능력입니다. 이 두뇌는 AI 가 그림을 그리는 전체 과정을 훑어보며, **"어디서 얼마나 생략해도 맛있는지"**를 학습합니다.

③ '최적의 경로 찾기' (Dynamic Programming Solver)

학습된 두뇌가 예측한 정보를 바탕으로, 전체 그림이 망가지지 않으면서도 가장 빠르게 그릴 수 있는 경로를 찾아냅니다.

  • 비유: 여행 계획을 세울 때, "A 길은 빠르지만 경치가 안 좋고, B 길은 멀지만 경치가 좋아"라고 할 때, 시간과 경치를 모두 고려해 가장 완벽한 경로를 찾아내는 GPS와 같습니다.

3. 왜 이것이 혁신적인가요?

기존 방법들은 "이 단계는 무조건 다 계산해야 해"라고 강제하는 경우가 많았습니다. 하지만 DiffSparse 는 두 단계 학습 전략을 사용합니다.

  1. 1 단계: 처음에는 AI 가 실수를 바로잡을 수 있도록 중요한 단계는 다 계산하게 합니다.
  2. 2 단계: AI 가 "어디를 생략해도 괜찮은지"를 완벽하게 학습하면, 이제 불필요한 계산을 과감하게 줄입니다.

이 덕분에 계산 비용 (전력) 을 50% 이상 줄이면서도, 오히려 그림의 질은 더 좋아지거나 최소한 떨어지지 않습니다.

4. 실제 성과: "더 빠르고, 더 예쁘게"

논문의 실험 결과를 보면 놀랍습니다.

  • PixArt-α라는 유명한 AI 모델을 사용했을 때, 계산량을 54% 줄이면서 (약 2 배 빠름), 기존 방법들보다 더 좋은 화질을 보여주었습니다.
  • 마치 요리사가 2 배 빠르게 요리를 만들어내는데, 맛은 더 좋아진 것과 같습니다.

요약

DiffSparse는 AI 가 그림을 그릴 때, 어디서 에너지를 아껴야 할지 스스로 배우는 똑똑한 시스템입니다.

  • 과거: 사람이 "여기 생략해, 저기 생략해"라고 지시함. (비효율, 화질 저하)
  • DiffSparse: AI 가 "여기 생략해도 돼, 저기는 꼭 계산해야 해"라고 스스로 최적의 계획을 세움. (초고속, 화질 유지 또는 향상)

이 기술은 AI 가 더 빠르고 저렴하게 작동할 수 있게 하여, 우리 일상에서 AI 그림 생성기를 더 쉽게 사용할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →