← 최신 논문
🤖 machine learning

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

이 논문은 하이브리드 Top-k+Top-p 마스킹 규칙과 증류 기반 미세 조정 목표를 도입하여 비디오 확산 모델에서 생성 품질을 유지하면서 95% 의 높은 주석 희소성과 16.2 배의 속도 향상을 달성한 학습 가능한 희소 어텐션 방법인 SpargeAttention2 를 제안합니다.

원저자: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

게시일 2026-02-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 스파지어텐션 2: "비디오 생성 AI"를 위한 초고속 렌더링 비법

이 논문은 AI 가 영상을 만들 때 (특히 긴 비디오를 만들 때) 얼마나 느리고 비싼지를 해결하는 새로운 기술을 소개합니다. 마치 고화질 영화를 만들 때, 불필요한 장면을 과감히 잘라내면서도 스토리는 그대로 유지하는 마법 같은 편집기 같은 거죠.

이 기술을 **스파지어텐션 2 (SpargeAttention2)**라고 부르는데, 이를 쉽게 이해할 수 있도록 일상적인 비유로 설명해 드릴게요.


1. 문제: "모든 것을 다 보느라 지친 AI" 🤯

비디오를 만드는 AI 는 매 순간 화면의 모든 픽셀과 이전 장면, 그리고 사용자의 명령 (텍스트) 을 서로 연결해서 생각해야 합니다. 이를 **'어텐션 (Attention)'**이라고 하는데, 마치 영화 감독이 촬영 현장의 모든 배우, 조명, 소품, 대본을 동시에 주시해야 하는 상황과 비슷합니다.

  • 문제점: 장면이 길어질수록 (비디오가 길어질수록) 감독이 봐야 할 것이 기하급수적으로 늘어납니다. 계산량이 너무 많아서 컴퓨터가 멈추거나 (지연), 돈이 너무 많이 듭니다.
  • 기존 해결책: "중요하지 않은 건 무시하자!"라고 생각해서, 감독이 일부 배우만 보고 나머지는 무시하게 만드는 '스파지 (Sparse) 어텐션' 기술들이 있었습니다. 하지만 이건 고정된 규칙만 썼기 때문에, 중요한 장면을 실수로 잘라내거나 (화질 저하), 여전히 불필요한 걸 너무 많이 보는 문제가 있었습니다.

2. 해결책: "스파지어텐션 2"의 3 가지 마법 🪄

이 논문은 기존 방식의 한계를 깨고, AI 가 스스로 배우게 하여 더 똑똑하고 빠르게 만들었습니다.

① "Top-k + Top-p" 혼합 마스크: "현명한 선택의 두 가지 기준" 🎯

기존 방식은 "가장 중요한 것 10 개만 고르자 (Top-k)"거나 "누적 확률이 80% 될 때까지 고르자 (Top-p)"는 식으로 한 가지 규칙만 따랐습니다.

  • Top-k 의 실패: 모든 것이 비슷하게 중요할 때 (균일한 분포), 10 개만 고르면 중요한 정보의 90% 를 놓칠 수 있습니다.
  • Top-p 의 실패: 한두 개가 압도적으로 중요할 때 (치우친 분포), 그 '핵심'만 보고 나머지를 다 버리면, 사실은 중요한 '보조 정보'까지 잃어버립니다.

🌟 스파지어텐션 2 의 해법:
이 두 가지를 혼합했습니다!

"상황에 따라 가장 중요한 10 개를 고르되, 만약 그 10 개가 너무 중요하지 않다면 (확률이 낮다면) 누적해서 80% 에 도달할 때까지 더 골라라!"
이렇게 유연하게 선택하면, 어떤 상황에서도 핵심 정보를 놓치지 않고 불필요한 것은 과감히 잘라냅니다.

② "지식 증류 (Distillation)": "선배에게 배우는 신입 사원" 🎓

기존 방식은 AI 를 새로운 데이터로 다시 훈련시켰는데, 문제는 원래 AI 가 배웠던 고품질 데이터가 공개되지 않아서 (예: Wan2.1 모델), AI 가 엉뚱한 데이터에 맞춰져서 성능이 떨어지는 일이 자주 있었습니다.

🌟 스파지어텐션 2 의 해법:
원래의 완벽한 AI(선배) 를 **동결 (Frozen)**시켜두고, 새로운 AI(신입) 가 선배의 **생각 과정 (속도/Velocity)**을 그대로 따라하게 합니다.

"선배가 어떻게 움직이는지, 어떤 결정을 내리는지 똑같이 따라해. 우리가 가진 데이터가 완벽하지 않아도, 선배의 '감'을 그대로 배우면 실수가 없어!"
이렇게 하면 데이터가 부족해도 원래의 화질과 스토리 일관성을 잃지 않습니다.

③ "효율적인 엔진": "불필요한 계산은 아예 안 하기" ⚡

단순히 규칙만 바꾼 게 아니라, GPU(컴퓨터 칩) 가 가장 좋아하는 방식으로 코드를 다시 짰습니다.

"중요하지 않은 블록은 아예 계산하지 않고, 필요한 부분만 쏙쏙 골라내서 처리해."
이로 인해 계산 속도가 비약적으로 빨라졌습니다.


3. 결과: "화질은 그대로, 속도는 16 배 빨라!" 🚀

이 기술을 적용한 결과는 놀랍습니다.

  • 압축률: AI 가 계산해야 할 정보의 95% 를 버려도 (스파지 95%), 화질은 원래와 다름없습니다.
  • 속도:
    • 어텐션 계산 속도: 16.2 배 빨라졌습니다. (예: 97 초 걸리던 게 6 초로!)
    • 전체 비디오 생성 속도: 4.7 배 빨라졌습니다. (예: 50 분 걸리던 게 10 분으로!)
  • 품질: 다른 방법들은 화질이 떨어지거나 캐릭터가 뒤로 걷는 등 엉뚱한 결과가 나왔지만, 이 방법은 텍스트와 영상이 완벽하게 일치하는 고품질 영상을 만들었습니다.

📝 한 줄 요약

"스파지어텐션 2 는 AI 가 비디오를 만들 때, '무엇을 볼지'를 스스로 배우게 하고, '선배의 감'을 따라하게 함으로써, 불필요한 계산을 95% 줄여도 화질은 그대로 유지하는 초고속 기술을 개발했습니다."

이제 AI 는 더 적은 전력과 시간으로 더 길고 멋진 비디오를 만들 수 있게 되었습니다! 🎥✨

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →