← 최신 논문
💬 NLP

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

이 논문은 학습이나 사전 계산 없이 고정된 스칼라 임계값을 통해 어텐션 블록을 동적으로 스킵하여 LLM 의 긴 컨텍스트 추론 속도를 획기적으로 개선하면서도 정확도를 유지하는 BLASST 라는 새로운 희소 어텐션 메커니즘을 제안합니다.

원저자: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach
게시일 2026-04-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

BLASST: 거대한 언어 모델의 '스마트 필터링' 기술

이 논문은 최근 화두인 **거대 언어 모델 **(LLM)을 해결하기 위해 NVIDIA 와 연구팀이 개발한 새로운 기술, BLASST에 대해 설명합니다.

기존의 모델은 문맥이 길어질수록 계산량이 기하급수적으로 늘어나서 속도가 느려지고 메모리도 많이 잡아먹는 문제가 있었습니다. BLASST 는 이 문제를 **"중요하지 않은 정보는 과감히 무시하자"**는 아이디어로 해결했습니다.

아래는 일상적인 비유를 통해 BLASST 가 어떻게 작동하는지 설명한 것입니다.


1. 문제 상황: "모든 것을 다 읽으려는 비효율적인 도서관 사서"

거대 언어 모델이 긴 글을 읽을 때 (예: 책 한 권 전체를 분석할 때), 기존 방식은 글자 하나하나를 모두 꼼꼼히 비교합니다.

  • 비유: 도서관 사서가 1,000 권의 책 중 한 권을 찾을 때, 책 제목을 보지 않고 모든 책의 내용을 처음부터 끝까지 다 읽어서 필요한지 확인한다고 상상해 보세요.
  • 결과: 시간이 너무 오래 걸리고, 사서 (GPU) 는 지쳐버립니다. 이것이 기존 모델이 긴 문맥을 처리할 때 겪는 '계산 병목 현상'입니다.

2. BLASST 의 해결책: "스마트한 필터링"

BLASST 는 이 비효율적인 방식을 바꿉니다. 모든 내용을 다 읽지 않고, 중요한 부분만 골라서 읽는 것입니다.

  • 핵심 아이디어: "이 부분이 정말 중요할까?"를 미리 판단해서, 중요하지 않은 부분은 계산 자체를 아예 하지 않고 건너뜁니다.
  • 비유: 도서관 사서가 책장을 넘길 때, 책 제목만 살짝 보고 "아, 이 책은 내가 찾는 내용과 전혀 상관없네?"라고 판단하면, 책 내용을 한 줄도 읽지 않고 바로 다음 책으로 넘어갑니다.
  • 효과: 읽어야 할 책 (계산해야 할 데이터) 이 70% 이상 줄어들기 때문에, 사서의 업무 속도가 1.5 배 이상 빨라집니다.

3. 어떻게 그렇게 판단할까? (소프트맥스 임계값)

"어떻게 책 제목만 보고 중요도를 알 수 있죠?"라는 질문이 나올 수 있습니다. BLASST 는 이미 계산 중인 숫자를 활용합니다.

  • 작동 원리:

    1. 사서가 책을 읽다가 **지금까지 본 내용 중 가장 중요한 부분의 점수 **(최대값)를 기억해 둡니다. (예: "지금까지 본 것 중 100 점짜리 내용이 있었어.")
    2. 새로운 책 (블록) 을 보는데, 그 책의 가장 중요한 부분의 점수가 100 점보다 훨씬 낮다면 (예: 10 점), "이건 중요하지 않아, 건너뛰자!"라고 판단합니다.
    3. 이때 **문장 하나하나를 다 읽지 않고 **(소프트맥스 계산 생략), **책장을 넘기는 것 **(데이터 로드)도 생략합니다.
  • 창의적 비유:

    • 기존 방식: 모든 학생의 시험지를 다 채점해서 상위 10% 를 뽑음.
    • BLASST 방식: 채점 중 "지금까지 본 점수 중 90 점이 최고야"라고 기억해 둠. 그다음 학생의 점수가 10 점이라면, "이 학생은 90 점보다 훨씬 낮으니 채점도 안 하고 바로 다음 학생으로 넘어가!"라고 함.

4. 왜 이 기술이 특별한가? (기존 기술과의 차이)

기존에도 비슷한 기술들이 있었지만, BLASST 는 다음과 같은 이유로 실제 상용화하기 훨씬 쉽습니다.

  1. **훈련 불필요 **(Training-Free)
    • 비유: 다른 기술들은 사서에게 "어떤 책이 중요한지"를 가르치기 위해 수개월간 재교육을 시켰습니다. 하지만 BLASST 는 기존에 있던 사서에게 "이런 규칙만 지키면 돼"라고 딱 하나만 알려주면 바로 작동합니다. 모델을 다시 학습시킬 필요가 없습니다.
  2. **미리 계산 불필요 **(No Pre-computation)
    • 비유: 다른 기술들은 책을 읽기 전에 전체 목록을 미리 분석하는 시간이 필요했습니다. BLASST 는 책을 읽는 순간순간에 판단하므로, 미리 준비할 시간이 전혀 들지 않습니다.
  3. 모든 단계 가속화:
    • 비유: 글을 처음 읽을 때 (Prefill) 도, 그다음에 답을 만들어가는 과정 (Decode) 도 모두 속도를 높여줍니다.

5. 실제 효과는?

연구팀은 최신 GPU(Blackwell, Hopper) 에서 이 기술을 테스트했습니다.

  • 속도: 글을 읽는 속도가 1.5 배 빨라졌습니다.
  • 정확도: 중요한 정보는 놓치지 않고, 정확도는 거의 떨어지지 않았습니다. (오히려 불필요한 잡음을 제거해서 더 잘 대답하는 경우도 있었습니다.)
  • 적용: 현재 NVIDIA 의 TensorRT-LLM 과 같은 실제 프레임워크에 이미 적용되어 사용 가능합니다.

6. 결론: "지혜로운 생략의 미학"

BLASST 는 **"모든 것을 다 계산하는 것이 능사가 아니다"**라는 철학을 보여줍니다.

마치 스마트한 비서가 매일 쌓이는 수천 개의 이메일을 다 읽지 않고, 제목만 보고 "이건 중요하지 않으니 삭제"라고 처리하는 것처럼, BLASST 는 AI 가 긴 문맥을 처리할 때 불필요한 계산이라는 '잡음'을 제거하여, 중요한 정보에 집중하게 만들어줍니다.

이 기술 덕분에 앞으로 우리는 책 한 권 전체를 분석하거나, 수시간 분량의 회의록을 요약하는 AI 를 훨씬 빠르고 저렴하게 사용할 수 있게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →