← 최신 논문
💬 NLP

Sparser Block-Sparse Attention via Token Permutation

본 논문은 긴 컨텍스트 LLM 에서 블록 수준의 희소성을 최적화하기 위해 토큰 순열을 활용하여 풀링 시 최대 2.75 배의 속도 향상을 달성하면서도 완전 어텐션과 비교 가능한 정확도를 유지하는 플러그 앤 플레이 방식인 Permuted Block-Sparse Attention(PBS-Attn) 을 소개합니다.

원저자: Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

10 만 페이지에 달하는 방대한 소설을 한 가지 질문에 대한 답을 찾기 위해 읽어야 한다고 상상해 보세요. 표준 대형 언어 모델 (LLM) 에서 컴퓨터는 매우 꼼꼼하지만 느린 사서와 같습니다. 답을 찾기 위해 이 사서는 단 한 페이지도 빠짐없이 모든 페이지를 살펴보고, 페이지들이 서로 관련이 있는지 확인하기 위해 각 페이지를 다른 모든 페이지와 비교해야 합니다. 책이 길어지면 사서가 해야 할 일의 양은 조금씩 늘어나는 것이 아니라 폭발적으로 증가합니다. 이것이 바로 컴퓨터가 긴 문서를 읽는 데 매우 느리고 비용이 많이 드는 이유입니다.

속도를 높이기 위해 연구자들은 '블록 희소 (block-sparse)' 접근법을 시도했습니다. 모든 페이지를 읽는 대신 책을 장 (블록) 으로 나누고 중요하다고 생각되는 장만 읽는 것입니다. 나머지는 건너뜁니다.

문제점:
이 논문은 '장을 건너뛰는' 방법에는 결함이 있다고 주장합니다. 미스터리 소설에서 가장 중요한 단서들이 책 전체에 무작위로 흩어져 있다고 상상해 보세요. 제 1 장에 하나의 단서, 제 50 장에 또 다른 단서, 제 99 장에 다른 단서가 있는 식입니다. 어떤 장에 단서가 있는지 알고 있더라도, 단서들이 너무 널리 퍼져 있기 때문에 거의 모든 장을 열어봐야 단서들을 찾을 수 있습니다. 결국 몇 조각의 흩어진 정보를 찾기 위해 많은 작업을 하게 되는 것입니다. 논문은 이를 '정보 분산 (information fragmentation)'이라고 부릅니다.

해결책: '토큰 순열 (Token Permutation)' 트릭
저자들은 **순환 블록 희소 어텐션 (Permuted Block-Sparse Attention, PBS-Attn)**이라는 새로운 방법을 제안합니다.

책을 고정된 이야기로 보지 않고 카드 덱으로 생각하세요.

  1. 기존 방식: 덱의 모든 카드를 순서대로 확인하며 '스페이드 에이스 (가장 중요한 정보)'를 찾으려 합니다.
  2. PBS-Attn 방식: 검색을 시작하기 전에 덱을 빠르게 섞습니다. 하지만 무작위로 섞는 것이 아니라, 모든 에이스와 킹 (가장 중요한 카드들) 을 맨 위의 깔끔한 더미로 묶이도록 섞습니다.

이제 중요한 정보를 찾으러 갈 때, 99 개의 장을 열 필요가 없습니다. 중요한 단서들이 모두 모여 있는 처음 몇 장만 열면 됩니다. 책의 나머지는 완전히 건너뛸 수 있습니다.

구현 방법 ('세그먼트화'된 마법)
주의할 점이 있습니다. 이야기를 무작위로 섞으면 줄거리가 무너집니다 (끝이 시작보다 앞서서는 안 됩니다). 이를 '인과성 (causality)'이라고 합니다.

이를 해결하기 위해 저자들은 '세그먼트 순열 (Segmented Permutation)' 전략을 사용합니다.

  • 책을 작고 관리하기 쉬운 섹션 (세그먼트) 으로 나눕니다.
  • 각 섹션 내부에서는 중요한 페이지들이 그룹화되도록 페이지를 섞습니다.
  • 섹션들은 원래 순서대로 유지합니다.

이렇게 하면 이야기는 1 섹션에서 2 섹션으로 논리적으로 이어지지만, 각 섹션 내부에서는 컴퓨터가 지루한 페이지들을 무시하고 그룹화되어 있는 '중요한 토큰 (heavy hitters)'에만 집중할 수 있습니다.

결과
논문에 따르면 이 간단한 재배열 트릭은 놀라운 효과를 냅니다.

  • 속도: 현재 가장 좋은 방법보다 긴 문서를 읽는 속도를 최대 2.75 배까지 높입니다.
  • 정확도: 모델을 '바보'로 만들지 않습니다. 답은 컴퓨터가 아무것도 건너뛰지 않고 책 전체를 읽었을 때와 똑같이 좋습니다.
  • 효율성: 필요한 컴퓨터 메모리 양을 줄여 이러한 모델을 실행하는 비용을 절감합니다.

요약
이 논문은 새로운 유형의 컴퓨터나 언어를 이해하는 새로운 방식을 발명하지 않았습니다. 대신 컴퓨터가 작업을 시작하기 전에 데이터를 조직화하는 더 나은 방법을 고안했습니다. 중요한 정보를 깔끔하고 밀집된 클러스터로 섞어 배치함으로써, 컴퓨터는 아무것도 놓치지 않은 채 작업의 거대한 부분을 건너뛸 수 있게 되어 긴 대화와 문서 분석이 훨씬 빠르고 저렴해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →