← 최신 논문
🤖 machine learning

LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

이 논문은 고차원 공간에서의 거리 집중 현상을 활용하여 후보군을 동적으로 분할하고 메모리 오버헤드를 최소화함으로써, 정확한 Top-k 정밀도를 유지하면서 대규모 언어 모델의 희소 어텐션 연산을 가속화하는 새로운 융합형 Indexer-TopK 커널인 LiteTopK를 제시한다.

원저자: Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

게시일 2026-07-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

백만 명의 인파 속에서 가장 흥미로운 친구 2,048명을 찾는다고 상상해 보세요. 거대 AI 두뇌(대규모 언어 모델, LLM)의 세계에서, 이것은 바로 모델이 방대한 문서를 한꺼번에 읽으려고 할 때 일어나는 일입니다. 모델은 텍스트의 어느 부분에 집중하는 것이 가장 중요한지 파악해야 합니다.

DeepSeek와 같은 시스템에서 사용되는 기존 방식은, 군중 속의 모든 사람에게 각자의 "우정 점수"를 크게 외치라고 요청하고, 그 모든 숫자를 거대한 화이트보드에 적어둔 다음, 상위 2,048명을 찾기 위해 경주를 하는 것과 같습니다. 문제는 이 화이트보드가 너무 커져서 컴퓨터의 메모리를 망가뜨린다는 것이며, 소리 지르는 과정도 시간이 너무 오래 걸립니다. 논문에서는 이를 "Indexer-TopK" 문제라고 부르며, 이는 AI를 느리게 만드는 주요 병목 현상입니다.

마법 같은 기술: "차원의 저주"
Ziqi Yin과 그 팀은 고차원 수학(많은 숫자를 가진 복잡한 데이터를 의미함)에서 나타나는 이상한 현상을 발견했습니다. 그들은 이러한 거대한 공간에서 대부분의 점수가 매우 좁은 범위 안에 뭉쳐 있다는 것을 발견했습니다. 마치 군중 속의 사람들이 모두 같은 작은 원 안에 모여 있는 것 같고, 오직 소수의 예외적인 값들만이 멀리 떨어져 있는 것과 같습니다.

그들은 이를 "차원의 저주"라고 부르지만, 이를 초능력으로 바꾸기로 했습니다. 모든 사람이 소리 지르는 것을 기다리는 대신, 그들은 소리 지르기가 시작되기도 전에 "좋은" 점수가 어디에 있을지 예측할 수 있다는 사실을 깨달았습니다.

LiteTopK의 등장: 스마트한 필터
팀은 LiteTopK라는 새로운 도구를 만들었습니다. 이것은 클럽의 입구에서 모든 사람의 신분증을 하나하나 확인하지 않는 보안 요원과 같습니다. 대신, 보안 요원은 다음과 같이 행동합니다:

  1. 샘플링(Sampling): 먼저, 이전 군중으로부터 아주 작은 그룹을 살짝 봅니다. 이야기 속의 사람들은 보통 비슷한 주제에 대해 이야기하므로, 지난 조각에서의 "흥미로운" 사람들은 이번에도 흥미로울 가능성이 높습니다.
  2. 선 긋기: 그 엿보기를 바탕으로, 그들은 모래 위에 선을 하나 긋습니다. 그들은 상위 점수들이 이 선 위에 있을 것임을 알고 있습니다.
  3. 군중을 빈(Bin)에 담기: 그들은 가능한 점수들을 작은 상자(빈)들로 나눕니다.
  4. 실시간 필터링: 점수가 계산됨에 따라, 시스템은 해당 점수가 어떤 상자에 속하는지 확인합니다. 만약 점수가 선 아래의 상자에 떨어진다면, 즉시 무시됩니다. 그 점수는 거대한 화이트보드에 기록조차 되지 않습니다.
  5. 최종 집계: "좋은" 상자에 들어간 사람들만이 최종 선택 단계에 도달합니다.

왜 이것이 중요한가 (숫자로 보는 성과)
저자들은 실제 하드웨어인 8개의 거대한 NVIDIA B200 GPU와 GLM-5.2 모델(컨텍스트 100만 토큰)을 사용하여 이를 측정했습니다.

  • 기존 방식: 이 과정을 처리하기 위해 기존 시스템(DSA)은 점수를 기록하는 데 무려 32GB의 추가 메모리 공간을 필요로 했습니다. 그럼에도 불구하고, 수학적 계산을 수행하는 데만 146.6밀리초가 걸렸습니다.
  • 새로운 방식: LiteTopK는 대부분의 데이터를 쓰는 과정을 건너뛰었습니다. 이 시스템은 단 1.5GB의 추가 메모리만을 사용했으며(엄청난 절감!), 작업을 단 43.4밀리초 만에 끝냈습니다.

이는 순수 수학 연산에서 3.38배의 속도 향상을 의미합니다. 전체 시스템을 엔드 투 엔드(end-to-end)로 테스트했을 때, LiteTopK는 메모리를 적게 사용하면서도 AI를 1.2배 더 빠르게 만들었습니다.

이것이 "아닌" 것
논문은 이 기술이 무엇을 하지 않는지를 매우 명확히 밝히고 있습니다. 이 기술은 AI를 더 "똑똑하게" 만들거나 정확도를 높이기 위해 수학을 바꾸는 것이 아니라, 단지 똑같은 답을 훨씬 더 빠르게 찾아낼 뿐입니다. 또한, 다른 방법들이 더 나을 수 있는 아주 작은 그룹(예: 단 10개의 아이템만 찾는 경우)에는 잘 작동하지 않습니다. 저자들은 자신들의 방법이 점수가 "집중(concentrated)"되어 있다는 점에 의존하며, 이는 이 특정 유형의 AI 어텐션에는 해당되지만 모든 곳에 적용되지는 않을 수 있다고 명시했습니다.

결론
저자들은 실제 GPU에서 이 기술을 측정했으며, 대부분의 점수가 지루할 정도로 비슷하다는 점을 이용함으로써, 그 지루한 것들을 기록되기도 전에 버릴 수 있다는 것을 증명했습니다. 이는 백만 명의 방 안에서, 단순히 서 있는 99만 9,000명의 이름을 적을 필요 없이, 실제로 무언가 흥미로운 일을 하고 있는 2,048명의 이름만 적으면 된다는 사실을 깨닫는 것과 같습니다.

이것은 단순한 이론이 아닙니다. 팀은 이미 이를 구축했으며, AI 모델이 메모리 부족이나 시간 지연 없이 더 긴 책을 읽을 수 있도록 도울 준비가 되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →