← 최신 논문
🤖 machine learning

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

본 논문은 현대적 GPU에서 중등도 수준의 비구조적 희소 LLM 추론을 가능하게 하기 위해 희소 코어와 CUDA 코어를 공동으로 활용하는 새로운 3계층 행렬 저장 형식과 하이브리드 SpMM 커널을 제안하며, 이를 통해 밀집 행렬 곱셈 대비 첫 번째 커널 수준의 속도 향상을 달축하고 SpInfer 및 FlashLLM과 같은 최신 기술들을 능가하는 성능을 달성한다.

원저자: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

게시일 2026-07-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 글을 쓰고, 질문에 답하고, 코드를 짤 수 있는 거대한 도서관(거대 언어 모델, LLM)이 있다고 상상해 보세요. 이 책들을 작동시키려면 초고속 로봇(GPU)이 다음 단어를 알아내기 위해 수백만 페이지의 숫자(가중치)를 빠르게 읽어야 합니다. 문제는 무엇일까요? 로봇이 너무 열심히 읽다 보니 지치기도 하고, 운영 비용도 많이 든다는 점입니다.

과학자들은 영리한 묘책을 냈습니다. 도서관을 더 가볍게 만들기 위해 지루하고 중요하지 않은 페이지들을 버린 것입니다. 이것을 "프루닝(pruning, 가지치기)"이라고 부릅니다. 하지만 여기에는 함정이 있습니다. 페이지를 너무 많이 버리면 이야기가 이상해지고 말이 안 될 수 있습니다. 적절한 균형점은 전체 페이지의 약 절반(50% 희소성)을 유지하는 것입니다.

거대한 문제
가벼운 도서관이 읽기에 더 빠를 것이라고 생각하기 쉽지만, 꼭 그렇지는 않습니다. 로봇의 독서 기계(GPU)는 빽빽하고 꽉 찬 페이지를 매우 빠르게 읽도록 설계되어 있기 때문입니다. 페이지들이 흩어져 있거나 조각조각 비어 있으면(비구조적 희소성), 로봇은 혼란에 빠집니다. 흩어진 페이지들을 찾고 조각들을 정리하는 데 너무 많은 시간을 소비하다 보니, 오히려 무겁고 꽉 찬 도서관을 읽을 때보다 더 느려지게 됩니다. 기존의 이러한 "흩어진" 읽기 도구들은 너무 느리거나, 속도 이득을 상쇄할 만큼 로봇에게 추가적인 수학 연산을 요구했습니다.

새로운 솔루션: 3단계 파일링 시스템
저자들은 로봇이 이 흩어진 페이지들을 효율적으로 읽을 수 있도록 새로운 파일링 시스템을 구축했습니다. 그들은 이를 "3단계(three-layer)" 형식이라 부르며, 이는 마치 매우 체계적인 사서처럼 작동합니다:

  1. "Sparse-TC" 레이어 (VIP 구역): 사서는 먼저 정해진 규칙(예: 4번째 페이지마다 2개의 중요한 메모가 있음)에 딱 들어맞는 페이지들을 먼저 챙깁니다. 이 페이지들은 로봇의 가장 빠른 전용 독서 팔(Sparse Tensor Cores)로 바로 전달됩니다. 따로 찾을 필요가 없습니다!
  2. "슬롯 채우기(Slot-Filling)" 레이어 (퍼즐 조각): VIP 패턴에 맞지 않는 나머지 추가 메모들은 어떻게 될까요? 사서는 이들을 그냥 버리거나 지저도한 목록으로 만드는 대신, VIP 페이지들이 남긴 빈 공간에 밀어 넣습니다. 이 위치를 방대한 주소록 없이 추적하기 위해, 그들은 "병렬 차분 거리(Parallel Differential Distance)" 코드를 사용합니다. 이것은 마치 전체 주소를 매번 쓰는 대신 "다음 단서는 오른쪽으로 3걸음 이동"이라고 적힌 보물 지도와 같습니다. 덕분에 공간을 크게 절약할 수 있고 빠르게 해독할 수 있습니다.
  3. "잔여(Residual)" 레이어 (잡동사니 서랍): 어디에도 끼워 넣기 너무 까다로운 아주 극소수의 메모들(1% 미만)이 있습니다. 이들은 표준적인 구식 파일링 방식(CSR 형식)으로 들어갑니다. 양이 워낙 적기 때문에 로봇은 이 서랍을 확인하는 것을 개의치 않습니다.

슈퍼 파이프라인
진정한 마법은 단순히 파일링 시스템에 있는 것이 아니라, 로봇이 읽는 방식에 있습니다. 저자들은 로봇이 세 가지 일을 동시에 수행하는 워크플로우를 설계했습니다:

  • 로봇은 거대한 메모리 선반(Global Memory)에서 다음 페이지 뭉치를 가져옵니다.
  • "오른쪽으로 3걸음"이라는 보물 지도 단서를 해독합니다(표준 코어 사용).
  • VIP 페이지들을 위한 숫자를 계산합니다(빠른 전용 코어 사용).

이러한 작업들을 겹쳐서 수행함으로써(overlapping), 로봇은 데이터를 기다리느라 가만히 서 있는 시간이 없습니다. 이는 마치 요리사가 재료를 다듬으면서 동시에 냄비를 젓고 식탁까지 차리는 것과 같습니다. 한 번에 한 가지 일만 하는 것이 아니라 말이죠.

결과: 이전보다 빨라진 속도
현대적인 고속 로봇(80GB 메모리를 갖춘 NVIDIA H100 GPU)에서 테스트했을 때, 결과는 인상적이었습니다.

  • 속도: 이 방식은 커널 수준에서 이전의 최고 도구인 SpInfer보다 최대 1.64배 더 빠르게 실행되어, 실제로 무거운 전체 도서관을 읽는 속도를 앞지른 첫 번째 사례가 되었습니다.
  • 엔드 투 엔드(End-to-End): 텍스트를 생성하는 전체 과정에서는 FlashLLM보다 최대 1.41배 더 빨랐습니다.
  • 메모리: 또한 전체 도서관을 읽을 때보다 메모리 공간을 약 21.4% 절약했습니다.

한계점
저자들은 이 기술이 완벽하지 않은 부분에 대해서도 명확히 밝히고 있습니다. 도서관이 거의 비어 있는 상태(90% 이상의 높은 희소성)에서는 이 방법이 최선이 아닙니다. 그런 경우에는 기존 방식이 여전히 더 낫습니다. 또한, 이 방식은 "디코딩(decode)" 단계(로봇이 한 번에 한 단어씩 써 내려가는 단계)에 최적화되어 있습니다. 로봇이 한꺼번에 거대한 텍스트 블록을 읽어야 하는 "프리필(prefill)" 단계에서는 이 새로운 방법이 표준적인 무거운 읽기 도구보다 약간 느릴 수 있는데, 이는 현재 해결하려는 특정 시나리오가 아닙니다.

요약하자면, 흩어진 페이지들을 스마트한 3단계 시스템으로 정리하고 로봇을 끊임없이 움직이게 함으로써, 저자들은 AI 챗봇을 더 똑똑하게 만들지 않으면서도 더 빠르고 저렴하게 운영할 수 있게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →