SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
SpenseGPT는 별도의 커스텀 컴파일러 지원 없이도 엄격한 준구조적 희소성(semi-structured sparsity)의 한계를 극복하면서 모델 정확도를 유지하는 동시에, 하이브리드 희소-밀집 가중치 형식을 활용하여 B200 GPU에서 최대 1.2배의 엔드 투 엔드 LLM 디코딩 속도 향상을 달성하는 실용적인 원샷 프루닝 방법을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 컴퓨터가 코드를 작성하고, 수학 문제를 풀고, 지시를 따를 수 있도록 돕는 거대하고 믿을 수 없을 정도로 똑똑한 도서관(거대 언어 모델, 즉 LLM)을 가지고 있다고 상상해 보십시오. 이 도서관을 최신 컴퓨터에서 빠르게 실행하기 위해, 엔지니어들은 도서관을 더 가볍고 빠르게 만들기 위해 불필요한 책들을 제거하는 '가지치기(pruning)'를 시도해 왔습니다.
하지만 여기에는 함정이 있습니다. 새로운 컴퓨터 칩(NVIDIA의 B200과 같은)에서 이 책들을 읽는 가장 빠른 방법은 매우 엄격한 규칙을 요구합니다. 바로 책 4권당 정확히 2권은 비어 있어야 한다는 규칙입니다. 이것을 "2:4 희소성(2:4 sparsity)"이라고 부릅니다.
문제점: 엄격한 규칙
문제는 이 엄격한 규칙이 마치 가방을 쌀 때 반드시 공간의 절반을 비워두어야만 하는 것과 같다는 점입니다. 만약 규칙을 맞추기 위해 단순히 무작위로 책의 절반을 버린다면, 중요한 정보가 손실되어 도서관이 제대로 작동하지 않게 됩니다. 컴퓨터는 빨라지겠지만, 내놓는 답변은 엉뚱하거나 틀리게 됩니다.
다른 연구자들은 이 규칙을 더 유연하게 만드는 방법을 시도했지만, 그들의 해결책은 특정 연료만 사용할 수 있는 특수하고 비싼 엔진을 만드는 것과 같았거나, 혹은 추가적인 작업량(오버헤드)이 너무 많아 속도 향상의 이점이 사라져 버렸습니다.
해결책: Spense (하이브리드 책장)
이 논문의 저자들은 Spense라고 불리는 새로운 방법을 제안합니다. 전체 도서관에 엄격한 "2권은 비우고, 2권은 채운다"는 규칙을 강요하는 대신, 이들은 책장을 두 개의 구역으로 나눕니다.
- 희소 구역 (Sparse Zone): 여기서는 엄격한 규칙을 따릅니다 (4권 중 2권을 제거). 이 구역은 컴퓨터의 특수한 하드웨어로부터 속도 향상을 얻습니다.
- 밀집 구역 (Dense Zone): 여기서는 모든 책을 그대로 유지합니다. 책을 하나도 제거하지 않습니다. 이 구역은 가장 중요한 정보를 보존합니다.
이것은 하이브리드 자동차와 같습니다. "희소 구역"은 전기 모터(매우 효율적인 순항용)이고, "밀집 구역"은 가솔린 엔진(언덕을 오를 때 필요한 강력한 힘)입니다. 이 둘을 결합함으로써, 성능 저하 없이 속도를 높일 수 있습니다.
핵심 비결: 무엇을 남길 것인가
어떤 책을 "밀집 구역"에 넣고 어떤 책을 버릴지 결정하는 것이 까다로운 부분입니다. 저자들은 이 선택이 매우 결정적이라는 것을 발견했습니다. 만약 잘못된 책을 남긴다면, 도서관는 여전히 제대로 작동하지 못할 것입니다.
그들은 이 선택을 위해 두 가지 전략을 개발했습니다:
- SpenseGPT (단순한 전략): 책들이 한 줄로 늘어서 있다고 상상해 보십시오. 이 방법은 "책장의 마지막 25%의 책은 그대로 두고(밀집), 나머지 앞쪽 75%를 가지치기(희소)하자"고 말합니다. 알고 보니, 이 단순한 "끝부분 절단" 방식은 가지치기 수학 계산 방식 덕분에 놀라울 정도로 잘 작동했습니다.
- SpenseGPT+ (스마트한 전략): 이것은 마치 모든 책을 읽어보고 어떤 책이 가장 중요한지 판단하는 사서와 같습니다. 이 방법은 각 책이 최종 답변에 얼마나 기여하는지를 바탕으로 '점수'를 계산합니다. 그리고 가장 높은 점수를 받은 책들을 밀집 구역에 남겨둠으로써, 가장 결정적인 지식이 절대 손실되지 않도록 보장합니다.
결과: 빠르고 정확함
연구팀은 이 방법을 두 개의 매우 크고 똑똑한 모델(Qwen3-32B 및 Seed-OSS-36B)에 적용하여 최신 초고속 컴퓨터 칩(B200 GPU)으로 테스트했습니다.
- 속도: 실제 사용 환경에서 1.2배의 속도 향상을 달ей했습니다. 이는 컴퓨터가 이전보다 눈에 띄게 빠르게 답변을 생성할 수 있음을 의미합니다.
- 정확도: 모델을 "멍청하게" 만드는 다른 방법들과 달리, Spense는 모델을 똑똑하게 유지했습니다. 수학적 추론, 코딩, 지시 이행과 같은 어려운 과제에서 원래의 가지치기를 하지 않은 모델만큼이나 뛰어난 성능을 보여주었습니다.
- 실용성: 결정적으로, 이 방법은 새로운 커스텀 컴퓨터 소프트웨어(컴파일러)를 구축할 필요가 없습니다. 이 칩들에 이미 존재하는 표준화되고 고도로 최적화된 도구들을 그대로 사용할 수 있습니다.
요약
요약하자면, 이 논문은 AI 모델을 덜 똑똑하게 만들지 않으면서도 더 빠르게 만드는 방법을 소개합니다. 모델 전체를 "절반을 비우도록" 강요하는 대신(이는 모델을 망가뜨립니다), 이들은 하이브리드 시스템을 만들었습니다. 모델의 일부는 속도를 위해 축소하고, 가장 중요한 부분은 정확도를 위해 온전하게 유지하는 방식입니다. 이를 통해 현대의 컴퓨터들이 이미 사용 가능한 도구들을 사용하여 거대한 AI 뇌를 그 어느 때보다 빠르게 실행할 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.