← 최신 논문
🤖 machine learning

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

SparseForge 는 헤시안 기반 중요도 추정과 점진적 소프트 마스크 어닐링을 결합하여 반구조화 LLM 희소화의 효율성을 향상시키는 사후 학습 프레임워크로, 기존 방법들에 비해 훨씬 적은 재학습 토큰으로 뛰어난 정확도를 달성합니다.

원저자: Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 거의 모든 것을 알고 있는 거대하고 놀라울 정도로 똑똑한 도서관 (대형 언어 모델, 또는 LLM) 을 가지고 있다고 가정해 봅시다. 하지만 이 도서관은 너무 커서 전체 창고를 차지하고, 운영하려면 거대한 사서 팀이 필요합니다. 이 도서관을 일반 사무실 크기로 줄이고 더 빠르게 실행되게 만들고 싶지만, 무작위로 책을 버릴 수는 없습니다. 그렇게 하면 도서관이 더 이상 논리적으로 작동하지 않게 되니까요.

이것이 바로 SparseForge가 해결하는 문제입니다.

문제: "그룹 의사결정"의 딜레마

현대 컴퓨터 칩 (NVIDIA 의 칩 등) 은 2:4 희소성이라는 특정 유형의 "축소"를 처리하는 데 뛰어납니다. 이는 네 명의 친구가 테이블에 앉아 있는 상황에 비유할 수 있습니다: 정확히 두 명은 떠나고, 두 명은 남아야 합니다.

기존 방법들은 각 책을 개별적으로 살펴보고, 어떤 책이 "가장 덜 중요한지" 결정한 다음, 그룹들이 이를 따르도록 강요함으로써 이 문제를 해결하려 했습니다.

  • 결함: 이는 네 명의 친구에게 누가 떠날지 결정하라고 요청하되, 그 결정을 즉시 내리게 하는 것과 같습니다. 충분히 깊이 생각하지 않고 잘못된 두 명을 선택하면 전체 대화가 무너집니다. 깨진 대화를 복구하기 위해 기존 방법들은 도서관을 수천 번 다시 가르쳐야 했습니다 (방대한 양의 데이터를 사용). 이는 느리고 비용이 많이 듭니다.

해결책: "어닐링 (Annealing)" 과정

이 논문의 저자들인 SparseForge는 더 지적인 방법을 제안합니다. 단단하고 즉각적인 결정을 내리는 대신, 이 결정을 금속 가공처럼 취급합니다.

  1. 가열 (소프트 마스크): 도서관의 책들이 부드럽고 성형 가능한 점토로 만들어졌다고 상상해 보세요. "남아라" 또는 "가라"를 즉시 결정하는 대신, 시스템은 각 책에 0 과 1 사이의 "소프트" 점수를 부여합니다. 마치 책들이 약간 찰랑거리는 상태인 것입니다. 시스템은 점토를 부드럽게 밀어내어 책들이 서로 다른 위치를 탐색하도록 허용합니다. 아직 최종 결정을 강제하지는 않습니다.
  2. 헤시안 가이드 (전문 조각가): 어떤 책이 진정으로 중요한지 알기 위해, 시스템은 특별한 "곡률 센서"(헤시안 인식) 를 사용합니다. 단순히 책이 얼마나 무거운지 (크기) 만 보는 대신, 그 특정 책을 제거했을 때 도서관의 이해도가 얼마나 상처를 입는지를 살펴봅니다. 이를 통해 시스템은 네 명으로 이루어진 그룹 중 정확히 두 명의 친구가 유지되어야 가장 핵심적인지 파악할 수 있습니다.
  3. 담금질 (경화): 시스템이 모든 가능성을 탐색하고 완벽한 배열을 찾으면, 점토를 서서히 "냉각"시킵니다. 부드러운 점수를 점차적으로 "남아라 (1)" 또는 "가라 (0)"라는 단단한 결정으로 바꿉니다. 시스템이 먼저 옵션을 탐색했기 때문에, 최종적인 단단한 결정은 훨씬 더 정확합니다.

결과: 더 적은 것으로 더 많은 것 달성

이 논문은 이 방법이 효율성 측면에서 게임 체인저라고 주장합니다:

  • 적은 데이터, 동일한 지능: 도서관이 잘 작동하도록 만들기 위해 SparseForge 는 단지 50 억 개의 단어 (토큰) 만 다시 읽으면 되었습니다.
  • 거인들을 제치다: 이전 최상위 방법은 유사한 결과를 얻기 위해 400 억 개의 단어를 다시 읽어야 했습니다. SparseForge 는 8 배 적은 데이터로 동일한 (또는 약간 더 나은) 지능을 달성했습니다.
  • 더 빠르고 더 작게: 최종 도서관이 "4 명 중 2 명" 규칙을 따르기 때문에 컴퓨터 메모리에 훨씬 잘 들어갑니다 (약 58% 의 공간 사용) 그리고 현대 하드웨어에서 1.4 배 더 빠르게 실행됩니다.

결론

SparseForge는 단순히 조각칼로 동상을 찍어내는 (기존 방법) 장인이 아닙니다. 대신 그들은 돌을 가열하여 완벽한 형태로 정착하게 한 다음, 식혀서 걸작을 드러냅니다. 이를 통해 거대한 AI 모델을 지능을 잃지 않고 관리 가능한 크기로 줄일 수 있으며, 이 과정에서 막대한 시간과 컴퓨팅 자원을 절약할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →