← 최신 논문
💬 NLP

SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

SigmaScale는 활성화 인지형 SVD를 통해 가중치 행렬의 유효 내재적 랭크를 줄이기 위해 학습된 대각 스케일링 행렬을 최적화함으로써 Llama 3.1 및 Qwen3와 같은 모델에서 최첨단 기술들과 경쟁력 있는 성능을 달성하는 새로운 LLM 압축 방법입니다.

원저자: Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: 거대 모델은 너무 무겁습니다

Llama 3.1이나 Qwen3와 같은 거대 언어 모델(LLM)을 매우 상세하고 방대한 정보를 담고 있는 거대한 도서관이라고 상상해 보세요. 이 도서관에는 인공지능이 똑똑하게 질문에 답할 수 있게 해주는 수십억 개의 책(파라미터)이 들어 있습니다. 하지만 이 도서관은 너무 거대하기 때문에 들고 다니기 무겁고, 실행하는 데 비용이 많이 들며, 단 한 문장을 읽는 데도 강력하고 에너지를 많이 소비하는 컴퓨터가 필요합니다.

과학자들은 이 '똑똑한 부분'을 잃지 않으면서, 이 도서관을 더 작은 기기에 들어갈 수 있도록 줄이고 싶어 합니다. 이것을 **압축(Compression)**이라고 부릅니다.

기존 방식: "눈 가린 편집자"

이러한 모델을 줄이는 인기 있는 방법 중 하나는 **SVD (Singular Value Decomposition)**입니다. 모델의 뇌를 거대한 숫자 스프레드시트라고 생각해 보세요.

  • 비유: 당신에게 100페이지짜리 문서가 있는데, 공간이 부족해서 10페이지만 남겨야 한다고 가정해 봅시다. 기존의 SVD 방식은 눈 가린 편집자처럼 행동합니다. 편집자는 문서를 보고 이렇게 말합니다. "좋아, 잉크가 가장 많이 묻어 있는 앞쪽 10페이지만 남기고 나머지는 버릴게."
  • 결함: 때때로 가장 중요한 정보는 잉크가 가장 많이 묻은 페이지에 있지 않을 수도 있습니다. 정보는 여백에 숨겨져 있거나 아주 작은 글씨로 적혀 있을 수도 있죠. 데이터를 무작정 끝부분에서 잘라내 버리면, 모델은 미세한 차이를 이해하는 능력을 잃게 되고 실수를 하기 시작합니다.

새로운 솔루션: SigmaScale (스마트한 축소 전문가)

이 논문의 저자들은 SigmaScale라는 새로운 방법을 제안합니다. 단순히 하위 90%의 데이터를 무작정 잘라내는 대신, SigmaScale은 돋보기와 형광펜을 든 스마트한 편집자처럼 행동합니다.

작동 방식은 다음과 같습니다.

1. "늘리고 줄이기" 기술 (The "Stretch and Shrink" Trick)

편집자가 페이지를 자르기 전에, SigmaScale은 문서에 특별한 "늘리고 줄이기" 필터를 적용합니다.

  • 비유: 문서가 고무로 만들어졌다고 상상해 보세요. SigmaScale은 중요한 부분은 늘리고(더 크게 만들어서 보기 쉽게 함), 중요하지 않은 부분은 줄입니다(더 작게 만듦).
  • 작동 원리: 이는 단순히 어디를 자를지 추측하는 것이 아니라, 데이터의 행과 열을 측정하는 자 역할을 하는 두 세트의 숫자(벡터)를 학습합니다. SigmaScale은 단순히 자르는 위치를 짐작하는 것이 아니라, 가장 중요한 정보가 목록의 상단으로 이동하도록 데이터를 어떻게 늘릴지 정확하게 학습합니다.

2. "활성화 인식" 손실 (The "Activation-Aware" Loss)

이 논문은 이 방법이 "활성화 인식(activation-aware)"이라고 언급합니다.

  • 비유: 일반적인 편집자는 종이 자체만 봅니다. 하지만 SigmaScale은 종이가 실제로 어떻게 사용되는지를 봅니다. "사람이 이 글을 읽을 때, 이야기를 이해하기 위해 실제로 어떤 단어들이 필요한가?"라고 묻는 것입니다. SigmaScale은 단순히 종이 위의 숫자가 어떻게 보이는가가 아니라, 모델이 실제로 정보를 처리하는 방식에 기반하여 늘리기(stretching)를 최적화합니다.

3. 결과: 더 작고 똑똑한 도서관

중요한 부분을 늘린 후, 편집자(SVD)는 하단을 잘라냅니다. SigmaScale이 중요한 부분을 먼저 늘려 놓았기 때문에, "컷(cut)"은 가치가 낮은 정보가 저장된 지점에서 일어나게 됩니다.

  • 결과: 이렇게 만들어진 "축소된" 모델은 훨씬 작지만, 기존 방식보다 "고유 랭크(intrinsic rank, 핵심 지능)"를 훨씬 더 잘 유지합니다.

실험 결과

연구진은 이를 **Llama 3.1 (8B)**과 Qwen3-8B에 테스트했습니다. 그들은 SigmaScale을 다른 최고 수준의 방법들(SVD-LLM 및 ASVD+)과 비교했습니다.

  • 완만한 압축 (크기를 90% 유지할 때): SigmaScale이 명확한 승자였습니다. SigmaScale은 다른 방법들보다 모델의 "퍼플렉시티(perplexity, 모델이 얼마나 혼란스러워하는지를 나타내는 척도)"를 훨씬 낮게 유지했습니다. 이는 도서관의 90%를 유지하면서도 지능은 95%를 유지한 것과 같습니다.
  • 중간 정도의 압축 (크기를 75% 유지할 때): SigmaScale은 여전히 매우 우수한 성능을 보였으며, 특정 논리 및 추론 테스트에서 경쟁 모델들을 앞서는 모습을 보였습니다.
  • 극한의 압축 (크기를 50%로 줄일 때): 이 단계에서 SigmaScale은 다른 방법들과 마찬가지로 어려움을 겪었습니다. 논문은 도서관을 절반 크기로 줄인다면, 아무리 스마트한 편집자라도 모델이 정신을 잃는 것을 막을 수 없다는 점을 인정합니다. 즉, 이 방법은 극한의 축소를 위한 마법 같은 해결책은 아닙니다.

"미세 조정(Fine-Tuning)" 단계

모델을 축소한 후에는 약간 흔들거릴 수 있습니다. 연구진은 이를 다시 안정시키기 위해 두 가지 방법을 테스트했습니다.

  1. 지도 미세 조정 (Supervised Fine-Tuning): 축소된 모델에게 새로운 예시들을 가르치는 방식입니다.
  2. 지식 증류 (Knowledge Distillation, KD): 거대한, 축소되지 않은 "스승(Teacher)" 모델이 작은 "학생(Student)" 모델을 안내하도록 하는 방식입니다.

발견된 사실: 놀랍게도 이 특정 방법의 경우, "스승(KD)"이 학생을 직접 가르치는 것보다 더 큰 도움을 주지는 못했습니다. 두 방법 모두 거의 비슷하게 작동했습니다.

요약

SigmaScale은 AI 모델을 더 똑똑하게 축소하는 새로운 기술입니다. 단순히 데이터의 하단을 잘라내는 것이 아니라, 가장 중요한 부분이 보존되도록 데이터를 재배치하는 법을 먼저 학습합니다.

  • 가장 적합한 경우: 공간을 절약해야 하지만 지능을 너무 많이 잃고 싶지 않은 상황 (완만한 ~ 중간 정도의 압축).
  • 적합하지 않은 경우: 모델을 아주 작은 크기로 줄이려는 극한의 압축 상황 (이 경우 방법론이 무너집니다).
  • 핵-결론: SigmaScale은 일률적인 공식이 아니라, 모델의 뇌 구조에 맞춰 적응하는 유연하고 학습 가능한 접근 방식입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →