← 최신 논문
🤖 machine learning

KronQ: LLM Quantization via Kronecker-Factored Hessian

KronQ는 크로네커 인수 분해 헤시안 근사(Kronecker-factored Hessian approximation)를 통해 양자화 목적 함수에 그래디언트 공분산을 통합함으로써 대규모 언어 모델 압축을 개선하고, 양방향 비상관성 처리와 향상된 민감도 지표를 가능하게 하여 특히 극단적인 저비트 시나리오에서 GPTQ와 같은 기존 방식보다 우수한 퍼플렉시티를 달성하는 사후 학습 양자화 프레임워크이다.

원저자: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 믿을 수 없을 정도로 똑똑한 로봇 뇌(거대 언어 모델, LLM)를 상상해 보세요. 이 뇌는 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있습니다. 문제는 너무 거대해서 선반에 올려두려면 컴퓨터가 가득 찬 창고가 필요하다는 점입니다. 이를 일반 노트북이나 스마트폰에서 실행할 수 있도록 과학자들은 이 뇌를 '압축'하여 메모리를 줄이려고 노력하는데, 이 과정을 **양자화(quantization)**라고 합니다. 이것은 마치 여행 가방을 싸는 것과 같습니다. 중요한 것을 잃어버리지 않으면서 모든 옷(모델의 지식)을 작은 가방에 담고 싶어 하는 것과 같죠.

한동안 이 가방을 싸는 가장 좋은 방법은 GPTQ라고 불리는 방식이었습니다. 이 방식은 로봇의 '입력'(읽는 단어들)이 어떻게 변하는지를 살펴보고 그에 따라 가중치를 조정했습니다. 하지만 이 새로운 논문의 저자들은 KronQ를 통해 이 전략에 결함이 있음을 발견했습니다. 그들은 GPTQ가 방정식의 입력 측면만을 보고, 가능한 모든 출력(로봇이 다음에 말할 단어들)은 모두 동일하게 중요하다고 가정했다는 사실을 깨달았습니다.

큰 실수: "출력" 측면을 무시함
논문은 이 가정이 옷의 무게만 보고 가방을 싸면서, 그 옷이 얼마나 깨지기 쉬운지는 무시하는 것과 같다고 주장합니다. 실제로 어떤 부분은 매우 민감합니다. 그것들을 너무 짓눌러 버리면 전체가 무너질 수 있습니다.

저자들은 이를 측정했고 놀라운 사실을 발견했습니다. LLaMA-3-70B와 같은 거대 모델에서 "출력" 채널(로봇이 답변을 생성하는 경로)의 중요도는 극단적으로 다양했습니다. 어떤 채널은 섬세한 유리 같았고, 다른 채널은 튼튼한 벽돌 같았습니다. 기존 방식들은 이들을 모두 똑같이 취급했고, 이로 인해 압축을 너무 많이 하면 로봇이 이상하게 작동하게 만들었습니다. 실제로 LLaMA-3-70B를 단 2비트(매우 적은 양의 메모리)로 줄이려고 시도했을 때, 기존 방식들은 완전히 실패하여 2000이 넘는 "퍼플렉시티(perplexity, 모델이 혼란을 느끼는 정도)"를 기록했습니다. 이는 로봇이 영어를 말하는 법 자체를 잊어버린 것과 같습니다.

새로운 해결책: KronQ
KronQ가 등장했습니다. 저자들은 입력과 출력을 모두 고려하여 가방을 싸는 새로운 방법을 제안합니다. 이들은 **크로네커 인수 팩터 헤시안 근사(Kronecker-factored Hessian approximation)**라는 수학적 트릭을 사용합니다.

여기서 비유를 들어보겠습니다. 로봇의 뇌가 거대한 드럼이라고 상상해 보세요.

  • 기존 방식 (GPTQ): 드럼의 앞면을 두드리고, 앞면이 어떻게 진동하는지에 따라 장력을 조절합니다. 당신은 뒷면이 앞면의 거울 이미지와 같다고 가정합니다.
  • KronQ: 드럼의 앞면과 뒷면을 모두 두드립니다. 당신은 뒷면이 다르게 진동한다는 것을 깨닫습니다! 뒷면의 어떤 부분은 느슨하고 흔들거리며, 어떤 부분은 팽팽합니다. KronQ는 이 "뒷면의 진동"(그래디언트 공분산)을 측정하고 이를 사용하여 훨씬 더 세심하게 가방을 쌉니다.

두 가지 초능력: KronQ
논문은 KronQ가 두 가지 영리한 일을 수행함을 보여줍니다.

  1. 양방향 무상관성 (The "Shuffle"):
    짐을 싸기 전에, KronQ는 가중치를 두 방향(입력 및 출력)으로 섞어서 특정 지점에 무겁거나 깨지기 쉬운 물건이 과하게 몰리지 않도록 합니다. 이것은 엉망으로 쌓인 책 더미를 골고루 펼쳐서 가방의 한 부분이 불룩하게 튀어나오지 않게 만드는 것과 같습니다. 논문은 이 과정이 가중치의 "변동성"을 줄여주어, 망가지지 않고 훨씬 더 쉽게 압축할 수 있게 만든다는 것을 보여줍니다.

  2. 스마트 비트 할당 (The "VIP Pass"):
    로봇의 모든 부분에 동일한 공간이 필요한 것은 아닙니다. KronQ는 뇌의 각 하위 계층(sub-layer)에 대한 "민감도 점수"를 계산합니다. 가장 민감한 "VIP" 계층에는 더 많은 비트(더 많은 메모리 공간)를 주고, 덜 중요한 계층에는 더 적은 비트를 줍니다. 결정적으로, KronQ는 출력 측면을 바라보기 때문에, 입력 측면에서는 동일해 보이지만 실제로는 매우 다르게 작동하는 계층들을 구분해 낼 수 있습니다.

결과: 위기 구출
저자들은 70억 개에서 700억 개의 파라미터를 가진 여러 모델을 테스트했습니다. 결과는 극적이었으며, 특히 모델을 극한의 한계인 2비트로 줄였을 때 더욱 그러했습니다.

  • 실패: 거대한 LLaMA-3-70B 모델에서 기존 방식(GPTQ 및 GPTAQ)은 발산하거나 엉터리 결과를 내놓았습니다(퍼플렉시티 > 2000).
  • 성공: KronQ는 동일한 700억 파라미터 모델을 2비트로 압축하면서도 완벽하게 작동하도록 유지했으며, WikiText-2 데이터셋에서 7.93이라는 퍼플렉시티를 달성했습니다. 이는 "고장 난 로봇"과 "똑똑한 로봇" 사이의 엄청난 차이입니다.

4비트 및 3비트 설정에서도 KronQ는 일관되적으로 경쟁 모델을 앞섰으며, PiQA 및 Arc-Challenge와 같은 추론 테스트에서 더 낮은 혼란도와 더 높은 정확도를 보여주었습니다. 예를 들어, LLaMA-2-7B를 2비트로 설정했을 때, KronQ는 8.15의 퍼플렉시티를 기록한 반면, GPTQ는 31.11로 고전했습니다.

비용
부작별이 있을까요? 논문은 이 "출력 진동" 데이터를 얻기 위해 KronQ가 짐을 싸기 전 모델을 한 번 더 역전파(backward pass)해야 한다는 점을 인정합니다. 이 과정은 설정 단계에서 약간의 시간과 메모리를 더 소모합니다(GPTAQ보다 레이어당 약 8~11초 더 소요됨). 하지만 일단 모델이 압축되고 나면, 실제 실행 속도와 메모리 사용량은 기존 방식만큼 효율적입니다. 이 추가 작업은 모델을 망가뜨리지 않고 훨씬 더 많이 축소할 수 있게 해주는 일회성 설정 비용입니다.

그들이 배제한 것
논문은 수학의 출력 측면을 무시해도 된다는 생각에 대해 명시적으로 반박합니다. 그들은 모든 출력 방향이 동일하다고 가정하는 것(그래디언트 공분산을 항등 행렬로 설정하는 것)이 실패를 초래하는 "차선책의 근사(suboptimal approximation)"임을 보여줍니다. 또한 입력 통계만을 보는 방식(표준 GPTQ 등)은 동일한 입력을 공유하는 서로 다른 하위 계층을 구분할 수 없어, 메모리를 어디에 할당할지에 대해 잘못된 결정을 내릴 수 있음을 보여줍니다.

얼마나 확신하는가?
저자들은 이 결과가 단순한 시뮬레이션이 아닌 엄격한 측정에 기반하고 있기 때문에 매우 자신만만합니다. 그들은 실제 하드웨어(A100 GPU)에서 실제 모델들(LLaMA-2, LLaMA-3, Gemma, DeepSeek)을 사용하여 테스트를 수행했고, 실제 퍼플렉시티와 정확도 점수를 측정했습니다. 그들은 단순히 이론적으로 가능할 것이라고 제안한 것이 아니라, 특정 실험에서 기존 방식들이 2비트에서 작동하는 모델을 만드는 데 실제로 실패한 반면, KronQ는 성공했음을 입증했습니다.

요약하자면, KronQ는 거대한 뇌를 작은 상자에 담기 위해서는 뇌가 정보를 어떻게 '입력'하는지뿐만 아니라 어떻게 '출력'하는지도 이해해야 한다는 것을 깨달은 숙련된 짐꾼과 같습니다. 이를 통해 그들은 이전에는 불가능하다고 여겨졌던 기기에서 거대 AI 모델을 실행할 수 있는 길을 열었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →