← 최신 논문
🤖 machine learning

NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache

NSNQuant는 보정 데이터셋에 의존하지 않고도 강건한 저비트 압축과 최대 3배의 처리량 이득을 가능하게 하기 위해, 토큰 분포를 표준 정규 분포와 정렬하는 고유한 "Normalize-Shift-Normalize" 변환과 하다마르 변환(Hadamard transform)을 결합하여 LLM KV 캐시를 위한 보정이 필요 없는 벡터 양자화 방법을 채택한다.

원저자: Donghyun Son, Euntae Choi, Sungjoo Yoo

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Donghyun Son, Euntae Choi, Sungjoo Yoo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 긴 길을 걸으며 거대한 기억의 도서관을 배낭에 담아 옮기려 한다고 상상해 보세요. 이것은 거대 언어 모델(LLM)—이야기를 쓰고, 수학 문제를 풀고, 당신과 대화하는 똑똑한 컴퓨터 뇌—이 긴 대화를 처리하려고 할 때 발생하는 현상입니다. 단어를 하나 읽을 때마다, 모델은 문맥을 이해하기 위해 그 이전에 왔던 모든 것을 기억해야 합니다. 이 "기억"을 **KV 캐시(KV Cache)**라고 부릅니다. 문제는 대화가 길어질수록 이 배낭이 점점 더 무거워져서, 결국 공간이 부족해지고 속도가 느려진다는 것입니다.

이를 해결하기 위해 과학자들은 진공 압축 백에 옷을 넣는 것처럼 기억을 압축하여 배낭의 크기를 줄이려고 노력해 왔습니다. 한 가지 인기 있는 방법은 **벡터 양자화(Vector Quantization, VQ)**입니다. 이것은 비슷한 항목들을 하나로 묶고 이를 "사전"이나 코드북의 하나의 라벨로 대체하는 것과 같습니다. 모든 양말의 정확한 파란색 색조를 일일이 기억하는 대신, 그냥 "파란색 그룹 4"라고 기억하는 식입니다. 하지만 여기에는 함정이 있습니다. 대부분의 기존 방식은 사전을 만들기 위해 특정 의류 세트(보정 데이터셋)를 미리 공부해야 합니다. 만약 완전히 다른 종류의 옷(새로운 유형의 대화)을 팩킹하려고 한다면, 그 사전은 맞지 않게 되고 압축은 실패하게 됩니다. 이 논문은 바로 이 문제, 즉 데이터를 먼저 공부하지 않고도 어떻게 메모리를 줄일 수 있는지에 대해 다룹니다.


문제점: 하나의 옷장에만 작동하는 사전

서울대학교 연구진은 현재 LLM 메모리 압축 분야에서 가장 뛰어난 기술 중 하나인 **결합 양자화(Coupled Quantization, CQ)**의 답답한 결함을 발견했습니다. CQ를 한 사람의 치수에 맞춰 맞춤 정장을 만드는 재단사라고 상상해 보세요. 만약 그 사람이 다양한 체형의 사람들이 모인 방으로 들어간다면, 그 정장은 첫 번째 사람에게는 완벽하게 맞겠지만 다른 모든 사람에게는 우스꽝스러워 보일 것입니다.

AI의 세계에서 이 "사람"은 모델이 보정된 데이터(예: WikiText-2라는 특정 텍xt 데이터셋)입니다. 모델이 다른 유형의 텍스트(예: 방대한 웹 페이지 모음인 C4 데이터셋)를 처리하려고 하면, 이 "정장"은 맞지 않게 됩니다. 저자들은 이러한 불일치가 모델로 하여금 특히 구두점 기호에서 어처구니없는 실수를 하게 만든다는 것을 발견했습니다. 예를 들어, 모델은 쉼표에 대해 혼란을 겪을 수 있는데, 이는 학습 데이터로부터 배운 "사전"이 새로운 텍스트에서 나타나는 쉼표의 방식에 적절한 라벨을 가지고 있지 않았기 때문입니다. 이는 매우 중요한 문제입니다. 모델이 자신의 안락한 구역을 벗어날 때 신뢰할 수 없게 된다는 것을 의미하기 때문입니다.

해결책: NSNQuant – 만능 패킹 큐브

이 문제를 해결하기 위해 연구팀은 특정 데이터를 미리 공부할 필요가 없는 새로운 메모리 압축 방식인 NSNQuant를 도입했습니다. 모든 옷에 딱 맞는 맞춤형 사전을 만들려고 애쓰는 대신, NSNQuant는 모든 옷이 표준화된 기성품 패킹 큐브에 들어가도록 강제합니다.

연구팀은 **정규화-이동-정규화(Normalize-Shift-Normalize, NSN)**라고 불리는 세 단계의 "마법 주문"을 사용하여 이를 수행합니다.

  1. 정규화 (첫 번째 단계): 어떤 양말은 아주 작고 어떤 양말은 아주 크다고 상상해 보세요. 첫 번째 단계는 모든 양말을 같은 크기로 늘리거나 줄이는 것입니다. 이는 거대한 양말이 공간을 독차지하여 전체적인 패킹을 망치는 것을 방지합니다.
  2. 이동 (중간 단계): 이제 양말들이 모두 같은 크기이지만, 모두 왼쪽으로 기울어져 있다고 상상해 보세요. "이동" 단계는 이들을 다시 중앙으로 밀어 넣어 완벽하게 균형을 잡도록 합니다.
  3. 정규화 (마지막 단계): 마지막으로 확인 차원에서, 모든 것이 여전히 균일한지 확인하기 위해 크기를 한 번 더 체크합니다.

이 세 단계의 춤을 마친 후, 저자들은 마지막 반전인 **하다마르 변환(Hadamard Transform)**을 추가합니다. 이것은 전체 양말 더미를 특정한 수학적 방식으로 회전시키는 것이라고 생각하면 됩니다. 이 회전의 마법은, 원래의 무질서하고 예측 불가능한 양말의 모양(데이터)이 갑자기 완벽하고 매끄러운 종 모양의 곡선(표준 정규 분포)처럼 보이게 만든다는 점입니다.

데이터가 원래의 텍스트가 무엇이었든 관계없이 이 예측 가능한 종 모양 곡선 형태를 띠게 되므로, 저자들은 해당 곡선에 맞춰 특별히 설계된 단 하나의 기성 "사전"(코드북)을 사용할 수 있습니다. 데이터를 먼저 살펴볼 필요가 없습니다. 데이터를 그런 모양으로 강제했기 때문에, 데이터가 사전에 딱 맞을 것임을 이미 알고 있기 때문입니다.

연구 결과: 만능 열쇠

연구팀은 LLaMA와 Mistral 제품군을 포함한 여러 유명 AI 모델을 대상으로 이 아이디어를 테스트했습니다. 그들은 단순한 이야기부터 복잡한 코드와 수학 문제에 이르기까지 다양한 유형의 텍스트를 사용하여 NSNQuant를 기존 방식(CQ 및 KIVI)과 비교했습니다.

결과는 인상적이었습니다:

  • 더 나은 일반화 능력: 기존 방식(CQ)은 데이터셋을 바꿀 때 비틀거렸지만, NSNQuant는 강력한 성능을 유지했습니다. 이는 마치 모든 문을 여는 만능 열쇠를 가진 것과 같았고, 기존의 열쇠들은 오직 자신이 만들어진 문에만 작동하는 것과 같았습니다.
  • 저비트(Low-Bit) 성공: 연구팀은 메모리를 단 1비트2비트까지 압축하여 테스트했습니다. 1비트 설정(메모리를 절대적으로 가장 작게 줄인 경우)에서 NSNQuant는 경쟁 상대를 압도했습니다. 예를 들어, GSM8K라는 수학 추론 작업에서 기존 1비트 방식은 약 24점을 기록한 반면, NSNQuant-1b는 53.45점을 기록했습니다. 이는 두 배 이상의 성능 향상입니다!
  • 속도와 공간: 메모리가 훨씬 작기 때문에 컴퓨터는 더 많은 대화를 동시에 처리할 수 있습니다. 저자들은 자신들의 방식이 압축되지 않은 표준 버전보다 3배 더 많은 데이터 처리량을 처리하면서도 메모리는 훨씬 적게 사용한다는 것을 보여주었습니다.

세부 사항

저자들은 이 방식이 엄청난 개선이지만, 완벽한 마법은 아니라는 점을 주의 깊게 언급했습니다. 그들은 AI 모델의 매우 초기 레이어에서 "양말" 중 일부가 여전히 종 모양 곡선에 완벽하게 맞지 않는 이상치(outliers)를 가질 수 있다는 것을 발견했습니다. 그러나 이러한 작은 결함에도 불구하고 전반적인 성능은 매우 높게 유지되었습니다.

또한 그들은 이 방식이 "보정 불필요(calibration-free)"하다는 점을 강조합니다. 사전을 만들기 위해 특정 데이터를 몇 시간 동안 공부해야 했던 기존 방식과 달리, NSNQuant의 사전은 단일 그래픽 카드에서 5분 미만으로 구축할 수 있으며 이후 어떤 모델에도 재사용할 수 있습니다. 이는 실제 환경에서 사용하기에 매우 실용적입니다.

요약하자면, NSNQuant는 무질서한 기억의 더미를 예측 가능한 형태로 강제하는 만능 패킹 시스템과 같아서, AI 모델이 명료한 사고 능력을 잃지 않으면서도 훨씬 작은 배낭에 장기 기억을 담을 수 있게 해줍니다. 이는 데이터를 압축하기 전에 표준화함으로써, AI가 완전히 새롭고 낯선 주제를 다룰 때도 더 빠르고, 저렴하며, 신뢰할 수 있게 만들 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →