← 최신 논문
🤖 machine learning

Quantize What Counts: More for Keys, Less for Values

본 논문은 키에 대한 값보다 높은 정밀도를 우선시하는 것이 양자화 오차를 엄격히 줄이고 정확도를 유지함을 증명함으로써 대규모 언어 모델의 혼합 정밀도 KV 캐시 양자화에 대한 이론적 기반을 확립하여, 비트 할당을 휴리스틱 튜닝에서 기하학적 설계 원리로 전환합니다.

원저자: Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Quantize What Counts: More for Keys, Less for Values"라는 논문에 대해 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

큰 문제: '메모리 냉장고'가 너무 꽉 찼습니다

매우 긴 식사 (대화나 이야기) 를 요리하는 천재 셰프처럼 대형 언어 모델 (LLM) 을 상상해 보세요. 식사를 이어가기 위해 셰프는 지금까지 추가한 모든 재료를 기억해야 합니다. 컴퓨터 용어로 이 메모리는 KV 캐시(Key-Value Cache)라고 합니다.

식사가 길어질수록 (더 많은 토큰이 늘어날수록) 셰프는 이 재료들을 저장하기 위해 점점 더 큰 냉장고가 필요합니다. 결국 냉장고가 너무 꽉 차서 부엌이 공간 부족에 시달리게 되고, 모든 것이 느려지거나 요리가 완전히 멈추게 됩니다. 이것이 이 논문이 다루는 '메모리 병목 현상'입니다.

현재의 해결책: 재료를 줄이기

꽉 찬 냉장고를 해결하기 위해 엔지니어들은 양자화(quantization)를 사용합니다. 이는 재료를 압축하는 것이라고 생각하세요. 전체이고 무거운 수박 (고정밀도) 을 저장하는 대신, 작고 가벼운 조각 (저정밀도) 을 저장하는 것입니다. 이렇게 하면 공간이 절약됩니다.

그러나 함정이 있습니다: 재료를 너무 많이 줄이면 셰프가 레시피를 잊어버리거나 실수를 할 수 있습니다. 항상 던져졌던 큰 질문은 바로 이것입니다: "요리를 망치지 않고 Key 재료를 Value 재료에 비해 얼마나 줄일 수 있을까?"

지금까지 사람들은 추측 (휴리스틱) 을 하거나 무작위 조합을 시도하여 무엇이 작동하는지 확인했습니다. 이 논문은 말합니다: "추측을 멈추세요. 수학을 봅시다."

발견: Keys 가 '무거운 짐꾼'입니다

저자들은 두 가지 유형의 재료인 KeysValues 사이의 근본적인 차이를 발견했습니다.

  • 비유: 'Key'는 상자의 라벨이고, 'Value'는 상자 안의 내용물이라고 상상해 보세요.
  • 발견: 이 논문은 '라벨'(Keys) 이 '내용물'(Values) 보다 수학적으로 '무겁고' 더 복잡하다는 것을 증명합니다. 기술적으로 말하면 Key 행렬은 Value 행렬보다 더 큰 '노름(norm)을 가집니다.

Keys 가 더 무겁기 때문에 더 높은 '정보 밀도'를 운반합니다. 무거운 물체를 너무 많이 으깨면 부서집니다. 가벼운 물체를 으깨면 거의 변하지 않습니다.

해결책: "Keys 에는 더 많이, Values 에는 더 적게"

이 발견에 기반하여 저자들은 재료를 줄이기 위한 새로운 규칙을 제안합니다:

  1. Keys 에 더 많은 비트를 할당하세요 (더 크게 유지하세요): Keys 는 무겁고 복잡한 라벨이므로 상대적으로 정밀하게 유지되어야 합니다.
  2. Values 에는 더 적은 비트를 할당하세요 (더 많이 줄이세요): Values 는 가볍고 민감도가 낮으므로 정확도를 크게 잃지 않고 크게 압축할 수 있습니다.

창의적인 비유:
여행을 위해 여행 가방을 꾸린다고 상상해 보세요.

  • Keys여권과 항공권입니다. 이들을 낙서하거나 너무 작게 접으면 사용할 수 없게 되어 발이 묶입니다. 이들은 선명하고 깔끔하게 유지되어야 합니다 (고정밀도).
  • Values양말과 티셔츠입니다. 이들을 꽉 접거나 말아서 구석에 밀어 넣을 수 있습니다. 이들은 공간을 차지하지만, 약간 구겨져도 입을 수 있습니다 (저정밀도).

이 논문의 전략은 다음과 같습니다: 여권은 조심스럽게 포장하세요 (4 비트), 양말은 꽉 채워 넣으세요 (2 비트).

결과: 품질을 잃지 않고 공간 절약

연구자들은 이 '여권 대 양말' 전략을 다양한 모델 (Llama, Mistral, Qwen 등) 과 작업 (수학, 대화, 작문) 에서 테스트했습니다.

  • 옛 방식: 모든 것을 동일하게 취급 (예: 여권 4 비트, 양말 4 비트). 이는 양말에 공간을 낭비합니다.
  • 새 방식: 여권 4 비트, 양말 2 비트.

결과:

  • 절약된 공간: 냉장고에 필요한 메모리의 약 **25%**를 절약했습니다.
  • 유지된 정확도: 모델은 원래 정확도의 **98.3%**로 여전히 작동했습니다.
  • "K4V2"의 최적점: 구체적으로 Keys 에 4 비트를, Values 에 2 비트를 할당하는 것은 모든 것을 4 비트로 유지하는 것과 거의 동일한 성능을 내면서도 Values 에 대한 메모리를 절반으로 줄였습니다.

왜 이것이 중요한가

이 논문은 '시행착오'에서 '과학적 설계'로 패러다임을 바꿉니다.

  • 이전: 엔지니어들은 모델이 충돌하지 않을 때까지 설정을 무작위로 조정했습니다.
  • 이제: 모델 자체의 기하학에 기반한 규칙이 생겼습니다: Keys 를 우선시하세요.

또한 이 규칙이 다른 기법들 (가방을 더 잘 맞추기 위해 물건을 재배치하는 것과 같은 '회전' 등) 과 완벽하게 호환된다는 것을 보여주었습니다. 'Keys 에 더 많이'라는 원칙과 이러한 다른 기법들을 결합하면 결과가 더욱 좋아집니다.

요약

이 논문은 AI 모델의 메모리에서 Keys 는 핵심적인 무거운 짐꾼이고, Values 는 유연하며 압축 가능한 부분이라고 주장합니다. Keys 에 더 많은 주의 (비트) 를 기울이고 Values 에는 더 적은 주의를 기울임으로써 AI 가 '생각하는 방법'을 잊지 않으면서 모델의 메모리 발자국을 크게 줄일 수 있습니다. 이는 간단하고 수학적으로 뒷받침되는 규칙입니다: Keys 에는 더 많이, Values 에는 더 적게.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →