← 최신 논문
🤖 machine learning

Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

본 논문은 고정된 후르비츠 군과 무작위 보조 코드북의 곱을 통해 4 개 원소 청크를 사원수로 표현함으로써 KV 캐시를 압축하는 보정 불필요 방법인 후르비츠 사원수 곱셈 양자화 (HQMQ) 를 소개하며, 이는 다양한 현대적 대규모 언어 모델에서 보정 없이도 최대 5.05 배의 압축률을 달성하면서 거의 fp16 수준의 정확도를 실현한다.

원저자: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression"(HQMQ) 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어낸 것입니다.

거대한 문제: "메모리 hoarder"

훌륭하지만 잊기 쉬운 사서처럼 대형 언어 모델 (LLM) 을 상상해 보세요. 여러분이 긴 질문을 하면, 모델은 올바르게 답변하기 위해 지금까지 말한 모든 단어를 기억해야 합니다. 컴퓨터 용어로 이 메모리를 KV 캐시라고 합니다.

매우 긴 대화의 경우, 이 메모리 캐시는 거대해집니다. 사서가 모든 세부 사항을 고화질 (4K 영화처럼) 로 기억하려고 하면 컴퓨터의 RAM 이 즉시 가득 차게 됩니다. 이로 인해 컴퓨터는 더 느린 저장 장치를 사용해야 하거나 충돌하여 대화가 중단됩니다.

이를 해결하기 위해 엔지니어들은 메모리를 "압축"하려고 시도합니다. 마치 4K 영화를 더 작은 MP4 파일로 변환하는 것과 같습니다. 그러나 이전의 압축 방법들은 둔한 칼을 사용하는 것과 같았습니다. 파일 크기를 너무 많이 줄이면 (4 비트 미만), 영화는 더 이상 볼 수 없게 됩니다 (AI 가 nonsensical 한 말을 하기 시작함). 만약 AI 모델에 "이상치"(데이터 내의 기이하고 극단적인 숫자) 가 있다면, 표준 압축은 완전히 무너져 AI 가 광기 어린 환각을 일으키게 됩니다.

해결책: HQMQ ("스마트 나침반" 시스템)

저자들은 HQMQ라는 새로운 방법을 제안합니다. 단순히 숫자를 줄이는 대신, 데이터 그룹을 쿼터니온(4 차원 수학적 나침반의 일종) 으로 취급합니다.

다음은 이를 세 가지 간단한 단계로 나눈 작동 원리입니다.

1. "24 점 별" (주요 코드북)

데이터가 가리키는 방향을 나침반 바늘처럼 상상해 보세요. 저자들은 정확한 각도를 저장하는 대신 (이는 너무 많은 공간을 차지함), 24 개의 점으로 구성된 특수한 미리 만들어진 "별" (Hurwitz 군이라고 함) 을 사용합니다.

  • 비유: 이는 24 개의 고정된 방향 (북, 북동 등, 하지만 4 차원) 의 표준 세트로 생각할 수 있습니다. 데이터가 어디를 가리키든, 이 24 개의 "완벽한" 방향 중 가장 가까운 것에 단순히 맞춰줍니다.
  • 마법: 이 24 개의 점은 수학적으로 완벽하고 균등하게 배치되어 있기 때문에, AI 가 이를 학습하도록 훈련할 필요가 없습니다. 키보드 위의 글자처럼 "하드코딩"된 규칙일 뿐입니다.

2. "무작위 회전" (보조 코드북)

24 개의 점만으로는 모든 미묘한 차이를 커버하기에 부족합니다. 따라서 저자들은 AI 의 각 특정 부분에 대한 작은 무작위 "회전"을 추가하는 두 번째 레이어를 도입합니다.

  • 비유: 24 개의 점이 그려진 지구본을 상상해 보세요. 이제 AI 가 처리하는 모든 문장에 대해 지구본을 무작위로 회전시킬 수 있다고 가정해 보세요.
  • 결과: 고정된 24 개의 점과 무작위 회전을 결합하면 수천 개의 고유한 방향 (24×무작위 회전24 \times \text{무작위 회전}) 을 얻을 수 있습니다.
  • 멋진 점: 논문은 이 무작위 회전을 훈련할 필요가 없다고 주장합니다. 그 뒤에 있는 수학 덕분에 어떤 무작위 회전도 훈련된 것과 거의 동일하게 작동합니다. "다트 던지기를 연습할 필요가 없다. 그냥 무작위로 던지면 수학이 보드판에 맞을 것을 보장한다"고 말하는 것과 같습니다. 이는 시간과 데이터를 절약해 줍니다.

3. "이상치 안전망" (Med3×)

일부 AI 모델 (Qwen 등) 은 정상보다 100 배 또는 200 배 더 큰 "이상치"를 가집니다. 표준 압축은 이러한 거대한 숫자를 맞추기 위해 억지로 줄이려다 데이터를 파괴합니다.

  • 비유: 여행 가방을 싸는 상황을 상상해 보세요. 대부분의 옷은 정상적인 크기이지만, 하나 거대하고 모양이 이상한 테디 곰이 있습니다. 이 곰을 작은 상자에 억지로 넣으려 하면 상자가 찢어집니다.
  • 해결책: HQMQ 는 다음과 같은 규칙이 있습니다: "숫자가 너무 크다면 (평균의 3 배 이상), 짜지 마라. 원래의 고품질 형태 (fp16) 로 유지하고 작은 플래그로 표시하라."
  • 결과: 데이터의 약 1~3% 만 이 특별한 처리를 받으므로 메모리 절약 효과는 여전히 막대하지만, "거대 테디 곰"이 시스템을 파괴하지는 않습니다.

그들이 증명한 것

저자들은 Mistral, Llama, Qwen 등 다섯 가지 다른 현대 AI 모델에서 이를 테스트했습니다. 주요 발견 사항은 다음과 같습니다.

  • 훈련 없이 작동: 다른 방법들이 압축 방법을 학습하기 위해 "보정" 단계 (AI 가 데이터를 연구함) 가 필요한 것과 달리, HQMQ 는 무작위 설정으로 즉시 작동합니다.
  • 엄청난 공간 절약: 그들은 메모리 캐시를 5 배 줄이는 데 성공했습니다. 예를 들어, 700 억 파라미터 모델의 128k 컨텍스트 캐시 (보통 43GB 소요) 가 8.5GB로 축소되었습니다. 이는 슈퍼컴퓨터 대신 단일 소비자용 그래픽 카드에서 거대한 AI 를 실행할 수 있음을 의미합니다.
  • "나쁜" 데이터 처리: 극단적인 이상치를 가진 모델 (Qwen 등) 에서 표준 압축은 완전히 실패했습니다 (AI 의 오류율이 폭발함). HQMQ 와 "안전망"은 이를 수정하여 AI 의 성능을 거의 완벽 수준으로 되돌렸습니다.
  • 속도: 그들은 AI 가 생각하는 동안 압축된 데이터를 읽고 즉시 디코딩하는 특수 "퓨즈드" 엔진을 구축했습니다. 이는 AI 가 느려지지 않고 단지 메모리만 덜 사용함을 의미합니다.

결론

HQMQ 는 AI 메모리를 위한 범용, 미리 만들어진 압축 키트와 같습니다. 먼저 아무것도 학습할 필요 없이 방향을 효율적으로 저장하기 위해 고정된 24 점 별에 무작위 회전을 곱하는 교묘한 수학적 트릭을 사용합니다. 또한 데이터의 급격한 스파이크를 위한 안전 스위치도 갖추고 있습니다.

그 결과는 무엇일까요? AI 가 정신을 잃지 않고 훨씬 작은 컴퓨터에서 훨씬 길고 지능적인 대화를 실행할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →