← 최신 논문
⚡ electrical engineering

KV Cache Compression Through the Lens of Transform Coding

이 논문은 신호 처리 원리를 활용하여 어텐션 메커니즘에 미치는 영향에 따라 비트를 할당함으로써 여러 벤치마크와 모델에서 약 5.8배의 압축률을 통해 무손실에 가까운 정확도를 달성하는 새로운 KV 캐시 압축 방법인 Attention-Aware Transform Coding(AATC)을 소개한다.

원저자: Hannah Laus, Claudio Mayrink Verdun, Hao Wang, Flavio du Pin Calmon, Felix Krahmer

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hannah Laus, Claudio Mayrink Verdun, Hao Wang, Flavio du Pin Calmon, Felix Krahmer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 들은 이야기를 기억하려고 노력하고 있다고 상상해 보세요. 하지만 당신의 뇌에는 매우 구체적인 규칙이 있습니다. 한 번에 아주 적은 양의 문장만을 활성 메모리에 유지할 수 있다는 규칙이죠. 전체 이야기를 계속 살려두기 위해, 당신은 거대한 두루마리에 노트를 적어야 합니다. 이야기가 길어질수록 이 두루마리는 거대해지고, 곧 종이가 바닥납니다. 이것이 바로 오늘날 우리가 사용하는 초지능형 AI 챗봇인 "대규모 언어 모델(LLM)"이 직면한 문제입니다. 이 모델들은 단순히 한 문장을 읽는 것이 아니라, 책 한 권, 대본, 또는 긴 대화 전체를 읽습니다. 현재의 문장을 이해하기 위해, 그들은 이전에 나왔던 모든 단어를 기억해야 합니다. 그들은 이 이력을 "KV 캐시(KV cache)"라고 불리는 특별한 디지털 수첩에 저장합니다.

문제는 이 수첩이 너무 커져서 컴퓨터의 메모리를 모두 잡아먹고, 속도를 늦추거나 일반적인 기기에서 실행하는 것을 불가능하게 만든다는 점입니다. 과학자들은 숫자를 나타내는 비트(bit)를 적게 사용하는 "약어"(shorthand)를 사용하여 이 수첩을 줄이려고 시도해 왔지만, 대부분 어떤 부분이 중요한지는 추측에 의존해 왔습니다. 그들은 마치 물이 실제로 어디에 저장되어 있는지 보지 않고 스펀지를 쥐어짜듯, 전체 두루마리를 균일하게 압축하려고 해왔습니다. 이 논문은 더 나은 질문을 던집니다. 만약 우리가 AI가 지금 이 순간 실제로 얼마나 관심을 갖느냐에 따라 노트를 다르게 압축할 수 있다면 어떨까요? 돌이켜보면, 과거의 모든 단어가 똑같이 중요한 것은 아닙니다. 어떤 단어는 다음 문장을 위해 결정적이지만, 어떤 단어는 그저 배경 소음에 불과합니다.

이 연구를 수행한 한나 라우스(Hannah Laus)와 그녀의 팀은, 보통 음악이나 이미지를 압축할 때 다루는 분야인 "신호 처리(signal processing)"의 관점에서 이 문제를 바라보기로 했습니다. 그들은 AI의 어텐션 메커니브즘(AI가 어디에 집중할지 결정하는 방식)이 마치 시끄러운 방 안에서 친구의 목소리에 집중하는 우리의 귀처럼 하나의 '필터' 역할을 한다는 것을 깨달았습니다. 그들은 노트를 압축할 때 발생하는 "왜곡(distortion)" 또는 오류가 단순히 약어가 얼마나 형편없느냐의 문제가 아니라, 그 오류가 AI의 현재 집중도와 어떻게 상호작용하느냐에 달려 있다는 것을 수학적으로 증명했습니다.

이를 해결하기 위해, 그들은 **어텐션 인식 변환 코딩(Attention-Aware Transform Coding, AATC)**이라는 방법을 발명했습니다. 이것은 마치 단순히 선반 위의 모든 책을 똑같은 양으로 줄이는 똑똑하지 않은 사서가 아니라, 독자가 무엇에 관심이 있는지 먼저 귀를 기울이는 똑똑한 사서와 같습니다. 그런 다음, 그들은 가장 중요한 정보가 함께 그룹화되도록 책들을 재배치합니다(이를 "백색화(whitening)" 또는 "비상관화(decorrelating)"라고 합니다). 마지막으로, 그들은 "역 워터 필링(reverse water-filling)" 전략을 적용합니다. 물을 언덕과 골짜기가 있는 지형에 붓는다고 상상해 보세요. 물은 자연스럽게 낮은 곳부터 채웁니다. 이 디지털 버전에서 "물"은 제한된 메모리 예산이고, "골짜기"는 노트에서 가장 중요한 부분들입니다. 이 방법은 중요한 채널에는 더 많은 "비트(bit, 메모리 공간)"를 쏟아붓고, 중요하지 않은 곳에는 거의 쏟아붓지 않습니다.

팀은 이 방법을 Llama-3.1-8B와 Qwen-2.5-7B라는 두 가지 인기 있는 AI 모델에 적용하여, 수학 문제 풀이, 객관식 질문 답변, 매우 긴 문서 읽기와 같은 다양한 도전적인 과제들을 테스트했습니다. 결과는 놀라웠습니다. 그들의 새로운 방식은 메모리 사용량을 약 5.8배(대략 5.8x) 압축하면서도, AI의 정확도를 전체 압축되지 않은 메모리를 사용했을 때와 거의 동일하게 유지했습니다. 많은 경우에서, 압축된 AI는 전체 버전과 통계적으로 구별할 수 없을 정도였습니다.

하지만 이 논문은 이것이 모든 것을 해결하는 마법 같은 해결책은 아니라는 점을 주의 깊게 언급합니다. 이 방법은 압축으로 인한 "노이즈"가 무작위 정전기(백색 소음)처럼 행동한다는 수학적 가정에 의존하는데, 이는 해당 분야의 표준적인 추측이지만 모든 실제 상황에서 완벽하게 사실일 수는 있습니다. 또한, 수학적으로는 시뮬레이션과 테스트에서 아름답게 작동하지만, 실제 코드 자체가 아직 실제 제품에 사용되는 가장 빠른 컴퓨터 칩(GPU)에 최적화되어 있지는 않습니다. 즉, 현재는 다운로드 가능한 기능이라기보다는 강력한 프로토타입에 가깝습니다.

이 접근 방식이 특별한 이유는 서로 다른 아이디어들을 하나로 통합했다는 점에 있습니다. 이전의 방법들은 기존 노트를 완전히 버리거나(토큰 제거, token eviction), 모든 것을 균일하게 줄이려고(균일 양자화, uniform quantization) 시도했습니다. 이 논문은 그 두 가지가 결국 동전의 양면과 같다는 것을 보여줍니다. AI의 어텐션이 과거의 데이터에 어떻게 가중치를 두는지 정확히 이해함으로써, 그들은 AI의 "사고 과정"을 존중하는 방식으로 메모리를 할당하는 방법을 찾아냈습니다. 예를 들어, 압축하기 까다롭기로 유명한 Qwen 모델의 경우, 그들의 방식은 다른 방법들이 완전히 실패했던 매우 긴 문맥에서도 AI의 지적 능력을 유지했습니다.

요약하자면, 이 논문은 만약 당신이 AI의 지적 능력을 잃지 않으면서 더 빠르고 가볍게 만들고 싶다면, 단순히 데이터를 쥐어짜는 것이 아니라, AI가 지금 듣지 않아도 되는 부분만을 똑똑하게 압축해야 한다고 제안합니다. 이는 "모든 것을 압축하는 것"에서 "지능적으로 압축하는 것"으로의 전환이며, 그 결과는 이것이 일상적인 기기에서 진정한 롱 컨텍스트(long-context) AI를 실현하는 열쇠가 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →