← 최신 논문
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA는 양방향 어텐션과 유연한 Token2Chunk 모듈을 사용하여 디코딩 과정에서 정보가 풍부한 컨텍스트를 선택적으로 유지함으로써, 기존 방식의 경직된 제한 없이 추론 언어 모델의 메모리 오버헤드를 줄이고 처리량을 향상시키는 슬라이딩 윈도우 방식의 KV 캐시 압축 기법입니다.

원저자: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 복잡한 미스터리를 풀려고 노력하는 천재적인 탐정(AI)이라고 상상해 보십시오. 이를 위해 당신은 문제를 단계별로 생각하며 찾아낸 모든 단서들을 거대한 화이트보드(KV 캐시)에 적어 내려가야 합니다. 이 "사고의 연쇄(Chain of Thought)"는 매우 강력하지만, 미스터리가 길어질수록 화이트보드는 너무 빨리 채워져 결국 벽 공간이 부족해집니다.

벽이 가득 차면, 당신에게는 두 가지 나쁜 선택지가 있습니다.

  1. 더 이상 쓸 공간이 없어서 풀이를 중단합니다.
  2. 더 많은 탐정을 고용하지만(동시에 더 많은 요청을 실행), 그들은 모두 하나의 작은 벽을 차지하기 위해 싸우느라 모두의 속도가 느려지고 줄을 서서 기다려야 합니다.

이 논문은 이 문제를 해결하기 위한 Kara라는 새로운 시스템을 소개합니다. 다음은 이 시스템이 어떻게 작동하는지 쉬운 비유를 통해 설명한 것입니다.

기존 방식의 문제점

기존의 공간 절약 시도들은 마치 서투른 청소부처럼 화이트보드를 닦아냈습니다.

  • "임계값(Threshold)"의 함정: 기존의 청소부는 화이트보드가 90% 찰 때까지 기다렸다가, 갑자기 보드의 거대한 부분을 한꺼번에 지워버렸습니다. 이는 "멈춤과 움직임(stop-and-go)"의 리듬을 유발했습니다. 때로는 보드가 너무 빨리 다시 차올라서 청소부가 즉시 다시 닦아야 했고, 이는 시간을 낭비하고 모두의 속도를 늦췄습니다.
  • "경직된(Rigid)" 실수: 기존의 청소부는 단어 하나를 무작위로 지우거나, 정해진 크기의 블록(예를 들어 정확히 처음 10단어, 그다음 10단어 식)을 지웠습니다. 이는 깔끔한 상자에 맞지 않는 중요한 맥락을 삭제하여 탐정이 결정적인 단서를 잊어버리게 만들었습니다.

Kara의 솔루션: 스마트한 슬라이딩 윈도우

Kara는 이야기의 가장 최근 부분(슬라이딩 윈도우)만을 살펴보고 무엇을 남길지 결정하는 스마트하고 효율적인 편집자 역할을 합니다.

1. "양방향 대화" 점수
Kara는 단순히 탐정이 단서에 얼마나 관심을 갖는지만 보는 것이 아니라, 단서들 사이의 대화를 살펴봅니다.

  • 비유: 당신이 책을 읽고 있다고 상상해 보십시오. 만약 등장인물 A가 비밀을 언급하고, 나중에 등장인물 B가 그 비밀에 대해 반응한다면, 그들은 서로 "대화"하고 있는 것입니다. Kara는 이 **양방향 어텐션(two-way attention)**을 측정합니다. 과거의 단서가 현재의 사고 과정에서 빈번하게 참조된다면, 그 단서는 높은 점수를 받아 유지됩니다. 반대로 무시된다면 삭제됩니다. 이를 통해 가장 "정보 가치가 높은" 단서들이 살아남도록 보장합니다.

2. "Token2Chunk" 모듈 (유연한 클러스터)
Kara는 때때로 단서들이 개별 단어가 아닌 그룹으로 온다는 것을 깨달았습니다.

  • 비유: 당신이 보관해야 할 중요한 단어 목록을 가지고 있다고 상상해 보십시오. 기존 방식은 이들을 고립된 점들로 취급했습니다. 하지만 Kara는 두 개의 중요한 점을 보고 "이 두 점 사이에 있는 모든 것도 아마 중요할 거야!"라고 말합니다. 즉, **유연한 덩어리(chunk)**를 만드는 것입니다. Kara는 이 덩어리를 고정된 크기로 강제하지 않으며, 이야기의 자연스러운 흐름에 맞춰 늘어나거나 줄어들며 특정 장면의 전체 맥락을 보존합니다.

3. "주기적(Periodic)" 스케줄 (KvLLM)
이것이 바쁜 사무실에서 많은 탐정과 함께 작동하도록 하기 위해, 저자들은 KvLLM이라는 프레임워크를 구축했습니다.

  • 비유: 화이트보드가 위험할 정도로 가득 찰 때까지 기다리는 대신, KvLLM은 엄격한 일정을 가지고 있습니다. 매 100단계마다, 선택된 몇몇 탐정들을 위해 현재 사고 과정의 뒷부분(가장 오래된 부분)을 조용히 청소합니다. 이는 "멈춤과 움직임"의 패닉을 방지하고 흐름을 매끄럽게 유지하여, 더 많은 탐정이 공간 부족 없이 동시에 작업할 수 있게 합니다.

결과

논문에 따르면 Kara를 사용했을 때 다음과 같은 성과를 거두었습니다:

  • 정확도: 탐정은 전체를 자르지 않은 화이트보드를 사용할 때와 거의 동일한 수준(거의 100% 정확도)으로 퍼즐을 해결합니다. 이는 원래 노트의 **20%**만을 유지하면서도 가능했습니다.
  • 속도: 청소가 더 매끄럽고 효율적이기 때문에, 사무실은 속도 저하 없이 동시에 12.75% 더 많은 탐정을 수용할 수 있습니다.

요약하자면, Kara는 AI의 기억에서 뇌를 잘라내지 않으면서도 불필요한 부분을 스마트하고 유연하게 쳐내는 방법이며, 이를 통해 더 길고 복잡한 문제를 더 빠르고 더 많은 사람이 동시에 해결할 수 있도록 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →