← 최신 논문
🤖 AI

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

이 논문은 전통적인 LRU 정책에 내재된 워크로드 간섭을 완화하기 위해 캐시 공간을 동적으로 할당하는 최신성/빈도수 적응형 KV 캐싱 전략을 제안하며, 이를 통해 다양한 LLM 추론 워크로드에서 히트율과 첫 번째 토큰 생성 시간(time-to-first-token)을 크게 개선한다.

원저자: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 바쁘고 속도가 빠른 도서관을 운영하고 있다고 상상해 보세요. 이곳에서는 똑똑한 로봇 사서(대규모 언어 모델)가 사람들이 이야기를 쓰거나, 질문에 답하거나, 대화를 나누는 것을 돕습니다.

빠르게 작업하기 위해, 이 로봇은 가장 최근의 그리고 가장 중요한 정보들을 바로 옆 책상 위에 '컨닝 페이퍼' 형태로 보관합니다. 기술 세계에서는 이를 **KV 캐시(KV Cache)**라고 부릅니다. 이것은 로봇이 다음 단어를 써 내려갈 때마다 대화 내용이나 긴 문서를 처음부터 다시 읽어야 하는 수고를 덜어줍니다.

하지만 로봇의 책상은 작습니다. 한 번에 놓을 수 있는 컨닝 페이퍼의 페이지 수가 정해져 있죠. 책상이 가득 차면, 로봇은 새로운 페이지를 위한 공간을 만들기 위해 기존의 페이지 몇 장을 버려야 합니다.

문제점: "최근 들어온 것이 먼저 나간다"는 실수

현재 대부분의 로봇 사서는 LRU(Least Recently Used)라는 단순한 규칙을 사용합니다. 이는 마치 이렇게 말하는 것과 같습니다: "가장 오랫동안 손대지 않은 페이지를 버리겠다."

이 방식은 모든 사람이 순서대로 같은 책을 읽고 있다면 괜찮습니다. 하지만 현실 세계는 복잡합니다:

  1. "핫(Hot)"한 문서: 만약 50명의 서로 다른 사람들이 동일한 특정 긴 기사에 대해 질문한다고 가정해 봅시다. 로봇은 그 기사를 계속 읽고 있지만, 그 기사가 '방금 전'에 본 것은 아니라는 이유로 LR고 규칙은 그 기사를 책상에서 치워버릴 수 있습니다. 그러다 51번째 사람이 똑같은 기사에 대해 질문하면, 로봇은 그 전체 내용을 처음부터 다시 읽어야 합니다. 매우 느려지겠죠!
  2. "신선한" 대화: 채팅 중에는 긴 대화 기록이 있을 수 있습니다. 로봇은 당신이 방금 한 말을 기억해야 합니다. 비록 당신이 이전에 했던 말이라 할지라도 말이죠.

기존의 규칙(LRU)은 너무 경직되어 있습니다. 그것은 무엇이 빈번하게 질문되는 것(핫스팟)인지, 아니면 단순히 최근에 한 번 본 것인지 구분하지 못합니다.

해결책: "적응형 책상"

이 논문의 저자들은 ARC(Adaptive Replacement Cache)라고 불리는 더 똑똑한 시스템을 만들었습니다. 이것은 로봇 사서에게 두 개의 특별한 구역이 있고, 이 구역의 크기가 실시간으로 변할 수 있는 책상을 주는 것과 같습니다:

  1. "방금 본 것" 구역 (최신성): 로봇이 방금 전 만졌던 페이지들을 담습니다.
  2. "매우 인기 있는 것" 구역 (빈도): 로봇이 여러 번 보았던 페이지들을 담습니다.

학습 방법:
이 시스템에는 "유령 선반(Ghost Cache)"이라는 비밀스러운 장치가 있습니다. 이 선반은 실제 페이지를 들고 있지는 않지만, 책상 위에 있었으나 버려진 것들의 목록을 가지고 있습니다.

  • 만약 로봇이 페이지를 버렸는데, 직후에 누군가 다시 그 페이지를 찾는다면, 시스템은 "유령 선반"을 통해 이를 확인합니다.
  • 그러면 시스템은 깨닫게 됩니다: "앗! 내가 실제로 인기 있는 것을 버렸구나. 다음에는 '매우 인기 있는' 구역에 보관했어야 했어."
  • 그래서 시스템은 자동으로 "방금 본 것" 구역을 줄이고 "매우 인기 있는" 구역을 확장하여, 다음번에 인기 있는 항목이 들어올 자리를 만듭니다.

이는 마치 스마트한 온도 조절기처럼 학습하는 것과 같습니다: "아침에는 춥기 때문에 거실을 데워야지. 하지만 오후에는 모두가 주방에 모이니까, 열기를 그쪽으로 옮겨야겠어." 시스템은 사용자들이 실제로 무엇을 하고 있는지에 따라 메모리 공간을 '최신성'과 '빈도' 사이에서 끊임없이 조정합니다.

연구 결과

연구진은 이 새로운 "적응형 책상"을 두 가지 유형의 작업에 대해 기존의 "LRU 책상"과 비교 테스트했습니다:

  1. 문서 질문: 사람들이 긴 기사에 대해 질문하는 경우 (퀴즈 쇼와 같은 상황).
  2. 실제 채팅: 챗봇과의 실제 대화를 시뮬레이션하는 경우.

결과:

  • 더 나은 메모리 적중률: 새로운 시스템은 적절한 페이지를 더 자주 책상 위에 유지했습니다. 문서 테스트에서 "적중률"(정보를 다시 읽지 않고 찾아내는 비율)을 최대 **10.8%**까지 향상시켰습니다.
  • 더 빠른 답변: 로봇이 재독(re-read)을 덜 하게 됨에 따라 답변 속도가 빨라졌습니다. 문서 테스트에서 첫 단어가 나오는 시간(First Token Latency)이 최대 12.6% 감소했고, 실제 채팅 테스트에서는 약 2% 감소했습니다.
  • 적응력: 작업의 성격이 변할 때(예: 많은 사람이 하나의 문서에 대해 질문하는 상황에서 많은 사람이 각기 다른 채팅을 하는 상황으로 변할 때), 시스템은 구역의 크기를 자동으로 조정하여 새로운 상황에 맞췄습니다.

핵심 요점

이 논문은 로봇의 메모리 관리를 유연하게 만드는 것—즉, '새로운 것'과 '인기 있는 것' 사이의 균형을 맞추는 것—이 어떻게 AI 시스템을 더 큰 컴퓨터 없이도 훨씬 더 빠르고 효율적으로 만들 수 있는지 보여줍니다. 이는 기존의 하드웨어가 더 열심히 일하는 대신, 더 똑똑하게 일하도록 만드는 소프트웨어 업그레이드입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →