← 최신 논문
🤖 AI

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

본 설문 조사는 LLM 서빙을 위한 30개 이상의 KV 캐시 관리 시스템을 네 가지 핵심 축을 기준으로 다섯 가지 아키텍처 원형으로 분류하고, 소유권이 설계 변이의 주요 동인임을 식별하며, 결함 허용, 격리 및 고급 서빙 기술의 발전을 저해하는 7가지 결정적인 측정 격차를 강조합니다.

원저자: Jie Li, Tongyang Wang, Yong Chen

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jie Li, Tongyang Wang, Yong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고속 도서관을 운영하고 있다고 상상해 보세요. 이곳에는 단 한 명의 사서(AI 모델)가 한 번에 한 단어씩 이야기를 써 내려가고 있습니다. 다음 단어를 쓰기 위해서 사서는 지금까지 쓰인 모든 내용을 기억해야 합니다. LLM(대규모 언어 모델)의 세계에서 이 '기억'을 **KV 캐시(KV Cache)**라고 부릅니다.

오랫동안 이 메모리는 일회용 포스트잇처럼 취급되었습니다. 사서는 포스트잇을 집어 들어 몇 단어를 쓰고, 이야기가 끝나면 바로 버려버렸습니다. 하지만 이제 이야기는 믿기 힘들 정도로 길어지고 있고(컨텍스트 윈도우), 도서관은 동시에 이야기를 요청하는 수백 명의 사람들로 북적이고 있습니다(높은 동시성). 포스트잇은 사서의 책상에 다 담기지 못할 만큼 커졌으며, 매번 이를 버리는 것은 엄청난 시간을 낭비하는 일이 되었습니다.

이 논문은 서로 다른 컴퓨터 시스템들이 이 "메모리 위기"를 어떻게 해결하고 있는지에 대한 서베이(종합적인 검토)입니다. 저자들은 우리가 KV 캐시를 단순한 로컬 메모가 아니라, 세심한 관리가 필요한 복잡하고 분산된 메모리 시스템으로 대하는 방식으로 변화하고 있다고 주장합니다.

다음은 그들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

1. 모든 시스템이 답해야 하는 네 가지 질문

저자들은 이 메모리를 관리하려는 모든 시스템이 네 가지 특정 질문에 답하고 있다고 말합니다. 이들은 이를 "네 가지 축(Four Axes)"이라고 부릅니다.

  • 지역성 (Locality - 메모리가 어디에 있는가?): 메모리가 사서의 책상 바로 위(로컬 GPU)에 있습니까, 아니면 사서가 다른 방으로 걸어가거나 다른 도시에 있는 친구에게 전화를 걸어 가져와야 합니까?
  • 수명 (Lifetime - 얼마나 오래 머무는가?): 이야기가 끝나는 즉시 메모리가 사라집니까? 한 사람과의 대화가 진행되는 동안 유지됩니까? 아니면 나중에 누구라도 재사용할 수 있도록 영구적으로 남습니까?
  • 소유권 (Ownership - 누가 관리하는가?): 무엇을 남기고 무엇을 버릴지 결정하는 권한이 사서에게만 있습니까? 중앙 관리자(예: 수석 사서)가 규칙을 만듭니까? 아니면 도서관의 모든 사람이 각자의 규칙을 만듭니까?
  • 기질 (Substrate - 무엇이 메모리를 운반하는가?): 메모리가 건물 내부의 초고속 케이블(GPU 메모리)을 통해 이동합니까, 건물 사이의 고속 광섬유 라인(RDMA)을 통과합니까, 아니면 고속도로 위의 느린 트럭(하드 드라이브/SSD)을 타고 이동합니까?

2. 다섯 가지 "아키타입" (다섯 가지 도서관 스타일)

저자들은 30개 이상의 서로 다른 시스템을 조사한 결과, 위 네 가지 질문에 대한 답변에 따라 모두 다섯 가지 주요 "스타일" 또는 아키타입으로 분류된다는 것을 발견했습니다.

  1. 로컬 페이징 (Local-Paged, 효율적인 책상): 메모리가 사서의 책상 위에 머물지만, 메모리를 버리지 않고 빠르게 넣었다 뺐다 할 수 있는 영리한 파일링 시스템(페이징)을 사용합니다. 현재 가장 흔한 스타일입니다 (예: vLLM).
  2. 분리형 파이프라인 (Disagregated-Pipeline, 조립 라인): 도서관이 업무를 나눕니다. 한 팀의 사서들이 이야기의 시작 부분(Prefill)을 쓰고, 다른 팀이 나머지 부분(Decode)을 완성합니다. 이들은 메모를 서로 주고받습니다. 이는 책상이 복잡해지는 것을 방지합니다.
  3. 공유 저장소 (Shared-Store, 글로벌 아카이브): 도서관에 거대한 공유 아카이브실이 있습니다. 두 사람이 같은 이야기의 시작 부분을 요청하면, 다시 쓸 필요 없이 아카이브에서 기존 메모를 가져오기만 하면 됩니다. 이는 엄청난 시간을 절약해 줍니다.
  4. 메모리 풀 (Memory-Pool, 공유 창고): 메모를 방 사이로 옮기는 대신, 도서관은 모두가 직접 접근할 수 있는 거대한 공유 창고(CXL과 같은 새로운 기술 사용)를 구축합니다. 이는 마치 모두가 공유하는 하나의 거대한 책상을 갖는 것과 같습니다.
  5. 하이브리드 티어 (Hybrid-Tier, 슈퍼 시스템): 이것은 "맥가이버 칼"입니다. 조립 라인, 공유 아카이브, 그리고 창고를 한꺼번에 결합한 형태입니다. 복잡하지만 매우 강력합니다 (예: Mooncake).

3. 핵심 발견: "소유권"이 열쇠다

저자들은 하드웨어와 작업 유형을 해결하고 나면, 시스템 간의 가장 큰 차이점은 소유권이라는 것을 발견했습니다.

  • 어떤 시스템은 중앙 관리자(수석 사서)가 모든 메모가 어디로 갈지 정확히 결정합니다.
  • 다른 시스템은 모든 사서가 스스로 결정하는 분산 팀 체제입니다.
  • 논문은 이 선택이 시스템의 확장성(Scalability)과 컴퓨터 장애 발생 시 어떻게 대응할지를 결정한다고 주장합니다.

4. 놓치고 있는 부분들 (사각지대)

논문은 중요한 문제점을 지적합니다: 우리는 이 시스템들을 측정할 좋은 자(Ruler)를 가지고 있지 않습니다.
현재 연구자들은 단순히 "우리 시스템이 더 빠르다!"라고 말하지만, 그런지에 대해서는 설명하지 않습니다. 저자들은 우리가 이러한 시스템을 진정으로 이해하기 위해 확인해야 할 일곱 가지 누락된 측정 항목을 찾아냈습니다.

  • 메모리가 어디에 있는지 찾는 데 얼마나 많은 시간이 낭비되는지(메타데이터 비용)를 알 수 없습니다.
  • 메모리가 버려지기 전까지 정확히 얼마나 오래 머무는지(수명)를 알 수 없습니다.
  • 실제 사람들이 도서관을 어떻게 사용하는지에 대한 공개된 기록(공개 트레이스)이 부족합니다.

5. 향관 과제

저자들은 연구 과제를 제안합니다. 우리는 단순히 추측하는 것을 멈추고 이러한 구체적인 것들을 측정하기 시작해야 한다고 말합니다. 그렇게 한다면 다음을 파악할 수 있습니다:

  • 이야기 중간에 컴퓨터가 고장 났을 때 어떻게 대처할 것인가 (결함 허용/Fault Tolerance).
  • 한 사용자가 실수로 다른 사용자의 메모를 보지 못하도록 어떻게 비밀을 안전하게 지킬 것인가 (격리/Isolation).
  • 도서관이 거대해질 때 메모리를 어떻게 관리할 것인가.

요약하자면: KV 캐시는 작은 포스트잇에서 거대하고 분산된 메모리 문제로 성장했습니다. 이 논문은 현재의 솔루션들을 다섯 가지 명확한 카테고리로 분류하고, "누가 관리하는가"가 가장 중요한 설계 선택임을 밝히며, 이러한 솔루션들이 얼마나 잘 작동하는지 정확히 측정하기 위한 더 나은 도구가 필요하다고 촉구하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →