← 최신 논문
🤖 machine learning

Sparse Prefix Caching for Hybrid and Recurrent LLM Serving

본 논문은 하이브리드 및 순환 LLM 서빙을 위한 희소 접두어 캐싱을 소개하며, 이는 희소한 체크포인트 위치에서 정확한 순환 상태를 전략적으로 저장하여 가장 깊은 일치 지점부터 계산을 재개함으로써 지연 시간을 최적화하는 방법으로, 기존 밀집 캐싱 휴리스틱보다 우수한 성능을 발휘하면서도 정확한 출력을 유지하고 커널 변경 없이 구현 가능하다.

원저자: Mikhail Shirokikh, Sergey Nikolenko

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mikhail Shirokikh, Sergey Nikolenko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러분이 여러 손님을 위해 복잡하고 다코스의 식사를 준비하는 셰프라고 상상해 보세요. 대형 언어 모델 (LLM) 의 세계에서는 이 "식사"가 응답을 생성하는 것이며, "재료"는 모델이 이미 처리한 단어 (토큰) 들입니다.

구식 방식: "전부 아니면 전무" 부엌

전통적으로 새로운 손님 (새로운 요청) 이 도착하면 셰프는 그들이 마지막 손님과 비슷한 것을 주문했는지 확인합니다.

  • 정확히 같은 전채요리를 주문한 경우: 셰프는 접시 전체를 재사용합니다.
  • 약간 다른 것을 주문한 경우: 셰프는 첫 90% 의 재료가 동일하더라도 전채요리 접시 전체를 버리고 처음부터 다시 조리합니다.

기술적인 용어로, 이는 **밀집 캐싱 (dense caching)**이라고 불립니다. 시스템은 나중에 재사용하기 위해 모든 단계 (모든 토큰) 의 사본을 저장합니다. 이는 표준 모델에는 훌륭하게 작동하지만, **하이브리드 또는 순환 모델 (Hybrid or Recurrent Model)**이라는 새로운 유형의 모델에게는 한 문장을 읽기 위해 도서관 전체를 들고 다니는 것과 같습니다. 너무 무겁고 메모리를 너무 많이 차지합니다.

새로운 아이디어: "체크포인트" 전략

이 논문은 이러한 특정 모델을 처리하는 더 지적인 방법을 제안합니다. 모델의 메모리를 모든 단어가 담긴 도서관이 아니라 마음의 상태로 생각해보세요.

매우 긴 소설을 읽고 있다고 상상해 보세요.

  1. 구식 방식: 즉시 뒤로 돌아갈 수 있도록 모든 페이지마다 스티커 노트를 붙입니다. (스티커 노트가 너무 많습니다!)
  2. 새로운 방식 (희소 접두어 캐싱): 1 페이지, 100 페이지, 200 페이지 등 특정 페이지에만 스티커 노트를 붙입니다.

새로운 독자가 150 페이지에서 이야기를 계속하고 싶다면:

  • 책 전체를 버리지 않습니다.
  • 마지막 스티커 노트 (100 페이지) 를 찾습니다.
  • 현재 상태로 돌아가기 위해 101 페이지부터 149 페이지까지 이야기를 빠르게 다시 읽습니다.
  • 그런 다음 150 페이지에서 계속합니다.

모델이 "순환적"이기 때문에 (단계별로 상태를 발전시키므로), 전체 역사가 아니라 특정 시점의 상태만 필요합니다. 이 논문에서는 이러한 스티커 노트를 체크포인트라고 부릅니다.

문제: 스티커 노트를 어디에 붙일 것인가?

이제 까다로운 부분이 나옵니다. 스티커 노트 (메모리) 에 대한 예산이 제한되어 있습니다. 시간을 가장 많이 절약하기 위해 어디에 배치해야 할까요?

  • "균형" 전략: 노트를 고르게 배치합니다 (100 페이지마다). 이는 안전하지만 아마도 가장 빠르지는 않을 것입니다.
  • "지능형" 전략 (이 논문이 수행하는 것): 독자들의 습관을 살펴봅니다.
    • 대부분의 사람들이 50 페이지 부근에서 읽기를 멈춘다면, 그곳에 노트를 붙입니다.
    • 사람들이 보통 끝까지 읽는다면, 끝부분에 노트를 붙입니다.
    • 사람들이 종종 200 페이지에서 멈춘다면, 그곳에 노트를 붙입니다.

저자들은 과거 요청을 분석하여 미래 독자들이 어디서 멈출지 예측하는 초지능 도서관 사서처럼 작용하는 수학적 공식 ("동적 계획법") 을 만들었습니다. 그런 다음 스티커 노트를 고르게 퍼뜨리는 대신, 가장 유용할 위치에 정확히 배치합니다.

결과: 시간과 메모리 절약

이 논문은 다음과 같은 실제 시나리오에서 이를 테스트했습니다:

  • QuALITY: 동일한 텍스트에 대해 사람들이 다른 질문을 하는 긴 문서.
  • 시스템 프롬프트: 많은 다른 사용자 질문에 이어지는 긴 일련의 지시사항.

그들이 발견한 것:

  1. 적은 메모리, 동일한 속도: 사람들이 실제로 멈추는 위치에 기반하여 체크포인트를 "지능형"으로 배치함으로써, 표준 "균등 간격" 방법보다 더 적은 스티커 노트(체크포인트) 를 사용하면서도 동일한 조리 시간을 절약할 수 있었습니다.
  2. 짧은 예산에서의 큰 승리: 가장 큰 개선은 사용할 수 있는 스티커 노트가 매우 적을 때 발생했습니다. 이러한 긴박한 상황에서는 "지능형" 배치가 단순히 추측하거나 균등하게 간격을 두는 것보다 훨씬 더 좋았습니다.
  3. 정확한 결과: 답을 추측하는 일부 단축키와 달리, 이 방법은 출력이 처음부터 작업을 수행한 것과 100% 동일함을 보장합니다. 이미 알고 있는 부분을 건너뛰어 더 빠르게 수행할 뿐입니다.

결론

이 논문은 "순환적" 메모리를 사용하는 AI 모델을 더 효율적으로 만드는 방법을 소개합니다. 모든 단계를 저장하거나 전혀 저장하지 않는 대신, 모델의 뇌에서 몇 가지 전략적인 "스냅샷"을 저장합니다. 사람들이 AI 를 실제로 어떻게 사용하는지에 기반하여 이러한 스냅샷을 정확히 어디에 저장할지 수학적으로 계산함으로써, 시스템은 특히 많은 사용자가 동일한 긴 문서에 대해 비슷한 질문을 할 때 더 빠르게 실행되고 더 적은 메모리를 사용할 수 있습니다.

이는 전체 지도를 보여주는 것이 아니라, 여러분이 가장 많이 취할 가능성이 있는 코너를 정확히 알고 있으므로 이러한 특정 코너에 대한 방향만 저장하는 GPS 와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →