← 최신 논문
🤖 machine learning

Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches

본 논문은 다양한 토큰 유형의 재사용 가치 차이를 멀티큐 아키텍처와 온라인 학습을 통해 활용하여 수동 파라미터 튜닝 없이 LLM 서비스 효율성을 획기적으로 향상시키는 시맨틱 적응형 접두어 캐시 교체 정책인 SAECache를 소개합니다.

원저자: Shaoke Fang, Ziang Li, Wenfei Wu, Jiatong Ji, Qingsong Liu, Ruizhi Pu

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shaoke Fang, Ziang Li, Wenfei Wu, Jiatong Ji, Qingsong Liu, Ruizhi Pu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매일 수백만 명의 고객을 응대하는 매우 바쁜 고급 커피숍 (대규모 언어 모델 또는 LLM) 을 운영한다고 상상해 보세요. 커피를 빠르게 만들기 위해, 이미 시작한 주문에 대한 미리 준비된 재료와 지시 사항을 보관하는 특별한 "기억 선반" ( GPU 메모리 ) 이 있습니다. 이를 **프리픽스 캐싱 **(Prefix Caching) 이라고 합니다.

새로운 고객이 이전 주문과 90% 가 동일한 라테를 주문하면, 새로운 원두를 갈거나 우유를 스팀할 필요가 없습니다. 선반에서 미리 준비된 베이스를 가져오면 됩니다. 이로 인해 첫 모금 ( 첫 번째 토큰 ) 이 거의 즉시 나타납니다.

하지만 선반은 매우 작습니다. 모든 미리 준비된 베이스를 영원히 보관할 수 없습니다. 결국 새로운 주문을 위한 공간을 마련하기 위해 일부 물건을 버려야 합니다. 이것이 **제거 정책 **(Eviction Policy) 입니다.

문제: "일률적 접근"의 실수

오랫동안 커피숍 관리자들은 간단한 규칙을 사용했습니다: "가장 오래된 물건을 먼저 버리세요." (이는 LRU 정책입니다).

이 논문은 모든 선반의 물건이 동등한 가치를 지닌 것은 아니므로 이 아이디어가 나쁘다고 주장합니다.

  • 시스템 프롬프트: 모든 고객이 보는 "표준 메뉴"를 상상해 보세요. 이는 절대 변하지 않습니다. 모든 고객이 주문하기 때문에 매우 귀중합니다.
  • **생각의 사슬 **(Chain-of-Thought) 고객이 라테를 원하는 이유에 대한 그 사람의 messy 한 내면 독백을 상상해 보세요. 이는 그 사람과 그 순간에만 고유한 것입니다. 다음 고객에게는 거의 쓸모가 없습니다.

오래된 규칙은 "표준 메뉴"와 "messy 한 독백"을 정확히 동일하게 취급했습니다. 독백이 메뉴보다 약간 더 최신이라면, 오래된 규칙은 독백을 위해 메뉴를 버릴 것입니다. 이는 재앙입니다. 다음 고객은 즉시 메뉴가 필요하지만, 독백은 그들에게 쓸모가 없기 때문입니다.

해결책: SAECache (똑똑한 관리자)

저자들은 SAECache라는 새로운 시스템을 만들었습니다. 이는 단순히 물건을 언제 마지막으로 만졌는지 보지 않고, 물건이 실제로 무엇인지를 파악하는 똑똑한 관리자라고 생각하세요.

간단한 비유를 사용하여 작동 방식을 설명하겠습니다.

1. 네 가지 전문 바구니 (다중 큐 아키텍처)

SAECache 는 하나의 큰 선반 대신 선반을 각자 다른 규칙을 가진 네 가지 구별된 바구니로 조직화합니다.

  • "쓰레기" 바구니: 거의 재사용되지 않는 물건 (messy 한 독백이나 음료의 마지막 단계 등) 을 보관합니다. 이들은 가장 먼저 버려집니다.
  • "템플릿" 바구니: 표준 지시 사항과 시스템 프롬프트 (메뉴 등) 를 보관합니다. 이들은 끊임없이 재사용되므로 매우 신중하게 보관됩니다.
  • "채팅" 바구니: 사람들이 오가며 대화하는 대화를 보관합니다.
  • "에이전트" 바구니: AI 가 작업 (코딩이나 도구 사용 등) 을 수행하는 복잡한 작업을 보관합니다.

2. "가치 점수" (의미 인식 가중치)

관리자는 어떤 바구니가 중요한지 단순히 추측하지 않습니다. 학습합니다!

  • 관리자가 "시스템 프롬프트"를 버렸다가 바로 다시 요청받으면, 시스템은 이렇게 학습합니다: "아차! 귀중한 것을 버렸군. 다음에는 시스템 프롬프트에 더 높은 점수를 줘야겠다."
  • "생각의 사슬"을 버렸는데 아무도 요청하지 않으면, 시스템은 이렇게 학습합니다: "잘했어! 그건 쓰레기였어. 계속 낮은 점수를 주겠어."
    이는 인간이 무엇을 해야 할지 알려줄 필요 없이, 관리자가 고객이 실제로 무엇을 구매하는지에 따라 선반을 조정하는 것처럼 자동으로 발생합니다.

3. "타임 머신" (적응형 타이밍)

시스템은 사람들이 언제 돌아오는지 언제인지도 학습합니다.

  • 채팅 세션은 긴 휴식 (고객이 커피 브레이크를 갖는 것) 을 가질 수 있습니다.
  • 에이전트 세션은 매우 빠르고 초조할 수 있습니다.
    시스템은 각 유형의 세션의 고유한 "박동"을 학습합니다. 채팅 세션이 10 분 동안 돌아오지 않았다면 영영 돌아오지 않을 것이라고 알고, 에이전트 세션이 10 초 동안 돌아오지 않았다면 단순히 생각하고 있을 뿐이라고 알고 있습니다. 이는 교통 흐름의 리듬에 맞춰 제거 규칙을 실시간으로 조정합니다.

결과: 더 빠른 커피, 더 적은 낭비

이 논문은 이 새로운 관리자를 "가장 오래된 것 먼저" 규칙과 다른 똑똑하지만 경직된 시스템과 비교하여 테스트했습니다.

  • 속도: 새로운 시스템은 바쁘고 혼합된 환경에서 커피의 첫 모금이 나타나는 속도를 1.4 배에서 2.7 배까지 빠르게 만들었습니다.
  • 적응성: 기존 시스템은 고객 유형이 변경될 때 (예, 수다쟁이 대신 단일 주문 고객이 갑자기 늘어났을 때) 고장 났습니다. 새로운 시스템은 즉시 적응했습니다.
  • 효율성: 쓰레기 (messy 한 독백 등) 를 비축하지 않고 귀중한 물건 (메뉴 등) 을 안전하게 보관함으로써 "낭비"되는 메모리를 대폭 절약했습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: 모든 메모리 블록을 동일하게 취급하지 마세요. 두 가지 물건이 동시에 만져졌다고 해서 동등하게 유용하다는 뜻은 아닙니다. 컴퓨터가 데이터의 의미 (이것은 메뉴인가? 농담인가? 도구인가?) 를 이해하도록 가르치고, 실시간으로 자신의 실수에서 학습하도록 함으로써 AI 를 훨씬 더 빠르고 효율적으로 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →