← 최신 논문
💬 NLP

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

이 실증적 연구는 LLM 에이전트를 위한 실용적인 온라인 KV 캐시 압축이 즉각적이거나 정적인 컨텍스트 가정에 의존하기보다, 향후 에이전트 쿼리가 가능할 때까지 압축을 지연시키고 견고한 프록시 소스를 활용한 토큰 제거를 사용함으로써 상당한 메모리 절감과 처리량 이득을 달성할 수 있음을 입증한다.

원저자: Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 여러 단계로 이루어진 미스터리를 풀려고 노력하고 있다고 상상해 보십시오. 당신에게는 질문을 던지고, 단서를 확인하며, 목격자와 대화할 수 있는 영리한 탐정(AI)이 있습니다. 하지만 함정이 하나 있습니다. 탐정의 두뇌에는 엄격한 메모리 제한이 있다는 점입니다. 탐정이 한 단계를 밟거나, 노트를 적거나, 목격자의 이야기를 들을 때마다 그 정보는 차곡차곡 쌓입니다. 사건이 너무 길어지면, 탐정의 두뇌는 오래된 노트들로 가득 차서 더 이상 명확하게 생각할 수 없게 되거나, 단순히 새로운 노트를 적을 공간이 부족해집니다. 이것이 바로 "LLM 에이전트(LLM Agents)"의 세계입니다. 이들은 도구 및 인터넷과 대화하며 복잡한 과제를 해결하는 똑똑한 컴퓨터 프로그램입니다. "KV 캐시(KV cache)"는 바로 그 탐정의 두뇌에 쌓여가는 노트 더미를 일컫는 기술적 명칭입니다. 이 더미를 사건 해결에 필요한 단서를 잃지 않으면서도 메모리에 들어갈 만큼 작게 유지하는 것이 이 논문이 다루는 핵심 과제입니다.

UC 산타바바라와 링크드인(LinkedIn)의 연구진은 "KV 캐시 압축(KV cache compaction)"이라는 영리한 기법을 테스트하기로 했습니다. 이것은 마치 긴 경찰 보고서를 하나의 포스트잇에 요약하는 것과 같습니다. 과거의 대화 속 모든 단어를 다 간직하는 대신, AI는 가장 중요한 의미를 유지하면서도 더 짧은 버전으로 압축하려고 시도합니다. 하지만 반전이 있습니다. 일반적인 이야기에서는 시작하기 전에 결말을 알고 있습니다. 그러나 AI 에이전트의 삶에서는 이야기가 진행되는 동시에 쓰여집니다. AI는 다음에 어떤 질문을 던질지 알지 못하므로, 미래에 무엇이 필요할지 알기도 전에 과거를 요약해야 합니다. 이 논문은 다음과 같은 질문을 던집니다. 다음 장을 읽기 전인데 어떻게 이야기의 한 장을 요약할 수 있을까요?

연구팀은 이 요약 방식에 대해 두 가지 주요 방법을 테스트했습니다. 첫 번째 방법인 **토큰 제거(Token Eviction, TE)**는 현재 페이지를 읽고 "이 80%의 단어들은 지루하니 버리고, 상위 20%만 남기자"라고 결정하는 엄격한 편집자와 같습니다. 두로 번째 방법인 **어텐션 매칭(Attention Matching, AM)**은 더 화려한 예술가에 가깝습니다. 이들은 최고의 단어를 고를 뿐만 아니라, 나중에 다시 읽었을 때 원래의 긴 버전과 똑같은 느낌을 주도록 더 짧고 새로운 버전을 그려내려 노력합니다.

최선의 요약 방식을 결정하기 위해, 연구진은 언제 요약을 할 것인지와 무엇을 가이드로 사용할 것인지를 결정해야 했습니다. 그들은 세 가지 다른 "가이드" 전략을 테스트했습니다:

  1. "지금 당장" 가이드: 방금 말한 단어들만을 사용하여 즉시 요약합니다.
  2. "반복" 가이드: AI에게 마지막 부분을 다시 읽는 척하게 하여 무엇이 중요한지 결정하도록 합니다.
  3. "미래" 가이드: 조금 기다립니다. AI가 이야기의 다음 몇 단계를 작성하게 한 다음, 그 새로운 질문들을 사용하여 이전 단계들로부터 무엇을 남길지 결정합니다.

결과는 놀랍고도 실용적이었습니다. 첫째, 그들은 즉시 요약하는 것( "지금 당장" 가이드를 사용하는 것)이 종종 AI를 멍청하게 만든다는 것을 발견했습니다. 이는 미스터리 소설의 첫 장을 읽으면서 누가 악당인지 알기도 전에 요약하는 것과 같습니다. 당신은 나중에 매우 중요해질 수도 있는 단서를 버릴 수도 있기 때문입니다. 하지만 만약 그들이 단 한 턴을 기다려준다면—즉, AI가 다음 질문을 먼저 던지게 한다면—요약은 훨씬 더 똑똑해졌습니다. "미래" 가이드를 사용함으로써, AI는 실제로 어떤 정보가 필요한지를 파철하고 오직 그 정보만을 남길 수 있었습니다.

또한 그들은 더 단순한 방법인 **토кен 제거(TE)**가 더 화려하고 복잡한 **어텐션 매칭(AM)**보다 종종 더 신뢰할 만하다는 것을 발견했습니다. 설령 "가이드"가 완벽하지 않더라도, "가장 좋은 20%를 남긴다"는 단순한 접근 방식이 더 잘 버텨냈습니다. 수학적으로 너무 영리해지려고 노력하는 것(AM이 하는 방식처럼)이 미래를 예측해야 하는 상황에서는 항상 도움이 되지는 않는다는 것이 밝혀졌습니다.

가장 흥 미로운 부분은 이것이 속도와 비용에 무엇을 의미하는가 하는 점입니다. 더 크고 강력한 AI 모델에서 테스트했을 때, 결과는 판도를 바꾸는 수준이었습니다. 메모리를 원래 크기의 20%로 압축했을 때(5개 중 1개의 토큰만 유지), 그들은 단순히 공간을 절약한 것이 아니라, 한 모델에서는 4.2배 더 빠르게, 다른 모델에서는 1.7배 더 빠르게 실행했습니다. 어떻게 가능했을까요? AI의 "두뇌"가 훨씬 작아졌기 때문에, 컴퓨터는 충돌 없이 4배나 더 많은 탐정 사건을 동시에 수행할 수 있었습니다.

흥미롭게도, 논문은 AI의 메모리가 압축되었을 때 탐정이 가끔 "불안해"한다는 점을 주목했습니다. AI는 동일한 퍼즐을 풀기 위해 더 많은 질문을 던지고 더 많은 단계를 밟는 경향을 보였는데, 이는 아마도 자신이 잃어버렸다고 느끼는 사실들을 재확인하려는 행동일 것입니다. 이는 AI가 여전히 정답을 맞히기는 하지만, 더 타이트해진 메모리에 적응하기 위해 행동이 약간 변한다는 것을 시사합니다.

요약하자면, 이 논문은 만약 당신이 큰 비용을 들이지 않거나 컴퓨터 메모리를 망가뜨리지 않고 똑똑하고 오래 지속되는 AI 에이전트를 실행하고 싶다면, 서둘러 요약하지 말라고 제안합니다. 대신, AI가 몇 단계를 더 밟게 하고, 다음에 무엇을 할지 엿보게 한 다음, 그때 과거를 압축하십시오. 그리고 놀랍게도, 이를 위해 초복잡한 알고리즘을 사용할 필요는 없습니다. 가장 중요한 단어들을 선택하는 단순하고 영리한 방식이 똑같이, 혹은 더 잘 작동합니다. 이 접근 방식은 이러한 고급 AI 에이전트를 실행하는 것을 훨씬 더 저렴하고 빠르게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →