← 최신 논문
💬 NLP

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem 은 학습 가능한 인덱서를 통해 정확한 토큰 제거를 수행하고 폐기된 정보를 보존하는 경량 잠재 메모리 모듈을 결합하여 긴 컨텍스트 LLM 추론에서의 KV-캐시 병목 현상을 해결함으로써 다양한 모델과 벤치마크에서 성능과 안정성을 크게 향상시킵니다.

원저자: Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

만약 1,000 페이지 분량의 거대한 소설을 읽으면서 첫 페이지에 관한 단 하나의 질문에 답하려고 한다고 상상해 보세요. 읽는 동안 당신의 뇌는 본능적으로 본 모든 단어를 기억하려 합니다. 하지만 여기에는 문제가 있습니다. 당신의 뇌는 제한된 양의 '작업 기억 (working memory)'만을 가지고 있기 때문입니다. 1 페이지부터 1,000 페이지까지의 모든 단어를 한 번에 머릿속에 담아두려 한다면, 압도당하거나 속도가 느려지거나 아예 공간이 부족해질 것입니다.

이는 긴 문서를 다룰 때 대형 언어 모델 (LLM) 이 직면하는 문제와 정확히 일치합니다. 이들은 지금까지 읽은 내용을 기억하기 위해 KV 캐시라는 '메모리 뱅크'를 사용합니다. 텍스트가 길어질수록 이 메모리 뱅크는 커져 컴퓨터의 메모리를 가득 채우게 되고, 이로 인해 시스템이 충돌하거나 완전히 멈추게 됩니다.

'IndexMem'이라는 논문은 이 문제에 대해 지능적인 사서와 백업 금고처럼 작동하는 교묘한 2 단계 해결책을 제안합니다.

문제: "모든 것을 보관하라"는 함정

현재 대부분의 AI 모델은 처리하는 모든 단어 (토큰) 의 기록을 유지하려고 시도합니다. 이는 당신이 방문한 모든 상점에서 받은 영수증을 지갑에 모두 보관하려는 것과 같습니다. 결국 지갑은 들고 다니기엔 너무 무거워집니다.

이를 해결하기 위해 이전 방법들은 '가장 최근 것들을 보관하라'거나 '가장 큰 숫자가 있는 것들을 보관하라'는 간단한 규칙에 따라 '중요하지 않은' 영수증을 버리려 했습니다. 하지만 이러한 규칙들은 종종 어색합니다. 이야기가 오래되었다는 이유만으로 이야기 초반부의 중요한 세부 사항을 버리거나, 최근의 것이라서 지루한 문장을 그대로 유지할 수도 있습니다. 일단 버려진 정보는 영원히 사라집니다.

해결책: IndexMem

저자들은 **스마트 인덱서 (Smart Indexer)**와 **잠재 메모리 금고 (Latent Memory Vault)**라는 두 가지 주요 부분으로 구성된 시스템을 제안합니다.

1. 스마트 인덱서 (지능적인 '사서')

무슨 것을 보관할지 결정하기 위해 경직된 규칙을 사용하는 대신, IndexMem은 학습 가능한 인덱서를 사용합니다. 이는 수백만 권의 책을 읽고 나중에 질문에 답하는 데 어떤 세부 사항이 중요한지 정확히 아는 고도로 훈련된 사서라고 생각하면 됩니다.

  • 작동 방식: AI 가 읽는 동안, 이 사서는 현재 질문 (또는 AI 가 추측하려는 다음 단어) 을 살펴보고 텍스트의 어떤 부분이 실제로 중요한지 예측합니다.
  • 장점: 단순히 '최근성'에 기반해 추측하는 것이 아니라, 맥락을 이해합니다. "이 단어가 50 페이지에 있더라도 100 페이지의 질문에 결정적으로 중요하므로 이를 보관해야 한다"고 말할 수 있습니다. 이는 무엇을 주 메모리에 남기고 무엇을 내보낼지 결정하는 데 훨씬 더 정확해지도록 학습합니다.

2. 잠재 메모리 금고 (백업 금고)

여기가 이 논문의 가장 혁신적인 아이디어입니다. 과거에는 주 메모리에서 단어가 내보내지면 영원히 사라졌습니다. 나중에 AI 가 그 단어가 필요했다면 재앙이었습니다.

IndexMem은 잠재 메모리 (Latent Memory) 모듈을 도입합니다. 이는 고도로 압축된 첨단 백업 금고와 같습니다.

  • 과정: 스마트 인덱서가 단어를 주 메모리에서 내보내기로 결정하면, 단순히 삭제하지 않습니다. 대신 그 정보를 작고 압축된 '요약'으로 만들어 이 특별한 금고에 저장합니다.
  • 검색: 나중에 AI 가 그 정보를 회상해야 할 때, 비어 있는 주 메모리로 되돌아가지 않습니다. 대신 금고를 열어 압축된 요약물을 꺼내 빈 공간을 채우는 데 사용합니다.
  • 비유: 여행을 준비한다고 상상해 보세요. 당신은 여행 가방 (주 메모리) 에 몇 벌의 옷만 넣을 수 있습니다. 당신은 좋아하는 스웨터를 두고 갑니다. 그것을 버리는 대신, 고해상도 사진을 찍어 스마트폰 (잠재 메모리) 에 저장합니다. 나중에 그 스웨터를 그리워하면, 전체 스웨터를 들고 다니는 대신 사진을 보고 그것이 어떻게 생겼고 어떤 느낌이었는지 기억합니다.

왜 이것이 중요한가

이 논문은 Qwen, Mistral, Llama 등 다양한 모델에서 매우 긴 문맥을 가진 상태로 이 시스템을 테스트했습니다.

  • 향상된 정확도: 공간을 절약하기 위해 메모리의 75% 에서 90% 까지 과감히 버렸음에도 불구하고, AI 는 여전히 놀라울 정도로 잘 수행했습니다. '건초더미 속의 바늘' (질문에 답하는 데 필요한 구체적인 세부 사항) 을 잊지 않았습니다.
  • 안정성: 중요한 세부 사항이 텍스트의 '어려운' 위치에 있을 때 갑자기 실패했던 이전 방법들과 달리, IndexMem 은 안정적으로 유지되었습니다.
  • 효율성: 모든 데이터 조각을 비축하려 하지 않았기 때문에, 거대하고 비싼 슈퍼컴퓨터가 아닌 표준 컴퓨터 칩에서 AI 를 실행할 수 있게 했습니다.

요약

간단히 말해, IndexMem은 AI 에게 더 똑똑한 편집자가 되도록 가르칩니다. 학습된 시스템을 사용하여 즉시 메모리에 무엇을 보관할지 결정하고, 나머지는 특별한 '압축 금고'에 저장합니다. 이렇게 하면 AI 는 뇌력을 다 써버리지 않고도 도서관 전체를 읽을 수 있으며, 문제를 해결하는 데 필요한 세부 사항을 결코 진정으로 잊지 않게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →