← 최신 논문
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

CONF-KV 는 모델의 단계별 예측 신뢰도에 따라 캐시 예산을 동적으로 조정하고 혼합 정밀도 저장을 활용하여 장기 범위의 LLM 추론에서 높은 검색 정확도와 작업 성능을 유지하면서 메모리 사용량을 크게 줄이는 새로운 KV 캐시 제거 전략입니다.

원저자: Yubo Li, Yidi Miao

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yubo Li, Yidi Miao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 긴 책을 읽으려는데, 당신의 뇌(컴퓨터의 메모리)는 한 번에 몇 페이지만 보관할 수 있다고 상상해 보세요. 읽는 동안 현재 문장을 이해하려면 이전에 일어난 일을 기억해야 합니다. 너무 많이 잊어버리면 혼란스러워집니다. 반면, 모든 것을 기억하려고 하면 뇌가 너무 가득 차서 움직임이 극도로 느려집니다.

이것은 AI 모델(대형 언어 모델)이 긴 이야기를 쓰거나 긴 대화를 나눌 때 CONF-KV가 해결하는 정확한 문제입니다.

다음은 이 논문이 간단한 비유를 사용하여 설명하는 방식입니다:

문제: "과부하된 배낭"

AI 가 텍스트를 생성할 때, KV 캐시라고 불리는 정보의 "배낭"을 유지합니다. 이 배낭은 AI 가 지금까지 말한 모든 맥락을 담고 있습니다.

  • 문제점: 대화가 길어질수록 배낭은 무거워집니다. 결국 배낭이 너무 무거워져서 AI 가 메모리를 소진하거나(배낭이 찢어짐), 생각하는 데 영원히 걸릴 정도로 느려집니다.
  • 옛날 방식: 대부분의 AI 시스템은 "슬라이딩 윈도우"를 사용합니다. 기차 창문을 상상해 보세요. 기차가 움직이면 밖의 풍경이 바뀝니다. AI 는 마지막 512 단어들 (창문 바로 밖의 풍경) 만 기억하고 그 이전의 모든 것은 잊어버립니다.
    • 결함: 만약 1,000 단어 전에 언급된 질문의 답이 있다면, 슬라이딩 윈도우는 그것을 완전히 잊어버려 AI 가 실패합니다.
  • 다른 옛날 방식: 일부 시스템은 과거에 얼마나 자주 참조되었는지에 따라 "중요한" 단어를 기억하려고 시도합니다. 하지만 이는 지금 어떻게 느끼는지 알지 못한 채, 어제 어디에 있었는지에 대한 지도를 보는 것과 같습니다.

해결책: "신뢰도 미터"

이 논문의 저자인 CONF-KV는 배낭을 관리하는 새로운 방식을 도입했습니다. 고정된 규칙을 사용하는 대신, AI 에게 신뢰도 미터를 부여합니다.

AI 를 시험을 보는 학생이라고 상상해 보세요:

  1. 학생이 자신 있을 때: 그들은 쉽게 답을 압니다. 노트를 다시 볼 필요가 없습니다. 따라서 시스템은 "좋아! 확신했구나. 공간을 절약하기 위해 오래된 노트를 좀 버리자"라고 말합니다.
  2. 학생이 혼란스러울 때: 학생은 망설입니다. 상황을 파악하려면 역사를 확인해야 합니다. 시스템은 "잠깐, 확신이 없어 보이네. 모든 노트를 보관해! 아직 아무것도 버리지 마"라고 말합니다.

실제 작동 방식:

  • 신호: AI 가 다음 단어를 선택하기 전에 자신이 얼마나 확신하는지 확인합니다. 다음 단어가 명확하다면 (높은 신뢰도), 메모리를 줄입니다. 다음 단어가 까다롭다면 (낮은 신뢰도), 메모리를 확장합니다.
  • 정렬: 메모리를 줄여야 할 때도 무작위로 삭제하지는 않습니다. 가장 최근의 단어들 (보통 중요하기 때문) 과 과거에 AI 가 가장 많이 참조한 단어들을 유지합니다. 아무도 관심 없는 "지루한" 오래된 것들을 삭제합니다.

"혼합 정밀도" 트릭

이 논문은 또한 지능적인 저장 트릭을 언급합니다.

  • 당신의 노트가 종이에 쓰여 있다고 상상해 보세요.
  • 최근 노트는 **고품질의 두꺼운 종이 (FP16)**에 쓰여 있어 매우 선명합니다.
  • 오래된 노트는 **얇은 재활용 종이 (INT8)**에 쓰여 있습니다. 훨씬 적은 공간을 차지하지만, 여전히 전체적인 맥락을 파악할 정도로 읽을 수 있습니다.
  • 이를 통해 AI 는 품질을 너무 많이 잃지 않고도 같은 배낭 공간에 훨씬 더 많은 역사를 담을 수 있습니다.

결과가 보여주는 것

저자들은 네 가지 다른 AI 모델에서 이를 테스트한 결과 다음과 같은 사실을 발견했습니다:

  1. 메모리 절감: 모든 오래된 것을 잊는 단순한 "슬라이딩 윈도우"와 거의 동일한 양의 메모리를 사용하지만, 훨씬 더 많은 중요한 세부 사항을 기억합니다.
  2. 향상된 정확도: "Haystack 속의 바늘" 테스트 (거대한 텍스트 속에 숨겨진 하나의 특정 사실을 찾는 것) 에서 CONF-KV 는 **91.4%**의 확률로 바늘을 찾았습니다. 기존 슬라이딩 윈도우는 **53.8%**의 확률로만 찾았습니다.
  3. 실제 작업: 웹 검색 에이전트 (온라인에서 물건을 사거나 양식을 작성하는 시도) 로 사용될 때, 전체 메모리 버전만큼 95.3% 성공했지만 메모리는 2.8 배 적게 사용했습니다.
  4. 속도: 배낭이 가벼워졌기 때문에 AI 가 더 빠르게 생각하며 (낮은 지연 시간), 동시에 더 많은 사용자를 처리할 수 있습니다 (높은 처리량).

결론

CONF-KV는 단순히 책이 "오래되었다"는 이유만으로 낡은 책을 버리는 것이 아닌, 똑똑한 사서와 같습니다. 대신 사서는 독자를 관찰합니다. 독자가 고군분투하면 사서는 도서관 전체를 열어둡니다. 독자가 편안하게 진행하면 사서는 방을 더 빠르게 만들기 위해 잡동사니를 치웁니다.

이는 AI 가 단순히 각 단계마다 AI 가 얼마나 "확신"하는지 듣는 것만으로, 메모리가 부족하거나 느려지지 않고 더 길고 지능적인 대화를 할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →