← 최신 논문
💻 computer science

Still: Amortized KV Cache Compaction in a Single Forward Pass

이 논문은 단 한 번의 순전파(forward pass)를 통해 분할 상환되는(amortized) KV 캐시 압축을 수행하여 우수한 속도-품질 트레이드오프를 달면하고 극단적인 압축률과 컨텍스트 길이 전반에 걸쳐 반복적인 장기 지평 추론을 가능하게 하는, 가볍고 재사용 가능한 레이어별 Perceiver인 Still을 소개한다.

원저자: Charles O'Neill, Alex Sandomirsky, Harry Partridge, Mudith Jayasekara, Max Kirkby

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Charles O'Neill, Alex Sandomirsky, Harry Partridge, Mudith Jayasekara, Max Kirkby

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "무한한" 공책

매우 똑똑한 AI 비서(대규모 언어 모델)가 질문에 답하기 위해 아주 긴 책을 읽고 있다고 상상해 보세요. AI는 읽은 내용을 기억하기 위해 자신의 뇌 옆에 "공책"(KV 캐시라고 불림)을 두고 있습니다. 새로운 단어를 읽을 때마다 AI는 이 공책에 메모를 적습니다.

  • 문제점: 만약 책이 100페이지라면 공책은 작아도 됩니다. 하지만 책이 1,000,000페이지라면 공책은 엄청나게 커집니다. 결국 공책이 너무 커져서 컴퓨터의 메모리(RAM)에 다 들어가지 않게 됩니다.
  • 현재의 해결책들:
    1. 버리기: AI가 자신의 메모를 보고 지루하다고 생각되는 것들을 삭제합니다. 이 방법은 빠르지만, 정답이 담긴 단 하나의 문장까지 실수로 버릴 수 있습니다.
    2. 전체 다시 쓰기: AI가 책 전체를 짧은 단락으로 요약하려고 시도합니다. 이는 똑똑한 방법이지만, 매 페이지를 읽을 때마다 이 작업을 수행하는 데 시간이 너무 오래 걸립니다.

해결책: "Still" (스마트한 요약가)

저자들은 Still이라는 새로운 도구를 소개합니다. Still을 AI와 공책 사이에 앉아 있는 매우 효율적이고 즉각적인 편집자라고 생각하세요.

단순히 메모를 삭제하거나 책 전체를 다시 쓰는 대신, Still은 아주 영리하게 작동합니다. 전체 공책을 살펴보고 이를 작고 고품질인 '요약 카드'로 즉시 압축합니다.

작동 방식 (비유)

당신이 방대한 유물들이 있는 거대한 도서관(전체 공책)을 관리하는 박물관 큐레이터라고 상상해 보세요. 당신은 이 유물들을 모두 작은 전시 케이스(압축된 캐시)에 담아야 이동하기 쉽습니다.

  1. 기존 방식 (선택): 유물 10개를 무작위로 골라내고 나머지는 버립니다. 이 과정에서 가장 중요한 유물을 놓칠 수 있습니다.
  2. 기존 방식 (합성/컨텍스트별): 특정 도서관에 딱 맞는 완벽한 요약을 만들기 위해 정성껏 작업합니다. 훌륭한 방법이지만 시간이 몇 시간씩 걸립니다. 새로운 도서관이 도착하면 처음부터 다시 시작해야 합니다.
  3. "Still" 방식: 당신에게는 마법의 카메라(Perceiver 모듈)가 있습니다. 도서관 전체를 사진으로 찍으면, 카메라는 즉시 그 이미지를 처리하여 도서관의 모든 정수를 담은 완벽한 4x6 사이즈 카드 한 장으로 만들어냅니다.
    • 핵심 포인트: 이 카메라를 사용하는 법을 단 한 번만 배우면 됩니다. 그 후에는 생각하거나 계산할 필요 없이, 어떤 도서관이 오더라도 즉시 사용할 수 있습니다.

"Still"이 특별한 이유

1. 빠릅니다 ("원샷" 기술)
대부분의 똑똑한 요약 도구들은 새로운 텍스트를 볼 때마다 많은 수학적 계산을 해야 합니다. 하지만 Still은 다릅니다. Still은 "빠른 순방향 패스(fast forward pass)"가 되도록 한 번 학습되었습니다.

  • 비유: 국을 만들기 위해 채소를 다듬는 요리사를 상상해 보세요.
    • 기존 방식: 요리사가 채소를 썰기 전에 모든 당근과 양파의 크기를 완벽하게 측정하느라 멈춰 서야 합니다 (느림).
    • Still: 요리사는 이미 몸에 익은 근육 기억(muscle memory)이 있습니다. 한 번의 부드러운 동작으로 채소 더미를 한꺼번에 썰어냅니다. 이는 단 한 단계로 이루어집니다.

2. 똑똑합니다 (합성 vs 선택)
Still은 단순히 남겨둘 "최고의" 메모를 고르는 것이 아니라, 그것들을 섞어서 새롭고 매우 밀도 높은 메모를 만들어냅니다.

  • 비유: 만약 당신에게 1,000권의 책이 있다면, "선택자"는 그중 가장 좋은 책 50권을 남길 것입니다. 하지만 Still은 1,000권의 책에서 아이디어를 가져와 원래 책들의 DNA를 담은 50권의 새로운 "슈퍼 북"으로 혼합합니다. 이는 단순한 선택자가 삭제했을 수도 있는 문장 속에 숨겨진 정답까지도 유지할 수 있음을 의미합니다.

3. 긴 이야기에도 적합합니다 (반복적 압축)
논문은 Still이 반복해서 사용될 수 있음을 보여줍니다. AI가 이야기의 장(chapter)별로 읽어 나갈 때, Still은 1장의 메모를 압축하고, 그다음 2장의 메모를 압축하는 방식으로 계속 작동할 수 있습니다.

  • 비유: 일기를 쓰고 있다고 상상해 보세요. 매일 밤 모든 페이지를 다 보관하는 대신, 그날의 요약본 한 페이지를 작성합니다. 다음 날, 당신은 요약된 한 페이지를 읽고, 오늘의 사건들을 추가한 뒤, 다시 새로운 한 페이지 요약본을 작성합니다. 당신은 일기장이 무거워지지 않게 하면서 이 과정을 영원히 지속할 수 있습니다.

결과 (논문이 발견한 사실)

저자들은 다양한 모델(Qwen, Gemma)과 다양한 길이의 텍스트(8,000단어에서 128,000단어까지)를 대상으로 Still을 테스트했습니다.

  • 속도 vs 품질: Still이 "스윗 스팟(최적의 지점)"에 위치한다는 것을 발견했습니다. 가장 똑똑한 요약 도구들보다 훨씬 빠르며, 단순한 "지루한 것 삭제하기" 방식보다 훨씬 정확합니다.
  • 극한의 압축: 메모를 200배 압축했을 때(128k 문서를 600단어 분량의 공간에 맞춤), Still은 AI가 질문에 올바르게 답할 수 있을 만큼의 지능을 유지했습니다.
  • 요약 능력: Still은 단순히 객관식 질문에 답하는 것뿐만 아니라, 자유로운 형식의 요약을 작성하는 데도 효과적입니다.

한계점 (제약 사항)

논문은 Still이 아직 할 수 없는 부분에 대해서도 솔직하게 밝히고 있습니다:

  • 마법은 아닙니다: 만약 아주 긴 텍스트를 너무 많이 압축하면(예: 200배 압축), 일부 세부 사항을 잃을 수 있습니다. 완벽하지는 않습니다.
  • 학습이 필요합니다: 사용하는 특정 AI 모델마다 전용 "Still" 모듈을 학습시켜야 합니다. 별도의 설정 없이 아무 모델에나 바로 꽂아 쓸 수는 없습니다.
  • 정확한 회상: 만약 AI가 100,000단어 전의 특정 문장을 토씨 하나 틀리지 않고 그대로 읊어야 한다면, Still은 어려움을 겪을 수 있습니다. Still은 의미를 이해하는 데는 뛰어나지만, 완벽한 복사기가 되는 것은 아닙니다.

요약

Still은 AI 비서가 메모리 부족 문제 없이 방대한 양의 텍스트를 기억할 수 있게 해주는 새로운 도구입니다. 이는 전체 메모리를 작고 스마트한 요약 카드로 즉시 "증류(distill)"함으로써 작동합니다. 실시간으로 사용할 수 있을 만큼 빠르고, 중요한 세부 사항을 유지할 만큼 똑똑하며, 몇 시간 동안 이어지는 이야기도 처리할 수 있을 만큼 유연합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →