← 최신 논문
💬 NLP

KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

KV-Fold은 모델 재학습이나 아키텍처 변경 없이 깊은 체인 전반에 걸쳐 안정적이고 메모리 효율적인 시퀀스 처리를 가능하게 하도록 KV 캐시를 왼쪽 폴드 어큐뮬레이터로 취급하는 단순한 학습 없는 장문맥 추론 프로토콜입니다.

원저자: Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 책 한 권을 읽고 그 내용에 대해 질문에 답할 수 있는 천재적이고 매우 똑똑한 사서 (AI 모델) 가 있다고 상상해 보세요. 하지만 함정이 하나 있습니다. 이 사서의 책상은 매우 작습니다. 그들은 한 번에 책의 몇 페이지만 펼쳐서 볼 수 있을 뿐입니다. 만약 그들에게 1,000 페이지 분량의 소설을 주면, 책상이 넘치지 않도록 한 번에 전체를 읽을 수는 없습니다.

보통 이 문제를 해결하기 위해 우리는 사서에게 다음 중 하나를 하라고 지시합니다:

  1. 시작 부분을 잊기: 마지막 몇 페이지만 보기 (슬라이딩 윈도우와 유사).
  2. 과거를 요약하기: 전체 이야기를 작은 메모로 압축해 보려는 시도 (자세한 내용이 종종 손실됨).
  3. 더 큰 책상 만들기: 이는 비용이 많이 들고 거대한 책들의 경우 종종 불가능합니다.

KV-Fold는 더 큰 책상이 필요하지도, 요약을 하지 않아도 되며, 시작 부분을 잊지 않아도 되도록 사서가 책 전체를 읽을 수 있게 해주는 새롭고 영리한 트릭입니다.

핵심 아이디어: "접기" 트릭

책을 긴 종이 띠로 생각해보세요. 전체 띠를 한 번에 읽으려 하지 않고, 그것을 작고 관리하기 쉬운 조각으로 잘라냅니다.

  1. 첫 번째 조각: 사서가 첫 번째 조각을 읽습니다. 읽는 동안 그들은 특별한 "부착식 메모"에 메모를 남깁니다 (이것이 KV 캐시입니다). 이 메모는 그들이 방금 읽은 것의 본질을 담고 있지만, 나중에 특정 세부 사항을 다시 살펴볼 수 있는 방식으로 작성됩니다.
  2. 다음 조각: 두 번째 조각으로 이동할 때, 그들은 첫 번째 부착식 메모를 버리지 않습니다. 대신, 두 번째 조각에서 나온 새로운 메모를 첫 번째 메모들 바로 옆에 붙입니다. 이제 그들은 더 긴 메모 띠를 갖게 됩니다.
  3. 반복: 그들은 이를 계속 반복합니다. 조각을 읽고, 메모를 자라나는 띠에 추가한 다음, 다음 조각으로 이동합니다.

이 논문은 이를 **"왼쪽 접기 (Left Fold)"**라고 부릅니다. 긴 종이를 반복해서 접는다고 상상해 보세요. 각 접기는 새로운 층을 추가하지만, 이전 층들은 여전히 그 아래에 남아 접근 가능합니다. 사서는 이 자라나는 메모 더미를 단계별로 앞으로 운반합니다.

큰 놀라움: "혼란"이 발생하지 않습니다

"메모 더미에 계속 메모를 추가하면, 결국 사서가 혼란에 빠질 것이다. 1 페이지의 메모가 500 페이지의 소음 속에 사라질지도 모른다"라고 생각할 수 있습니다.

하지만 논문은 놀라운 사실을 발견했습니다: 사서는 혼란에 빠지지 않습니다.

  • "드리프트 (Drift)"의 평탄화: 처음에 사서가 첫 번째 조각에서 두 번째 조각으로 전환할 때, 그들의 사고 방식이 약간 변합니다 (새로운 방에 적응하는 것과 유사). 하지만 몇 단계가 지나면 이 변화는 멈춥니다. 이는 "평탄한 대지"에 도달합니다.
  • 안정된 상태: 수백 개의 조각을 읽은 후에도 (실험에서는 최대 511 단계까지), 사서의 성능은 점점 더 나빠지지 않습니다. 그것은 안정적으로 유지됩니다. 마치 사서가 편안한 리듬을 찾아それに 머무른 것과 같습니다.
  • 정밀도는 중요하지 않음: 사서가 무언가를 측정하는 "자"를 변경하더라도 (고정밀 수학에서 저정밀 수학으로 변경), 결과는 동일하게 유지됩니다. 이 안정성은 수학 자체뿐만 아니라 논리 구조에 내장되어 있습니다.

"건초더미 속의 바늘" 테스트

이것이 작동함을 증명하기 위해 연구자들은 "건초더미 속의 바늘"이라는 게임을 진행했습니다.

  • 게임: 그들은 특정 문장 ("바늘") 을 거대한 문서 ("건초더미") 깊숙이 숨겼습니다.
  • 테스트: 그들은 사서에게 전체 문서를 읽은 후 그 문장을 찾아달라고 요청했습니다.
  • 결과:
    • 기존 방법 (스트리밍): 바늘이 처음 몇 페이지에 있었다면 사서가 찾았습니다. 하지만 바늘이 중간이나 끝에 있었다면 사서는 "책상"이 너무 작기 때문에 잊어버렸습니다.
    • KV-Fold: 사서는 바늘을 100% 의 확률로 찾았습니다. 심지어 그것이 128,000 단어 문서의 맨 처음에 묻혀 있더라도요. 그들은 이후 수백 개의 조각을 읽은 후에도 첫 번째 조각의 정확한 세부 사항을 회상할 수 있었습니다.

이것이 중요한 이유 (전문 용어 없이)

  • 재학습 불필요: 사서에게 새로운 사고 방식을 가르칠 필요가 없습니다. 단지 그들에게 책을 전달하는 방식만 바꾸면 됩니다. 사서는 이미 이를 수행할 만큼 똑똑합니다; 우리는 단지 그들에게 더 나은 업무 흐름을 제공했을 뿐입니다.
  • 메모리 트레이드오프: 사서는 여전히 모든 메모 (KV 캐시) 를 책상에 보관해야 합니다. 따라서 책이 길어질수록 책상도 커집니다. 그러나 이는 현재 컴퓨터에게는 불가능한 책 전체를 한 번에 머릿속에 담으려 하는 것보다 훨씬 낫습니다.
  • 정확한 회상: 요약하거나 오래된 페이지를 버리는 방법과 달리, KV-Fold 는 모든 세부 사항을 접근 가능하게 유지합니다. 만약 첫 번째 문장에 대한 것을 물어본다면, 사서는 여전히 그것을 찾을 수 있습니다.

요약 비유

친구에게 긴 이야기를 들려준다고 상상해 보세요.

  • 기존 방식: 당신은 이야기의 마지막 5 분만 기억합니다. 내가 시작 부분에 대해 물어보면, 당신은 "모르겠다"고 말합니다.
  • KV-Fold 방식: 당신은 지금까지 언급한 모든 등장인물과 줄거리에 대한 실행 목록을 유지합니다. 이야기의 다음 부분을 말할 때, 당신은 그 목록을 훑어보며 모든 사람이 누구인지 기억합니다. 목록이 길어지더라도 당신은 그것에 혼란을 느끼지 않습니다. 당신은 여전히 "맨 첫 번째 문장의 개 이름이 뭐였지?"라고 답할 수 있습니다. 왜냐하면 그 이름은 목록에 완벽하게 보존되어 있기 때문입니다.

이 논문은 AI 모델들이 이미 이러한 "목록" 능력을 내장하고 있음을 보여줍니다. 우리는 단지 이를 무한한 길이의 책을 컴퓨터의 메모리를 깨뜨리지 않고 읽기 위한 반복 루프로 사용할 수 있음을 깨달아야 할 필요가 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →