← 최신 논문
🤖 machine learning

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV 는 경량 비동기 소형 모델 프록시와 새로운 HybridAxialMapper 를 활용하여 장문맥 LLM 추론을 위한 KV 캐시를 효율적으로 가지치기함으로써 최첨단 방법과 견줄 만한 높은 정확도를 달성하면서도 프리필링 오버헤드를 크게 줄이는 교차 모델 프레임워크입니다.

원저자: Junjie Li, Jiong Lou, Jie Li

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junjie Li, Jiong Lou, Jie Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

ProxyKV 논문에 대한 설명을 창의적인 비유를 곁들여 쉬운 언어로 번역한 것입니다.

문제: "메모리 벽"

10 만 페이지 분량의 서류를 바탕으로 미스터리를 해결하려는 천재 형사를 상상해 보세요. 형사는 지금까지 읽은 모든 페이지에서 가장 중요한 단서들을 적어두는 '메모장'(KV 캐시라고 함) 을 가지고 일을 합니다.

서류가 길어질수록 이 메모장은 거대해집니다. 결국 메모장이 형사의 책상 (컴퓨터의 메모리) 에 들어가지 않을 정도로 커지면, 형사는 제 발에 걸려 넘어져 수사를 현저히 늦추게 됩니다.

이를 해결하기 위해 메모장을 **가지치기 (prune)**해야 합니다. 지루하고 중요하지 않은 페이지를 버리고 오직 핵심 단서만 남기는 것입니다. 하지만 함정이 하나 있습니다.

  • 방법 A (빠른 추측): 젊은 보조가 최근 몇 페이지를 빠르게 훑어보고 무엇을 남길지 추측합니다. 빠르지만, 책 중간에 숨겨진 중요한 단서들을 종종 버려버립니다.
  • 방법 B (완벽한 재읽기): 형사가 정확히 무엇을 남길지 파악하기 위해 전체 책을 두 번째로 읽습니다. 이는 완벽하지만, 속도를 높이기 위한 목적을 무색하게 만들 정도로 시간이 너무 오래 걸립니다.

해결책: ProxyKV ("그림자 형사")

저자들은 두 가지 세계의 장점을 모두 얻는 ProxyKV라는 새로운 시스템을 제안합니다.

주요 형사 (대규모 모델) 가 사건을 해결하는 동안, 그들 대신 책을 다시 읽는 대신 **그림자 형사 (작은 모델 프록시)**를 고용합니다.

  1. 그림자 형사: 이는 주요 형사의 더 작고 빠른 버전입니다. 같은 "가족"(유사한 데이터로 훈련됨) 에 속하지만 훨씬 가볍고 빠릅니다.
  2. 병렬 작업: 주요 형사가 첫 페이지를 읽는 동안, 그림자 형사는 이미 별도의 책상에서 배경에서 책 전체를 읽고 있습니다.
  3. 번역자: 그림자 형사는 주요 형사와 정확히 같은 언어를 구사하지 않습니다 (서로 다른 수의 '헤드' 또는 어텐션 메커니즘을 가짐). 따라서 특별한 **번역자 (HybridAxialMapper)**가 그림자의 메모를 주요 형사가 이해할 수 있는 형식으로 변환합니다.
  4. 결과: 주요 형사가 첫 페이지를 끝내는 시점까지, 번역자는 "Top 10 단서" 목록을 건네줍니다. 주요 형사는 이제 즉시 불필요한 페이지를 버리고 전체 책을 다시 읽을 필요 없이 번개처럼 빠르게 사건을 해결할 수 있습니다.

번역자의 작동 원리 (HybridAxialMapper)

이 논문은 HybridAxialMapper라는 특별한 도구를 소개합니다. 이를 지능적인 정렬 기계로 생각하세요.

  • 시간 vs 헤드: 그림자 형사는 주요 형사와는 다른 방식으로 이야기를 봅니다. 매퍼는 "이야기 타임라인"(언제 무슨 일이 일어났는지) 과 "시점"(뇌의 어떤 부분이 그것을 감지했는지) 을 분리합니다.
  • 순위 매기기 게임: 모든 페이지의 정확한 점수를 추측하는 것 (어렵고 오류가 발생하기 쉬움) 대신, 매퍼는 순위를 매기는 법을 배웁니다. "51 페이지보다 50 페이지가 더 중요한가?"라고 묻는 것입니다. 이는 버릴 것을 결정하는 데 훨씬 쉽고 정확합니다.

결과: 빠르고 정확함

연구진은 70 억에서 320 억 파라미터까지 다양한 크기의 유명한 AI 모델 (Llama 및 Qwen 등) 에서 이를 테스트했습니다.

  • 속도: 80 억 파라미터 모델에서 ProxyKV 는 완벽하지만 느린 방법보다 "시작" 읽기 단계를 3.2 배 빠르게 만들었습니다. 단일 컴퓨터에서도 1.5 배 빨랐습니다.
  • 정확도: 완벽한 방법의 정확도를 98.7% 유지했습니다. 즉, 형사는 전체 책을 다시 읽은 것처럼 미스터리를 똑같이 잘 해결했지만, 그 시간의 일부로 완료했습니다.
  • 긴 컨텍스트: 이 속도 향상은 "서류"가 거대할 때 (최대 17 만 단어) 도 유효했습니다.

트레이드오프

작은 비용이 하나 있습니다: 책을 읽는 동안 그림자 형사와 번역자를 실행하려면 일시적으로 약간의 추가 메모리 공간이 필요합니다. 그러나 읽기가 완료되고 "Top 10 단서"가 선택되면 그림자 형사는 짐을 싸서 떠나 나머지 작업을 위해 그 공간을 비워줍니다.

요약

ProxyKV는 주요 전문가가 최종 결정에 집중하는 동안 거대한 도서관을 분류하는 무거운 작업을 대신 수행하는 빠르고 작은 조수를 고용하는 것과 같습니다. 이는 조수의 메모가 완벽하게 이해되도록 지능적인 번역자를 사용하여 AI 가 지능을 잃지 않고 대량의 텍스트를 빠르게 처리할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →