← 최신 논문
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

이 논문은 쿼리 불가지론적 압축(query-agnostic compression)을 명시적 캐시 제어 및 계층 보존 경계(tier-preserving bounds)와 결러 결합하여 쿼리 인지 방식의 한계를 극복하고, 다양한 프로덕션 LLM 워크로드 전반에서 품질을 유지하면서도 상당한 비용 절감(최대 90%)을 달성하는 캐시 인지 프롬프트 압축(Cache-Aware Prompt Compression, CAPC) 전략을 소개한다.

원저자: Yan Song

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yan Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 비싼 사서(AI)가 당신의 질문에 답을 찾아주는 거대하고 똑똑한 도서관을 운영하고 있다고 상상해 보세요. 비용을 아끼기 위해 도서관에는 두 가지 특별한 기술이 있습니다. 첫째, "VIP 라운지"(캐싱)입니다. 만약 당신이 똑같은 책의 장(chapter)에 대해 반복해서 물어본다면, 사서는 도서관 서가에서 책 전체를 다시 읽을 필요 없이 자신이 적어둔 노트를 슥 훑어보기만 하면 됩니다. 이는 훨씬 저렴합니다. 둘째, "요약기"(압축)입니다. 사서에게 500페이지짜리 소설을 통째로 건네주는 대신, 50페이지 분량의 요약본을 주는 방식이며, 이 또한 처리 비용이 더 저기렴합니다.

오랫동안 사람들은 이 두 가지 기술을 별개로 사용하는 것이 최선이라고 생각했습니다. 지루하고 긴 책에는 VIP 라운지를 사용하거나, 짧고 까다로운 질문에는 요약기를 사용하는 식이었죠. 하지만 여기 함정이 있습니다. 요약기는 새로운 질문에 맞춰 내용을 더 잘 맞추기 위해 매번 이야기를 조금씩 바꿉니다. 문제는 VIP 라운지가 규칙에 매우 엄격하다는 점입니다. 이야기가 아주 조금이라도 바뀌면, 사서는 "죄송하지만, 이건 다른 책입니다!"라고 말하며 노트를 버려버리고, 당신에게 책 전체를 다시 읽는 데 드는 전체 비용을 지불하게 만듭니다. 이 논문은 간단한 질문을 던집니다. 우리가 규칙을 깨뜨리지 않으면서 이 두 가지 기술을 동시에 사용할 수 있을까요?

PayPal의 연구원들은 이를 실제 AI 시스템인 Sonnet 4.6에서 테스트하기로 했습니다. 그들은 VIP 라운지가 사람들이 생각했던 것만큼 완벽하지 않다는 것을 발견했습니다. VIP 라운지에는 짧은 노트들을 위한 "핫 존(hot zone)"과 긴 노트들을 위한 "지속 존(persistent zone)"이 있는데, 만약 당신이 요약을 너무 영리하게 하려고 하면, 실수로 비싼 핫 존에서 노트를 쫓아내 버리게 됩니다. 그들은 기존의 방식, 즉 모든 질문마다 요약본을 바꾸는 방식이 사실은 돈을 낭비하는 일이라는 것을 알아냈습니다. 왜냐하면 그것이 사서가 저렴한 노트를 재사용하는 것을 방해하기 때문입니다.

이를 해결하기 위해, 그들은 CAPC(Cache-Aware Prompt Compression, 캐시 인지 프롬프트 압축)라는 새로운 전략을 발명했습니다. 이것을 이렇게 생각해 보세요. 매 질문마다 이야기를 새로 쓰는 대신, 지루한 부분들에 대한 완벽하고 압축된 요약본을 딱 한 번 만든 뒤, 이를 VIP 라운지에 잠가 두는 것입니다. 그러고 나서 새로운 질문이 생길 때마다, 그 잠긴 요약본을 수정하지 않고 그저 특정 질문만을 그 뒤에 덧붙이는 방식입니다. 이는 마치 변하지 않는 미리 작성된 대본을 갖는 것과 같아서, 사서가 매번 저렴한 노트를 재사용할 수 있게 해줍니다.

결과는 놀라웠습니다. 16가지 종류의 문서를 대상으로 한 테스트에서, 이 새로운 방법은 매번 가장 저렴한 옵션이었으며, 단순히 VIP 라운지만 사용하는 것보다 약 49% 저렴했고, 기존의 "요약본을 바꾸는" 방식보다는 64% 더 저렴했습니다. 그들은 또한 로봇이 컴퓨터 코드를 고치기 위해 도구를 사용하는 경우나, 거대한 지식 그래프를 검색하는 시스템과 같은 실제 업무 환경에서도 이를 테스트했습니다. 한 사례에서는 품질 저하 없이 비용을 50% 이상 절감했습니다. 또 다른 사례에서는 기존의 "요약본을 바꾸는" 방식이 캐시를 계속 깨뜨리는 바람에, 아무것도 하지 않았을 때보다 오히려 40% 더 많은 비용이 들었다는 것을 증명했습니다. 이 논문은 우리가 '언제' 압축하고 '무엇을' 캐싱할지에 대해 똑똑하게 결정함으로써, AI를 멍청하게 만들지 않으면서도 훨씬 더 저렴하게 사용할 수 있다는 결론을 내립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →