Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
이 논문은 장기적 에이전트 작업(long-horizon agentic tasks)에 대해 세 곳의 주요 LLM 제공업사를 대상으로 프롬프트 캐싱을 종합적으로 평가하며, 동적인 도구 결과(dynamic tool results)를 제외하고 프롬프트 구조를 관리하는 것과 같은 전략적 캐싱 기술이 단순한 전체 컨텍스트 캐싱(naive full-context caching)에 비해 API 비용을 41~80% 절감하고 첫 번째 토큰 생성 시간(time to first token)을 13~31% 개선할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 복잡한 미스터리를 해결하기 위해 아주 유능하지만 비용이 많이 드는 연구 보조원을 고용했다고 상상해 보세요. 이 보조원은 일을 시작하기 전에 방대한 양의 지침서(시스템 프롬프트)를 읽어야 합니다. 일을 하는 동안, 보조원은 다양한 출처로 수십 통의 전화를 걸어 답변을 얻고 이를 수첩에 적습니다.
새로운 전화를 걸 때마다, 보조원은 자신이 무엇을 해야 하는지 기억하기 위해 지침서의 첫 페이지부터 처음부터 끝까지 다시 읽어야 합니다. 이는 많은 시간을 소모하며, 보조원이 읽은 페이지 수에 따라 비용을 청구하기 때문에 많은 돈이 듭니다.
**"프롬프트 캐싱(Prompt Caching)"**은 이 보조원에게 마법의 형광펜을 주는 것과 같습니다. 만약 지침서가 바뀌지 않았다면, 보조원은 지침서의 첫 90%를 다시 읽는 과정을 건너뛰고, 바로 새로운 전화 통화 결과가 있는 부분으로 점프할 수 있습니다. 이는 시간과 비용을 절약해 줍니다.
하지만, 이 논문은 까다로운 질문을 던집니다: 이 마법의 형광펜이 항상 제대로 작동할까요, 아니면 우리가 망칠 수도 있을까요?
연구진은 세 곳의 주요 "보조원" 기업(OpenAI, Anthngths, Google)을 대상으로, 에이전트가 어려운 질문에 답하기 위해 긴 다단계 웹 검색을 수행하는 DeepResearch Bench라는 벤치마크를 통해 이를 테스트했습니다. 그들은 형광펜을 사용하는 세 가지 다른 방법을 시도했습니다:
- "단순한(Naive)" 접근 방식 (전체 컨텍스트): 새로운 전화 통화 결과까지 포함하여 모든 것에 형광펜을 칠합니다.
- "포스트잇(Sticky Note)" 접근 방식 (시스템 프롬프트만): 지침서에만 형광펜을 칠하고, 새로운 전화 통화 결과는 칠하지 않은 채로 둡니다.
- "깔끔한 구분(Clean Break)" 접근 방식 (도구 결과 제외): 지침서와 전화 통화 내용에 형광펜을 칠하되, 매 새로운 결과 뒤에 특별한 "정지" 표지판을 두어 형광펜이 실수로 다음 사람의 지저질한 메모까지 훑지 않도록 합니다.
연구 결과
1. 많은 돈을 아껴줍니다 (지갑의 승리)
어떤 방법을 사용하든, 마법의 형광펜은 엄청난 비용을 절감해 주었습니다. 기업에 따라 41%에서 80% 사이의 비용을 절감했습니다.
- 비유: 도서관에 들어갈 때마다 매번 새로운 도서 카드를 살 필요 없이, 이미 가지고 있는 카드를 그냥 사용하는 것과 같습니다.
2. 속도는 까다롭습니다 (교통 체증 문제)
돈을 아끼는 것은 쉬웠지만, 시간을 아끼는 것은 더 어려웠습니다.
- 놀라운 사실: 때때로 모든 것에 형광펜을 칠하는 것(Naive 접근 방식)이 오히려 보조원을 더 느리게 만들었습니다.
- 비유: 배달 기사가 자신이 배달하는 모든 패키지의 주소를 외우려고 노력한다고 상상해 보세요. 만약 단 한 번만 배달되고 다시는 배달되지 않을 패키지를 외우려고 한다면, 그는 그것을 외우느라 시간을 낭비하게 됩니다. 다음 패키지가 올 때, 그는 새로운 것을 만들기 위해 기존의 것을 "지워내는(un-memorize)" 과정을 거쳐야 합니다. 이 "기억 쓰기" 과정이 속도를 늦춥니다.
- 연구진은 안정적인 부분(지침서)에만 형광펜을 칠하고, 변동성이 큰 부분(전화 통화 결과)은 그대로 두면 보조원이 빠르게 유지된다는 것을 발견했습니다.
3. "캐시를 깨뜨리지 마라"는 규칙
가장 중요한 교훈은 어디에서 선을 그어야 하는가에 관한 것입니다.
- 만약 지침서 안에 변화하는 정보(예: "현재 시간: 오후 2:00", "사용자 ID: 123")를 넣으면, 마법의 형광펜이 깨집니다. 시스템은 지침서가 변경되었다고 판단하여, 형광펜 효과를 멈추고 처음부터 다시 읽기 시작합니다.
- 해결책: 지침서를 순수하고 정적인 상태로 유지하십시오. 만약 변화하는 정보를 반드시 포함해야 한다면, 지침서의 마지막 페이지에 포스트잇을 붙이듯 맨 끝에 배치하십시오. 이렇게 하면 지침서의 첫 99%는 여전히 형광펜이 칠해진 상태로 재사용 가능합니다.
결론
AI 에이전트가 길고 복잡한 작업을 수행하도록 구축하는 기업들을 위한 조언입니다:
- 네, 프롬프트 캐싱을 사용하십시오. 이는 비용을 획기적으로 줄여줄 것입니다.
- 하지만, 영리하게 행동하십시오. 모든 것에 그냥 켜두지는 마십시오.
- 최선의 전략: 안정적인 "지침서(System Prompt)"에만 캐싱을 적용하십시오. 변화하는 부분(도구 결과)은 캐싱 없이 자유롭게 흐르도록 두십시오. 이것이 저렴한 비용과 빠른 속도의 최적의 조합을 제공합니다.
만약 변화하는 부분을 캐싱하려고 시도한다면, "읽기"의 이득을 얻지도 못한 채 캐시를 "쓰는" 데 비용을 지불하게 되어, 오히려 시스템을 느리게 만들 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.