← 최신 논문
💻 computer science

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

본 논문은 다중 턴 LLM 에이전트 워크플로우에서 도구 호출 대기 기간 동안 캐시를 선택적으로 유지하기 위해 동적 시간-생존 (TTL) 메커니즘을 적용하는 새로운 KV 캐시 관리 시스템인 CacheTTL 을 소개하며, 이를 통해 기존 교체 정책에 비해 작업 완료 시간을 8 배 이상 단축하고 처리량을 향상시켰음을 보여줍니다.

원저자: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 여러 고객에게 복잡한 요리를 동시에 제공하는 매우 효율적이고 초고속인 주방을 운영한다고 상상해 보세요. 이곳에는 마스터 셰프 (AI) 가 있습니다.

문제: "중단하고 다시 시작하는" 주방

일반적인 AI 채팅봇에서는 셰프가 요리를 한 접시 완성해 서빙한 후 즉시 다음 요리를 시작합니다. 주방이 붐비면 셰프는 현재 요리를 위해 반쯤 준비해 둔 재료를 다른 고객의 주문을 위한 공간 확보를 위해 버립니다. 이는 간단한 대화에는 잘 작동합니다.

하지만 현대의 AI "에이전트"는 다릅니다. 그들은 단순히 대화만 하는 것이 아니라 행동합니다. 그들은 생각한 후 도구 (날씨 확인이나 웹 검색 등) 를 호출하고, 그 결과를 기다린 뒤, 그제서야 같은 요리를 계속합니다.

현재 시스템의 결함은 다음과 같습니다:

  1. 셰프가 요리를 시작합니다.
  2. 셰프가 도구를 호출하기 위해 잠시 멈춥니다 (예: "날씨 확인").
  3. 셰프가 "일시 정지" 상태이므로 주방 시스템은 주문이 완료된 것으로 간주합니다. 다른 주문을 위한 공간을 확보하기 위해 반쯤 준비된 재료 (KV 캐시) 를 버립니다.
  4. 도구가 2 초 만에 완료됩니다. 셰프는 계속할 준비가 되었습니다.
  5. 재앙: 재료가 사라졌습니다! 셰프는 먼 창고 (CPU 오프로딩) 에서 재료를 다시 사야 하거나, 처음부터 모든 것을 다시 다듬어야 합니다 (재계산).
  6. 더 나쁜 점은 재료가 버려졌기 때문에 셰프는 다시 작업대를 차지하기 위해 다른 고객들 뒤에 줄을 서서 기다려야 한다는 것입니다.

이 현상이 반복됩니다. 에이전트가 문제를 해결하는 데 20 단계를 거친다면, 작업을 20 번이나 다시 하고 줄을 서는 데 시간을 낭비할 수 있습니다.

해결책: CacheTTL ("준비 유지" 타이머)

연구진들은 CacheTTL이라는 새로운 시스템을 구축했습니다. 이는 모든 주문에 대해 셰프에게 특별한 "준비 유지" 타이머를 제공하는 것과 같습니다.

셰프가 도구를 호출하기 위해 멈출 때 재료를 즉시 버리는 대신, 시스템은 이렇게 말합니다: "잠깐! 이 셰프는 2 초 후에 돌아올지도 모릅니다. 재료를 일정 시간 (Time-To-Live, 즉 TTL) 동안 조리대 위에 보관합시다."

간단한 작동 원리는 다음과 같습니다:

  1. 스마트 예측: 시스템이 과거 데이터를 분석합니다. "보통 셰프가 '날씨 확인'을 호출하면 약 2 초가 걸립니다. '웹 검색'을 호출하면 5 초가 걸립니다."
  2. 타이머: 그 예측을 기반으로 타이머를 설정합니다. 도구 호출에 2 초가 예상되면 재료는 2.5 초 동안 조리대 위에 남아 있습니다.
  3. 성과:
    • 셰프가 제 시간에 돌아오면: 재료가 여전히 있습니다! 셰프는 중단한 곳에서 바로 계속합니다. 다시 다듬거나 줄을 서서 기다릴 필요가 없습니다.
    • 셰프가 늦으면: 도구가 2 초 대신 10 초가 걸리면 타이머가 만료됩니다. 시스템은 주방이 막히지 않도록 재료를 안전하게 버리고 다른 고객들을 위한 공간을 확보합니다.

이것이 기존 시스템보다 더 나은 이유는 무엇일까요?

이전 시스템은 재료를 보관할지 말지 추측하려 했지만, 한 가지 측면만 고려했습니다: "재료를 다시 사는 것이 비싼가?" 그들은 더 큰 문제를 무시했습니다: "셰프가 다시 일을 시작하기 위해 줄을 서서 기다리는 시간은 얼마나 될까?"

CacheTTL은 둘 다를 고려합니다:

  • 음식을 다시 만드는 비용.
  • 줄을 서서 기다리는 비용 (대기 지연).

이는 전체적으로 가장 많은 시간을 절약하기 위해 재료를 조리대 위에 보관할 완벽한 시간을 계산합니다.

결과

연구진들은 소프트웨어 버그를 해결하고, 웹을 검색하며, 코드를 작성하는 실제 AI 에이전트들을 통해 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • 속도: 일부 실제 테스트에서 에이전트들이 작업을 최대 8 배 더 빠르게 완료했습니다.
  • 효율성: 주방 (GPU) 이 멈추지 않고 더 많은 주문을 동시에 처리할 수 있었습니다.
  • 견고성: 도구 호출이 예상보다 오래 걸리더라도 시스템은 충돌하거나 멈추지 않았습니다. 단지 타이머가 만료되도록 하고 다음으로 넘어갔습니다.

한 마디로

CacheTTL은 셰프가 전화를 하기 위해 멈췄을 때, 그들이 요리를 끝낸 것이 아니라는 것을 아는 스마트한 주방 관리자처럼 작동합니다. 재료를 딱 알맞은 시간 동안 준비된 상태로 유지함으로써 셰프가 처음부터 다시 시작하거나 줄을 서서 기다리는 일을 막아 주방 전체가 훨씬 더 매끄럽고 빠르게 운영되도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →