Learning Agent Execution for KV-Cache Management in Agentic Serving
이 논문은 사전 정의된 워크플로 그래프 없이도 에이전트 실행 전이를 온라인으로 학습하여 캐시 제거 및 프리페칭을 선제적으로 관리함으로써, 멀티 에이전트 LLM 서빙의 히트율을 크게 높이고 지연 시간을 줄이는 에이전트 인지형 KV-캐시 런타임인 CacheScout를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 세계에서, 스마트한 비서를 구축하는 새로운 방식이 자리를 잡았습니다. 복잡한 문제를 한 번에 해결하기 위해 단 하나의 전지전능한 컴퓨터 두뇌에 의존하는 대신, 개발자들은 이제 작업을 전문화된 디지털 작업자들의 팀으로 세분화합니다. 여행 플래너를 상상해 보십시오. 이 플래너는 먼저 한 에이전트에게 항공권을 찾으라고 요청한 다음, 그 업무를 호텔을 예약할 다른 에이전트에게 넘기고, 마지막으로 식당을 찾을 세 번째 에이전트에게 전달합니다. 이러한 각 에이전트는 학습한 패턴을 바탕으로 문장의 다음 단어를 예측하는 소프트웨어의 일종인 거대 언어 모델(LLM)입니다. 이를 수행하기 위해 소프트웨어는 '키-값 캐시(key-value cache)'라고 불리는 단기 기억 속에 방대한 양의 정보를 보유해야 합니다. 이 메모리는 모델이 게임의 규칙, 사용할 수 있는 도구의 정의, 그리고 어떻게 행동해야 하는지에 대한 예시를 보관하는 작업 공간 역할을 합니다. 새로운 에이전트가 대화에 참여할 때마다 각 에이전트는 자신만의 지침과 예시를 가져오며, 이는 시스템이 사용자의 구체적인 질문에 답하기 전에 반드시 처리해야 하는 커다란 데이터 덩어리를 생성합니다.
문제는 이러한 디지털 팀이 역동적이라는 점입니다. 첫 번째 에이전트가 업무를 마치면 시스템은 즉시 완전히 다른 에이전트로 전환하거나, 나중에 다시 첫 번째 에이전트로 돌아갈 수도 있습니다. 이러한 AI 팀을 실행하는 현재의 컴퓨터 시스템은 메모리를 반응적으로 관리합니다. 이들은 가장 최근에 사용된 정보를 유지하고 새로운 요청을 위한 공간을 만들기 위해 오래된 정보를 폐기합니다. 이는 단순한 대화에는 잘 작동하지만, 다중 에이전트 팀에서는 좌절스러운 비효율성을 초래합니다. 시스템은 특정 에이전트가 몇 초 동안 말하지 않았다는 이유만으로 그 에이전트의 고정된 지침과 예시를 버리곤 하는데, 실제로는 그 에이전트가 바로 다음 단계에서 다시 호출될 가능성이 매우 높음에도 불구하고 말입니다. 에이전트가 돌아올 때마다 시스템은 그 모든 지침을 처음부터 다시 읽고 처리해야 하며, 이는 시간과 컴퓨팅 자원을 낭비하게 만듭니다. 이러한 폐기와 재학습의 순환은 전체 동작을 느리게 만들어, AI를 느리고 비용이 많이 드는 것처럼 느껴지게 합니다.
캘리포니아 대학교 산타크루즈 캠퍼스와 여러 기관의 연구진은 이 문제를 해결하기 위한 새로운 접근 방식인 '캐시스카우트(CacheScout)'를 개발했습니다. 이 시스템은 단순히 과거에 일어난 일을 관찰하는 대신, 다음에 일어날 일을 예측하는 법을 배웁니다. 이 시스템은 대화의 흐름을 무작위적인 사건의 연속이 아니라, 서로 다른 작업자들 사이의 전이(transition) 패턴으로 취급합니다. 여행 에이전트 다음에 호텔 에이전트가 오거나, 코딩 에이전트가 리뷰 에이전트로 전환되는 빈도를 관찰함으로써, 시스템은 실행 과정에서 워크플로의 정신적 지도(mental map)를 구축합니다. 개발자가 미리 작성한 스크립트나 지도가 없어도, 시스템은 매 요청을 처리할 때마다 연결 관계를 학습하며 자신의 이해도를 업데이트합니다.
이 새로운 시스템의 핵심은 AI 에이전트와 컴퓨터 하드웨어 사이에 위치하는 가벼운 레이어(layer)입니다. 에이전트가 작업을 마치면, 이 레이어는 대화 기록을 살펴보고 다음에 어떤 에이전트가 말할 가능성이 가장 높은지 예측합니다. 시스템이 다음 단계를 확신하면, 속도를 높이기 위해 두 가지 구체적인 조치를 취합니다. 첫째, 오래된 데이터를 삭제하여 공간을 확보해야 할 때, 시스템은 곧 돌아올 것으로 예측되는 에이전트의 지침을 삭제하기를 거부합니다. 즉, 해당 에이전트가 한동안 말을 하지 않았더라도 과거의 사용량보다는 미래의 중요성을 기준으로 이 귀중한 메모리 덩어리들을 보호합니다. 둘째, 다음 요청을 기다리는 동안, 시스템은 예측된 에이전트를 위해 조용하고 보이지 않게 메모리를 준비합니다. 사용자가 요청하기도 전에 필요한 지침을 빠른 메모리에 미리 로드하여, 에이전트가 마침내 작업을 시작할 때 지연 없이 즉시 시작할 수 있도록 합니다.
연구진은 여행 계획, 수학 문제 풀이, 소프트웨어 코드 작성 등 실제 작업에서 이 시스템을 테스트했습니다. 그 결과, 에이전트의 행동 패턴을 기억함으로써 기존보다 훨씬 더 자주 적절한 정보를 메모리에 유지할 수 있음을 발견했습니다. 테스트에서 기존 메모리를 성공적으로 재사용하는 비율이 10~18%포인트 상승했습니다. 이러한 개선은 직접적인 속도 향상으로 이어졌습니다. 답변의 첫 단어가 나타나는 데 걸리는 시간은 최대 45% 감소했으며, 단일 대화 턴을 완료하는 전체 시간은 거의 40% 단축되었습니다. 또한 시스템은 더 많은 요청을 동시에 처리하여, 초당 완료할 수 있는 총 작업 수를 최대 57%까지 증가시켰습니다.
결정적으로, 연구진은 이 접근 방식이 고정된 워크플로가 아닐 때도 작동한다는 것을 보여주었습니다. 많은 현대적 애플리케이션에서 다음 단계는 AI 스스로 실시간으로 결정하므로, 경로는 예측 불가능하게 변할 수 있습니다. 새로운 시스템은 이러한 유동성에 적응하여, 발생하는 대로 가장 흔한 경로를 학습하고 그에 따라 예측을 조정합니다. 또한 훨씬 더 크고 복잡한 AI 모델에서도 효과적임을 입증하였으며, 메모리 요구 사항이 크게 높아져도 속도 이점을 유지했습니다. 이 시스템은 컴퓨터를 느리게 만들거나 복잡한 새로운 하드웨어를 요구하지 않고도 이 모든 것을 달성하며, 단순히 메모리 관리 프로세스에 작은 지능을 더함으로써 수동적인 저장 시스템을 다음에 올 일을 알고 있는 능동적인 참여자로 변화시킵니다.
이러한 발견은 효율적인 AI 서비스의 미래가 단순히 데이터 자체가 아니라 작업의 맥락을 이해하는 데 있다는 것을 시사합니다. 여행 에이전트 다음에 호텔 에이전트가 올 가능성이 높다는 것을 인식함으로써, 시스템은 모든 순간을 새로운 시작으로 취급하는 대신 대화를 하나의 연속적인 여정으로 보기 시작합니다. 과거에 반응하는 것에서 미래를 준비하는 것으로의 이러한 전환은 디지털 팀이 훨씬 더 빠르고 효율적으로 작동하게 하여, 복잡한 AI 애플리케이션의 배포를 늦추던 병목 현상을 제거합니다. 그 결과, 시스템은 더욱 응답성이 뛰어나고 유능해지며, 차세대 인공지능 서비스의 특징인 복잡하고 다단계적인 과업들을 처리할 수 있게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.