← 최신 논문
💬 NLP

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

이 논문은 광범위한 실제 시스템 배포 없이도 범용 CPU 상에서 서빙 정책의 확장 가능하고 비용 효율적인 평가를 가능하게 하기 위해, 프로그램 오케스트레이션, 도구 유발 간극(tool-induced gaps), KV 캐시 잔류를 포함한 멀티 턴 LLM 에이전트 서빙 역학을 정확하게 모델링하는 하드웨어 인식 시뮬레이터인 AGENTSERVESIM을 소개한다.

원저자: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 레스토랑을 운영하고 있다고 상상해 보세요.

과거의 방식 (표준 LLM 서빙):
과거에 AI 모델을 서빙하는 것은 패스트푸드 드라이브스루와 같았습니다. 모든 차(요청)가 들어와서 버거(단일 질문)를 주문하고, 그것을 받은 뒤 떠납니다. 주방은 그 차가 이전에 무엇을 했는지, 다음에 무엇을 할 것인지 신경 쓰지 않습니다. 각 주문은 독립적입니다. 만약 차가 나중에 다시 돌아온다면, 그것은 완전히 새로운 고객으로 취급됩니다.

새로운 방식 (멀티 턴 에이전트 서빙):
이제, 레스토랑에서 복잡한 요리 경연 대회를 개최한다고 상상해 보세요. 단 하나의 팀(하나의 "에이전트")이 테이블에 오랫동안 머뭅니다. 그들은 재료를 요청하고, 그러면 셰프는 팀이 양념을 찾으러 팬트리(도구 호출, "tool call")로 가는 동안 기다려야 하며, 팀이 돌아와서 다음 단계를 요청할 때까지 기다려야 합니다. 이 과정이 한 세션 동안 수십 번 반복됩니다.

  • 문제점: 셰프(AI)는 지금까지의 전체 레시피를 기억해야 합니다. 만약 팀이 팬트리에 가기 위해 테이블을 떠나 5분 동안 자리를 비운다면, 셰프는 카운터 위에 놓인 메모(KV 캐시)를 버려서는 안 됩니다. 왜냐하면 팀이 돌아왔을 때 그 메모가 다시 필요하기 때문입니다. 만약 팀이 돌아왔을 때 다른 테이블(다른 서버)로 이동한다면, 새로운 셰프는 처음부터 레시피 전체를 다시 읽어야 하며, 이는 시간 낭비가 됩니다.
  • 과제: 이를 관리하는 것은 어렵습니다. 우리는 결정해야 합니다: 이 메모를 비싸고 빠른 카운터에 계속 둘 것인가? 아니면 뒤쪽의 느린 선반으로 옮길 것인가? 팀이 너무 오래 자리를 비우면 버릴 것인가? 그리고 팀의 다음 차례를 처리할 셰프는 누구여야 하는가?

해결책: AGENTSERVESIM
저자들은 AGENTSERVESIM이라는 가상 레스토랑 시뮬레이터를 구축했습니다.

이런 복잡한 규칙들을 테스트하기 위해 실제의 비싼 슈퍼컴퓨터를 사용하는 대신(이는 엄청난 비용과 시간이 듭니다), 그들은 일반적인 저렴한 컴퓨터에서도 실행 가능한 디지털 트윈을 만들었습니다.

이 시뮬레이터가 작동하는 방식은 다음과 같습니다 (레스토랑 비유 사용):

  1. 프로그램 오케스트레이터 (헤드 웨이터):
    과거의 시뮬레이터에서는 모든 주문을 개별적으로 취급했습니다. 이 시뮬레이터에는 전체 요리 경연 대회를 하나의 단일 "프로그램"으로 추적하는 헤드 웨이터가 있습니다. 웨이터는 팀 A가 현재 팬트리에서 기다리는 중임을 알고 있으며, 팬트리 방문이 완료될 때까지 다음 주문이 시작되지 않도록 제어합니다.

  2. 도구 시뮬레이터 (팬트리 타이머):
    때때로 팀은 팬트리(grep이나 pytest 같은 도구 실행)에 가야 합니다. 이러한 방문은 밀리초에서 몇 분까지 걸릴 수 있습니다. 시뮬레이터에는 이러한 지연 시간을 정확하게 모사하는 특별한 타이머가 있어, 기다리는 동안 레시피 메모를 카운터에 둘지 아니면 선반으로 옮기는 것이 더 나은지 시스템이 테스트할 수 있게 합니다.

  3. 세션 인식 라우터 (테이블 배정자):
    만약 레스토랑에 여러 명의 셰프(서버)가 있다면, 이 라우터는 팀 A를 처음에 시작했던 것과 동일한 셰프에게 다시 보내려고 노력합니다. 이를 통해 레시피 메모를 그 자리에 그대로 유지하여 시간을 절약합니다. 만약 그 셰프가 너무 바쁘다면, 라우터는 메모를 새로운 셰프에게 옮기는 비용과 그냥 처음부터 다시 시작하는 비용을 계산합니다.

  4. KV 레지던시 모델 (메모 기록자):
    이것이 가장 똑똑한 부분입니다. 이 모델은 "레시피 메모"(KV 캐시)를 어디에 저장할지 결정합니다.

    • HBM (고속 카운터): 빠르지만 용량이 작습니다.
    • DRAM/CXL (뒤쪽 선반): 느리지만 용량이 큽니다.
    • 모델은 묻습니다: "팀이 10초 후에 돌아올 것인가, 아니면 10분 후에 돌아올 것인가?" 만약 10초 후라면, 메모를 카운터에 둡니다. 만약 10분 후라면, 카운터를 다른 팀들을 위해 비워두도록 메모를 선반으로 옮깁니다.

이것이 왜 중요한가요?
이러한 전략들을 실제 슈퍼컴퓨터에서 테스트하는 것은 새로운 레스토랑 레이아웃을 테스트하기 위해 실제로 레스토랑을 짓고, 직원을 고용하고, 몇 주 동안 운영해보는 것과 같습니다. 이는 매우 비싸고 느립니다.

  • 결과: 저자들은 자신들의 시뮬레이터를 실제 슈퍼컴퓨터(실제 AI 모델과 실제 하드웨어 사용)와 비교 테스트했습니다. 그 결과, 시뮬레이터가 "요리 경연 대회"가 얼마나 빨리 끝날지를 6% 미만의 오차로 예측한다는 것을 발견했습니다.
  • 이점: 이제 엔지니어들은 매번 비싼 슈퍼컴퓨터를 빌릴 필요 없이, 일반 노트북에서 수천 가지의 "만약에(what-if)" 시나리오를 실행하여 복잡한 AI 에이전트를 실행하는 최선의 방법을 찾아낼 수 있습니다.

요약하자면, 그들은 AI 에이전트를 위한 매우 정확한 "비행 시뮬레이터"를 구축했습니다. 이를 통해 연구자들은 실제 비행기를 추락시키거나(또는 연료비로 거금을 쓰는 일 없이) 복잡하고 다단계적인 AI 작업을 실행하는 방법을 연습하고 최적화할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →