← 최신 논문
💻 computer science

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

본 논문은 비결정론적인 제어 흐름의 문제를 극복하기 위해 세밀한 트레이스 리플레이 방식을 활용함으로써, 다양한 에이전틱 AI 워크로드 하에서 LLM 서빙 시스템의 재현 가능한 부하 테스트와 상세한 성능 프로파일링을 가능하게 하는 벤치마킹 프레임워크인 XPerf를 소개한다.

원저자: Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능의 풍경 속에서, 단순히 질문에 답하는 것을 넘어 실제로 행동하는 새로운 세대의 소프트웨어가 등장했습니다. '에이전트'라고 불리는 이 프로그램들은 복잡한 과업을 더 작은 단계들로 나누고, 정보를 수집하기 위해 디지털 도구를 사용하며, 찾아낸 정보에 기반하여 의사결정을 내릴 수 있습니다. 매 응답마다 새로운 프롬프트를 기다리는 일반적인 챗봇과 달리, 에이전트는 연구 프로젝트를 계획하고, 데이터를 위해 웹을 검색하고, 그 데이터를 분석할 코드를 작성한 뒤, 결과에 따라 자신의 접근 방식을 개선할 수도 있습니다. 이 과정은 생각하고 행동하는 연속적인 루프를 포함하며, 소프트웨어가 단 한 번의 세션 동안 자신의 여정을 안내하기 위해 거대 언어 모델을 여러 번 호출하는 과정을 거칩니다.

이러한 에이전트들이 현실 세계에서 유용하게 쓰이기 위해서는, 이들을 구동하는 컴퓨터 시스템이 믿기지 않을 정도로 빠르고 효율적이어야 합니다. '서빙 엔진(serving engines)'이라 불리는 이 시스템들은 언어 모델의 계산을 처리하는 역할을 담당합니다. 하지만 이 엔진들의 성능을 테스트하는 것은 매우 어렵습니다. 왜냐하면 에이전트가 밟아가는 경로는 예측 불가능하기 때문입니다. 사람이 어떤 날은 다섯 단계로 문제를 해결하고 다음 날은 열 단계로 해결하는 것과 마찬가지로, 에이전트의 여정은 설령 정확히 동일한 시작 명령을 받더라도 실행될 때마다 매번 달라집니다. 이러한 예측 불가능성은 엔지니어들이 시스템이 진정으로 빠른 것인지, 아니면 단지 특정 테스트가 운 좋게 간단하게 진행되었던 것인지 알기 어렵게 만듭니다.

이 문제를 해결하기 위해 일리노이 대학교와 IBM 리서치의 연구진은 'XPerf'라는 새로운 도구를 개발했습니다. 이 시스템은 엔지니어가 실제 작업 중에 에이전트가 밟아간 정확한 경로를 기록한 다음, 그 동일한 경로를 반복해서 재생하여 서로 다른 컴퓨터 시스템을 테스트할 수 있게 해줍니다. 결정과 행동의 특정 순서를 포착함으로써, XPerf는 우연의 요소를 제거합니다. 이를 통해 엔지니어가 새로운 소프트웨어 업데이트를 테스트할 때, 무작위적인 단계들을 어떻게 처리할지 추측하는 대신, 정확히 동일한 워크로드를 기준으로 비교할 수 있도록 보장합니다. 이러한 정밀함은 병목 현상을 식별하고 왜 시스템이 압박 아래에서 느려지는지를 이해하는 데 매우 중요합니다.

연구진은 XPerf를 사용하여 코드 작성 및 디버깅 도구부터 심층 연구 수행 및 복잡한 질문 답변 시스템에 이르기까지 8가지 유형의 에이전트 애플리케이션을 연구했습니다. 그들은 이 애플리케이션들이 표준 챗봇과는 매우 다르게 동작한다는 것을 발견했습니다. 일반적인 대화는 몇 차례의 주고받는 메시지로 이루어질 수 있지만, 에이전트는 단 하나의 사용자 요청을 완료하기 위해 수십 번의 내부 호출을 트리거할 수 있습니다. 어떤 경우에는 코딩 에이전트에 대한 단 하나의 요청이 언어 모델에 대해 평균 17번의 별도 호출을 발생시켰으며, 일부 요청은 거의 40번의 호출을 일으키기도 했습니다. 이러한 복잡성은 시스템이 의존적인 작업들의 망을 관리해야 함을 의미하며, 여기서 한 단계는 이전 단계가 완료될 때까지 시작될 수 없습니다.

연구의 주요 발견 중 하나는 이러한 시스템의 성능이 요청이 처리되는 방식에 매우 민감하다는 것이었습니다. 연구진은 많은 에이전트가 동시에 실행될 때, 시스템이 이전 단계의 맥락을 기억하는 데 어려움을 겪는 경우가 많다는 것을 관찰했습니다. 언어 모델은 이미 처리한 정보를 다시 읽지 않기 위해 '캐시(cache)'라고 불리는 일종의 단기 기억에 의존합니다. 그러나 시스템에 부하가 걸리면, 새로운 요청을 위한 공간을 만들기 위해 나중에 다시 필요할 정보임에도 불구하고 오래된 정보를 밀어내는 경우가 발생합니다. 이는 컴퓨터가 모든 것을 처음부터 다시 계산하게 만들어 시간과 에너지를 낭비하게 합니다. 연구는 이러한 '스래싱(thrashing, 쓰레싱)' 현상이 시스템 속도를 크게 저하시킬 수 있으며, 요청 수가 증가할 때 일부 애플리케이션의 속도가 거의 40%까지 떨어질 수 있음을 보여주었습니다.

연구팀은 또한 여러 컴퓨터 프로세서를 관리하는 다양한 전략들이 얼마나 효과적인지 테스트했습니다. 그들은 단순히 가용한 모든 프로세서에 작업을 균등하게 분산시키는 것이 항상 최선의 결과를 가져오는 것은 아니라는 점을 발견했습니다. 사실, 단일 에이전트의 여정 중 모든 단계를 동일한 프로세서에 유지하는 전략이 훨씬 더 효율적이었습니다. 이 접근 방식은 시스템이 필요한 맥락을 메모리에 유지할 수 있게 하여, 정보를 재계산해야 하는 상황을 방지했습니다. XPerf를 사용하여 동일한 워크로드를 다양한 조건에서 재생해 본 결과, 연구진은 이 타겟팅된 접근 방식이 작업을 무작위로 분산시키는 표준 방식보다 처리 속도를 3배 이상 향상시킨다는 것을 명확히 확인할 수 있었습니다.

XPerf는 단순히 속도를 측정하는 것을 넘어, 컴퓨터 하드웨어 자체의 내부 작동 방식에 대한 상세한 시각을 제공했습니다. 연구진은 컴퓨터 메모리가 얼마나 사용되고 있는지, 그리고 프로세서 칩이 얼마나 열심히 작동하고 있는지를 정확히 볼 수 있었습니다. 그들은 시스템이 부실한 메모리 관리로 인해 정보를 재계산해야 할 때, 컴퓨터의 프로세서들이 열심히 일하고는 있지만 유용한 결과물을 만들어내지는 못하고 있다는 것을 발견했습니다. 이는 높은 노력 대비 낮은 효율의 사례였습니다. 이러한 수준의 상세한 정보는 엔지니어들이 단순히 시스템이 느리다는 것뿐만 아니라, 정확히 '왜' 느린지를 이해하여 문제의 원인이 되는 특정 소프트웨어 부분을 수정할 수 있도록 돕습니다.

또한 연구는 에이전트가 설계되는 방식이 그것이 실행되는 컴퓨터만큼이나 중요하다는 점을 강조했습니다. 어떤 애플리케이션들은 더 똑똑해서가 아니라, 컴퓨터의 메모리와 더 잘 작동하도록 설계되었기 때문에 훨씬 더 효율적이라는 것이 밝혀졌습니다. 예를 들어, 메시지를 보낼 때마다 변하는 타임스탬프를 추가하는 한 연구 도구는 실수로 메모리를 재사용하는 능력을 파괴하여, 시스템이 매번 처음부터 다시 시작하게 만들었습니다. 이러한 불필요한 변경 사항을 제거함으로써 연구진은 시스템 효율성을 크게 개선할 수 있었습니다. 이는 소프트웨어가 작성되는 방식의 작은 변화가 성능에 엄청난 영향을 미칠 수 있음을 시사합니다.

궁극적으로 XPerf는 인공지능 에이전트의 세계를 비추는 신뢰할 수 있는 거울 역할을 합니다. 이는 개발자들이 무작위적인 변동이라는 왜곡 없이 자신의 시스템을 명확하게 볼 수 있게 해줍니다. 이러한 복잡한 애플리케이션을 테스트하고, 측정하고, 이해할 수 있는 방법을 제공함으로써, 이 도구는 차세대 AI 소프트웨어가 견고하고 빠르며 현실 세계의 요구를 충족할 준비가 되도록 돕습니다. 연구진은 이 도구를 대중에게 공개하여, 모두를 위한 더 나은 시스템의 발전을 가속화하기를 희망하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →