← 최신 논문
💻 computer science

Agent-MIRUPD: Operationalizing LLM Agents for Microservices Incident Response Under Performance Degradation

본 논문은 관측 가능성 데이터를 구조화된 다단계 추론과 결합하여 마이크로서비스의 전체 장애 대응 라이프사이클을 자동화함으로써, 기존 베이스라인 대비 진단 속도, 완화 정확도 및 토큰 효율성을 크게 개선한 LLM 기반 에이전트 프레임워크인 Agent-MIRUPD를 제안한다.

원저자: Nayereh Rasouli, Matthijs Jansen, Alexandru Iosup, Cristian Klein, Erik Elmroth

게시일 2026-09-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nayereh Rasouli, Matthijs Jansen, Alexandru Iosup, Cristian Klein, Erik Elmroth

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

뱅킹 앱부터 의료 플랫폼에 이르기까지 현대의 디지털 서비스는 하나의 애플리케이션이 수십 개의 작고 독립적인 프로그램인 마이크로서비스로 분해되는 복잡한 아키텍처에 점점 더 많이 의존하고 있습니다. 이 조각들은 컨테이너 내에서 실행되며, 쿠버네티스(Kubernetes)라고 알려진 자동화된 시스템에 의해 관리됩니다. 쿠버네티스는 교통 관제사처럼 작동하여, 만약 한 조각이 충돌하면 이를 재시작하여 서비스가 계속 유지되도록 보장합니다. 이러한 설정은 놀라운 유연성을 제공하지만, 새로운 종류의 문제를 만들어냅니다. 즉, 때때로 서비스가 완전히 중단되지 않고 단순히 느려지거나 비정상적으로 동작하는 경우입니다. 이러한 미묘한 문제들은 흔히 '그레이 페일러(gray failures)' 또는 성능 저하라고 불리는데, 시스템이 기술적으로는 여전히 "살아있는" 상태이기 때문에 포착하기가 매우 어렵습니다. 인간 엔지니어들에게 특정 서비스가 왜 지연되는지 진단하는 작업은 방대한 양의 데이터 로그, 성능 지표, 네트워크 트레이스를 샅샅이 뒤져야 하는 일이며, 이는 느리고 오류가 발생하기 쉬우며 매우 고된 작업입니다.

우메오 대학교(Umeå University)와 브리 으 대학(Vrije Universiteit Amsterdam)의 연구진은 이 문제를 해결하기 위해 인공지능 에이전트를 사용하여 문제 탐색 및 해결의 전 과정을 관리하는 새로운 접근 방식을 개발했습니다. 이 시스템은 단순히 명백한 충돌을 찾는 것에 그치지 않고, 서비스가 저하되는 시점을 감지하고, 정확히 왜 그런 일이 발생하는지 파악한 다음, 해결책을 제안하도록 설계되었습니다. 이들의 연구의 핵심은 Agent-MIRUPD라는 프레임워크로, 이는 마치 숙련된 엔지니어처럼 복잡한 상황을 추론할 수 있는 디지털 조수 역할을 수행하면서도 컴퓨터의 속도를 갖추고 있습니다. 연구진은 실제 세계의 마이크로서비스 장애를 모방한 통제된 환경에서 이 시스템을 테스트했으며, 여기에는 서비스가 시간이 지남에 따라 노후화되고 느려지는 시나리오가 포함되었습니다. 그 결과, 이 시스템이 높은 정확도로 전체 사고 대응 사이클을 처리할 수 있음을 발견했습니다.

이 시스템은 문제 해결 과정을 탐지(detection), 국지화(localization), 분석(analysis), 완화(mitigation)라는 네 가지 뚜렷한 단계로 나누어 작동합니다. 먼저, 에이전트는 시스템을 지속적으로 모니터링하여 문제가 있는지 확인합니다. 문제가 발견되면 두 번째 단계로 넘어가 정확히 어떤 서비스가 원인인지를 찾아냅니다. 세 번째 단계에서는 메모리 누수나 설정 오류와 같은 근본 원인을 이해하기 위해 더 깊이 파고듭니다. 마지막으로 완화 단계에서는 시스템을 복구하기 위해 어떤 조치를 취할지 결정합니다. 이 설계의 중요한 특징은 불확실성을 다루는 방식입니다. 설정 오류와 같이 명확한 문제의 경우, 에이전트는 자동으로 수정 사항을 적용할 수 있습니다. 그러나 해결책이 명확하지 않은 더 미묘한 문제의 경우에는 시스템이 잠시 멈추고 변경을 수행하기 전에 인간 운영자의 승인을 요청합니다. 이러한 "인간 참여형(human-in-the-loop)" 접근 방식은 AI가 도움을 주려다 오히려 상황을 악화시키는 실수를 하지 않도록 보장합니다.

이를 구현하기 위해 연구진은 AI에게 실행 중인 프로그램의 상태를 확인하거나 에러 로그를 읽는 것과 같이 특정 정보를 쿼리할 수 있는 특화된 도구 세트를 갖추었습니다. AI에게 가공되지 않은 로우 데이터를 직접 입력하는 대신, 이 도구들은 요약되고 구조화된 답변을 제공하여 AI가 과부하에 걸리지 않고 더욱 효과적으로 추론할 수 있도록 돕습니다. 또한 시스템은 '단계별 컨텍스트 전파(stage-context propagation)' 기술을 사용하는데, 이는 한 단계에서 도출된 결론이 다음 단계로 직접 전달됨을 의미합니다. 예를 들어, 에이전트가 결함이 있는 서비스를 식별하면, 그 정보는 즉시 분석 단계의 시작점으로 사용되어 AI가 조사를 처음부터 다시 시작할 필요가 없게 합니다. 이러한 연속성은 시스템이 이전 방식보다 훨씬 빠르게 진단 과정을 진행할 수 있게 해줍니다.

연구진이 기존 도구 및 다른 AI 에이전트들과 이 시스템을 비교 테스트했을 때, 결과는 매우 유의미했습니다. 서비스가 완전히 실패하는 기능적 결함 시나리오에서 이 시스템은 최대 90%의 정확도를 달성했습니다. 서비스가 멈추지는 않지만 느려지는 더 어려운 성능 저하 시나리오에서도 85%의 정확도를 기록했습니다. 또한 이 시스템은 경쟁 모델들보다 훨씬 빠르고 효율적이라는 것을 입증했습니다. 문제의 근본 원인을 찾는 데 걸리는 시간을 244초에서 52초로 단축했습니다. 게다가 AI가 사고를 생각하는 데 사용하는 기본 단위인 토큰(tokens) 측면에서 계산 자원을 51.3% 적게 사용했습니다. 문제 해결 측면에서 보면, 표준 베이스라인 에이전트와 비교했을 때 완화 조치의 정확도를 40%에서 70%로 향상시켰습니다.

이 연구는 인간의 감독이 얼마나 중요한지도 강조했습니다. 성능 관련 문제에 대해 시스템이 완전히 독자적으로 행동하도록 허용했을 때, 이러한 문제들은 종면상 서로 다른 트레이드오프를 가진 여러 가지 가능한 해결책이 존재하기 때문에 최선의 해결책을 선택하는 데 어려움을 겪기도 했습니다. 인간 전문가가 제안된 조치를 검토하고 승인하도록 함으로써, 시스템은 더 신뢰할 수 있는 복구 전략을 선택할 수 있었습니다. 연구진은 AI가 자신의 추론 과정을 명확하게 설명하고 인간 운영자가 그 선택을 검증했을 때, 전체적인 복구 효과가 증가한다는 것을 발견했습니다. 이는 가장 강력한 접근 방식이 인간 엔지니어를 대체하는 것이 아니라, 데이터 분석과 초기 진단과 같은 힘든 작업을 처리해 주는 스마트한 조수를 제공하고, 복잡한 해결책에 대한 최종 결정은 인간의 판단에 맡기는 것임을 시사합니다.

연구진은 현재의 작업이 시뮬레이션 단계이며, 실제 운영 환경은 훨씬 더 복잡하다는 점을 인정하고 있습니다. 그들은 실제 산업 워크로드를 대상으로 시스템을 테스트하고, 더 작고 저렴한 모델을 사용하여 AI의 효율성을 높이는 방법을 탐구할 계획입니다. 그러나 현재의 연구 결과는 마이크로서비스의 전체 사고 대응 라이프사이클을 위해 AI 에이전트를 운용하는 것이 가능하다는 것을 보여줍니다. 자동화된 탐지와 인간의 감독을 결합함으로써, 이 시스템은 큰 혼란을 일으키기 전까지는 눈에 띄지 않는 미묘하고 서서히 타오르는 실패들을 처리할 수 있는, 더 탄력적인 디지털 인프라를 향한 실질적인 경로를 제시합니다. 이 연구는 적절한 설계가 뒷받 heavy lifting(힘든 작업)을 수행하는 데 있어 인공지능이 현대 사회의 핵심 시스템을 원활하게 유지하는 신뢰할 수 있는 파트너가 될 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →