← 최신 논문
💻 computer science

MARCA: Multi-Agent Root Cause Analysis with Multi-Modal Data

이 논문은 높은 정확도와 효율성을 달성하는 동시에 토큰 사용량을 줄이고 데이터 프라이버시를 보장하기 위해 컨트롤러-실행자-투표자(controller-executor-voter) 아키텍처를 사용하여 분산 시스템의 근본 원인 분석 문제를 해결하는 멀티 에이전트 프레임워크인 MARCA를 제안한다.

원저자: Yidan Wang

게시일 2026-09-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yidan Wang

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 소프트웨어 시스템은 더 이상 단일한 모놀리식 기계가 아닙니다. 이들은 서로 끊임없이 대화하는 마이크로서비스라고 불리는 작고 독립적인 프로그램들이 모인 거대하고 복잡한 도시와 같습니다. 이 디지털 도시의 한 부분이 비틀거리면 전체 네트워크가 멈춰 설 수 있으며, 이는 결제 지연부터 웹사이트 다운까지 다양한 문제를 일으킵니다. 정확히 어떤 작은 프로그램이 붕괴를 일으켰는지 찾아내는 작업은 근본 원인 분석(Root Cause Analysis)이라고 알려져 있습니다. 수십 년 동안 엔지니어들은 이 탐색 과정을 자동화하려고 노력해 왔지만, 로그, 성능 수치, 에러 코드와 같은 데이터의 엄청난 양 때문에 전통적인 도구들은 이를 따라잡기가 어렵습니다. 최근에는 대규모 언어 모델(Large Language Models)로 알려진 강력한 컴퓨터 프로그램들이 인간 전문가처럼 이 무질서한 데이터 스트림을 읽고 이해하는 데 유망한 가능성을 보여주었습니다. 하지만 이 모델들은 자신들만의 장애물에 직면해 있습니다. 한꺼번에 너무 많은 정보가 들어오면 압도당할 수 있고, 실행 비용이 많이 들며, 민감한 기업 데이터를 외부 서버로 전송하는 것은 개인정보 보호 문제를 야기합니다.

룩셈부르크 대학교의 한 연구자가 이러한 문제들을 해결하기 위해 MARCA라고 불리는 새로운 접근 방식을 개발했습니다. 모든 것을 읽고 답을 추측하는 하나의 거대한 컴퓨터 프로그램에 의존하는 대신, MARCA는 이 업무를 소수의 전문화된 디지털 작업자 팀으로 나눕니다. 마치 한 명은 조사를 지휘하고, 다른 한 명은 특정 단서를 수집하며, 세 번째 사람은 최종 결정을 내리기 위해 증거를 검토하는 탐정 팀을 상상해 보십시오. 이 팀은 질문을 던지고, 데이터를 수집하고, 확신이 생길 때까지 이론을 정교화하는 루프 속에서 함께 작동하며 진정한 실패의 원인을 찾아냅니다. 업무를 분담함으로써, 이 시스템은 방대한 데이터에 발이 묶이는 것을 피하고, 민감한 정보를 로컬 서버에 유지하여 개인정보를 보호하며, 이전 방식보다 적은 컴퓨팅 자원을 사용합니다.

연구자는 자신이 직접 구축한 시뮬레이션 결제 플랫폼과 다른 과학자들이 사용하는 공개 벤치마크를 통해 이 다중 에이전트 시스템을 테스트했습니다. 연구진은 프로세서를 과부하하거나, 메모리를 가득 채우거나, 네트워크 연결을 차단하는 등 다양한 유형의 결함을 시스템에 주입하여 MARCA가 범인을 정확히 식별할 수 있는지 확인했습니다. 결과는 명확했습니다. 이 새로운 시스템은 약 77%의 확률로 근본 원인을 정확하게 찾아냈는데, 이는 기존의 가장 우수한 방법들이 62% 수준에 머물렀던 것과 비교하면 상당한 개선입니다. 또한 이 시스템은 네트워크 지연과 메모리 부족을 구분하는 것과 같이 서로 다른 유형의 실패를 구별하는 데 훨씬 뛰어난 성능을 보였으며, 실제 시스템에서 발견되는 무질서하고 중첩된 신호들을 처리할 수 있음을 시사하는 높은 정확도 점수를 달성했습니다.

이 접근 방식이 차별화되는 점은 정보의 흐름을 처리하는 방식입니다. 전통적인 방식은 종-종 가용한 모든 데이터를 단일 모델에 한꺼번에 입력하려고 시도하는데, 이는 시스템을 혼란스럽게 하거나 모든 것을 담기 위해 중요한 세부 사항을 무시하게 만들 수 있습니다. 반면, MARA는 집중력 있는 조사관처럼 행동합니다. 시스템은 문제가 감지된 지점에서 시작하여 그 원인으로 이어지는 연결 고리들을 체계적으로 점검합니다. 각 단계에서 '컨트롤러' 에이전트는 다음에 무엇을 살펴볼지 결정하고, '실행자' 에이전트는 전문 도구를 사용하여 관련 로그나 성능 수치를 가져오며, '투표자' 에이전트는 이러한 발견을 결합하여 용의자 목록을 업데이트합니다. 이 과정은 증거가 특정 서비스 하나를 강력하게 가리킬 때까지 반복됩니다. 이 방식은 시스템이 무관한 데이터를 무시할 수 있게 하여 작업을 관리 가능하고 효율적으로 만듭니다.

이 연구는 단순히 더 강력한 언어 모델을 사용하는 것만으로는 문제를 해결할 수 없다는 점을 강조했습니다. 연구자가 단일한 강력한 모델이 혼자서 전체 업무를 수행하도록 했을 때와 이 팀 기반 접근 방식을 비교했을 때, 팀 기반 시스템이 여전히 훨씬 더 나은 성능을 보였습니다. 이는 개별 모델의 순수한 지능보다 조사 구조, 즉 에이전트들이 어떻게 협력하고, 노이즈를 걸러내며, 다양한 유형의 증거를 어떻게 가중치 있게 다루느냐가 더 중요하다는 것을 시사합니다. 또한 이 시스템은 적응형으로 설계되었습니다. 시스템은 과거의 실수를 통해 학습하여, 이전 시나리오에서 무엇이 가장 효과적이었는지에 따라 에러 코드에 더 의존할지 혹은 성능 지표에 더 의존할지와 같이 데이터의 신뢰도를 조정할 수 있습니다.

결과가 유망하기는 하지만, 연구자는 자신의 연구가 가진 한계를 명시하는 데 주의를 기울였습니다. 이 시스템은 서비스 간의 연결 관계를 나타내는 정확한 지도가 있다는 것을 전제로 합니다. 만약 이 지도가 누락되었거나 최신 상태가 아니라면 조사가 궤도를 벗어날 수 있습니다. 또한, 여러 가지 문제가 동시에 발생하는 경우, 시스템은 때때로 중첩된 증상들을 분리하는 데 어려움을 겪습니다. 그러나 핵심적인 결론은 변하지 않습니다. 분석을 협력적이고 반복적인 과정으로 조직함으로써, 복잡한 소프트웨어 실패를 이전보다 더 정확하고 효율적으로 진단할 수 있다는 것입니다. 이 접근 방식은 대규모 디지털 시스템을 원활하게 운영하기 위한 실질적인 경로를 제시하며, 문제가 발생했을 때 데이터 보안을 타협하거나 컴퓨팅 자원을 과도하게 사용하지 않고도 빠르게 정답을 찾을 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →