← 최신 논문
💻 computer science

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

본 논문은 과거의 진단으로부터 운영 전문 지식을 축적하고 검증하는 적응형 외부 하네스를 활용함으로써 일반 목적 LLM 에이전트의 근본 원인 분석 능력을 크게 향상시키고, 순수 일반 에이전트 및 특화된 RCA 에이전트 모두를 능가하는 자가 진화 프레임워크인 OpsHarness를 소개한다.

원저자: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

게시일 2026-08-27
📖 5 분 읽기🧠 심층 분석

원저자: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 컴퓨터 시스템이 고장 나기 시작할 때, 문제는 대개 시작된 곳에 머물지 않습니다. 현대의 디지털 세계에서 소프트웨어는 수천 개의 작고 서로 연결된 조각들로 구축됩니다. 만약 한 조각이 비틀거리면, 그 오류는 바깥으로 파급되어 사용자의 앱에 지연을 일으키거나, 완전히 다른 문제처럼 보이는 갑작스러운 에러 메시지 급증을 유발할 수 있습니다. 문제가 실제로 어디서 시작되었는지 찾아내는 작업을 근본 원인 분석(root cause analysis)이라고 합니다. 수십 년 동안 엔지니어들은 이러한 조각들이 어떻게 연결되는지에 대한 지도나 통계적 패턴에 의존하여 범인을 찾아왔습니다. 오늘날 그들은 인공지능, 특히 거대 언어 모델을 활용하여 디지털 탐정 역할을 수행하도록 하고 있습니다. 이 모델들은 로그를 읽고, 코드를 이해하며, 복잡한 시나리오를 추론하는 데 매우 뛰어나며, 이는 마치 도서관의 모든 매뉴얼을 읽은 천재적인 엔지니어와 같습니다. 하지만 함정이 있습니다. 이 모델들은 똑똑하지만, 자신이 고치려는 시스템의 구체적인 특이사항(quirks)은 알지 못합니다. 그들은 인간 전문가가 동일한 시스템이 반복해서 고장 나고 회복되는 과정을 지켜보며 얻게 되는 깊고 축적된 경험이 부족합니다.

홍콩 중문대학교와 바이트댄스(ByteDance)의 연구진은 이 간극을 메울 새로운 방법을 개발했습니다. 모든 시스템마다 새로운 특화 AI를 처음부터 구축하는 대신, 그들은 강력하고 범용적인 AI를 감싸는 유연한 외부 계층을 만들었습니다. 그들은 이 계층을 '하네스(harness, 마구)'라고 부릅니다. 이 하네스를 일반 엔지니어가 새로운 팀에 합류할 때 받는 전문적인 도구 상자와 현장 노트라고 생각해보십시오. 일반 AI는 추론 능력을 제공하지만, 하네스는 구체적인 맥락, 사용할 적절한 도구, 그리고 과거의 실수로부터 얻은 교훈을 제공합니다. 그들의 작업에서 가장 중요한 혁신인 '옵스하네스(OpsHarness)'는 이 계층이 스스로 진화한다는 점입니다. 이것은 단순히 그 자리에 머물러 있는 것이 아니라, 자신이 돕는 모든 진단 과정을 지켜보고, 성공과 실패 모두로부터 배우며, 시간이 지남에 따라 더 나아지도록 자신의 지침을 스스로 업데이트합니다.

연구팀은 먼저 흔한 가설, 즉 트러블슈팅을 위해 특별히 제작된 커스텀 AI 에이전트를 구축하는 것이 최선이라는 가설을 테스트하며 시작했습니다. 그들은 이러한 커스텀 구축 에이전트들을 단순히 문제를 진단하는 과업을 부여받은 표준적인 범용 AI 모델들과 비교했습니다. 결과는 놀라웠습니다. 트러블슈팅을 위해 특별히 훈련되지 않은 일반 모델들이 커스텀 에이전트들보다 더 나은 성능을 보이는 경우가 많았습니다. 이는 커스널 에이전트들이 일반 모델들이 이미 숙달한 정교한 추론 및 계획 능력을 놓치는 경우가 많았기 때문입니다. 그러나 최고의 일반 모델조차 완벽하지는 않았습니다. 그들은 종%종 올바른 증상은 식별하지만, 특정 시스템이 스트레스 상황에서 어떻게 행동하는지에 대한 지식이 부족하여 잘못된 원인을 지목하곤 했습니다. 예를 들어, 모델은 데이터베이스 연결이 갑자기 떨어지는 것을 보고 데이터베이스 장애라고 가정할 수 있지만, 실제로는 서버의 프로세싱 능력이 고갈되는 것과 같은 다른 구성 요소의 부작용일 수 있습니다.

이를 해결하기 위해 연구진은 일반적인 지능과 시스템의 구체적인 현실 사이를 잇는 가교 역할을 하도록 옵스하네스를 설계했습니다. 이 시스템은 두 가지 주요 부분으로 나뉩니다. 첫 번째 부분은 정보를 계층적으로 저장하는 지식 베이스입니다. 이는 문제를 조사하는 방법에 대한 일반적인 규칙에서 시작하여, 모니터링 중인 특정 시스템의 프로필을 추가하고, 마지막으로 검증된 데스크톱 워크플로와 규칙의 네트워크를 축적합니다. 두 번째 부분은 '아이디어 카드(idea cards)' 라이브러리입니다. 시스템이 변경될 때 깨질 수 있는 스크립트를 하드코딩하는 대신, 하네스는 AI에게 도구나 방법의 설명을 제공하고, AI는 그 순간에 그것을 사용할 코드를 직접 작성합니다. 이를 통해 시스템은 재프로그래밍 없이도 다양한 데이터 레이아웃에 적응할 수 있습니다.

옵스하네스의 진정한 힘은 경험으로부터 배우는 능력에 있습니다. 시스템은 문제를 진단한 후 전체 과정을 검토합니다. 만약 진단이 정확했다면, 시스템은 성공적인 단계들을 추출하여 재사용 가능한 워크플로나 규칙으로 변환합니다. 만약 진단이 틀렸다면, 시스템은 추론이 정확히 어디에서 경로를 벗어났는지 식별하고, 미래에 해당 특정 실수를 방지하기 위한 규칙을 만듭니다. 이 과정은 무모하게 자동으로 이루어지는 것이 아닙니다. 시스템에는 엄격한 안전 점검 절차가 있습니다. 새로운 규칙이 메모리에 추가되기 전에, 시스템은 해당 규칙이 다른 것을 망가뜨리지 않고 진단을 개선하는지 확인하기 위해 격리된 안전한 환경에서 테스트를 거칩니다. 이 이중 점검 과정은 시스템이 나쁜 습관을 배우거나 단 하나의 특이한 사건에 과적합(overfitting)되는 것을 방지합니다.

연구진은 수백 개의 실제 장애 사례가 포함된 두 개의 공개 벤치마크에서 이 접근 방식을 테스트했으며, 또한 대규모 상업용 클라우드 환경에 배포했습니다. 결과는 극적인 개선을 보여주었습니다. 일반 AI 모델만 사용했을 때 시스템은 약 36%의 확률로 근본 원인을 정확히 식별했습니다. 동일한 모델에 옵스하네스를 장착했을 때, 그 정확도는 거의 59%까지 치솟았습니다. 이러한 개선은 서로 다른 유형의 AI 모델과 서로 다른 종류의 시스템 전반에서 일관되게 나타났습니다. 연구는 또한 시스템을 더 많이 사용할수록 더 좋아진다는 것을 발견했습니다. 시스템이 일련의 사고들을 지속적으로 진단하는 연속 테스트에서, 경험을 축적함에 따라 정확도가 꾸준히 상승했습니다. 반면, 진화하지 않는 시스템은 정체되어 있었고, 안전 점검 없이 진화하는 시스템은 노이즈로부터 학습하여 상황을 악화시키기도 했습니다.

연구진은 또한 이 시스템을 실행하는 비용을 측정했습니다. 하네스가 프로세스에 약간의 오버헤드를 추가하기는 하지만, 일반 AI 모델만 사용하는 것보다 훨씬 더 많은 컴퓨팅 파워나 시간을 요구하지는 않습니다. 사실, AI를 올바른 경로로 안내함으로써 문제를 해결하기 위해 AI가 거쳐야 하는 단계의 수를 줄여주는 경우가 많습니다. 학습된 모든 규칙과 도구를 포함한 전체 시스템은 매우 적은 저장 공간을 차지하므로 실무 적용이 가능합니다.

이 연구는 복잡한 작업을 위해 지능형 시스템을 구축하는 방식의 변화를 시사합니다. 특정 작업을 위해 매번 기초부터 새로운 AI를 훈련시키는 대신, 가장 효과적인 경로는 강력하고 범용적인 AI를 가져와서 그것이 환경의 구체적인 세부 사항을 배울 수 있도록 스마트하고 진화하는 계층으로 감싸는 것일 수 있습니다. 이 외부 계층에 집중함으로써, 연구진은 일반 모델의 가공되지 않은 지능을 전문적인 전문가로 바꿀 수 있는 시스템, 즉 자신의 역사를 통해 배우고 자신이 해결하는 데 도움을 주는 모든 사건을 통해 개선될 수 있는 시스템을 만들어냈습니다. 이 결과는 자동화된 트러블슈팅의 미래가 더 똑똑한 모델에 있는 것이 아니라, 그 모델들에게 어떻게 일하는지를 가르치는 더 똑똑한 방법에 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →