← 최신 논문
🤖 AI

Agentic Observability: Automated Alert Triage for Adobe E-Commerce

이 논문은 ReAct 패러다임을 사용하여 경보 분류를 자율적으로 수행함으로써, 동적 로그 분석과 문맥 인식형 액션 플래닝을 통해 진단 정확도를 유지하면서도 평균 통찰 시간(mean time to insight)을 90% 감소시킨, Adobe의 이커머스 인프라에 배포된 에이전트형 관측성 프레임워크를 제시한다.

원저자: Aprameya Bharadwaj, Kyle Tu

게시일 2026-02-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aprameya Bharadwaj, Kyle Tu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고속 이커머스 스토어(Adobe가 운영하는 것과 같은)를 거대하고 북적이는 도시라고 상상해 보십시오. 이 도시는 주문을 처리하고, 구독을 관리하며, 제품을 표시하기 위해 끊임없이 서로 대화하는 수천 개의 작고 연결된 건물들(마이크로서비스)로 구성되어 있습니다.

이 도시에서는 문제가 항상 발생합니다. 배관에서 파이프가 터지기도 하고, 신호등이 오작лу하기도 하며, 전력이 깜빡거리기도 합니다. 과거에는 알람이 울리면 인간 "소방관"(엔지니어)이 다음과 같은 일을 해야 했습니다:

  1. 알람을 듣고 현장으로 달려갑니다.
  2. 지도(로그)를 챙깁니다.
  3. 상태를 확인하기 위해 다섯 개의 서로 다른 건물으로 달려갑니다.
  4. 특정 건물에 대한 매뉴얼을 찾아보기 위해 도서관에 전화합니다.
  5. 마지막으로 무엇이 고장 났는지 파악하고 어떻게 고칠지 결정합니다.

이 과정은 매우 오래 걸렸으며(약 18~33분), 소방관은 종종 너무 많은 지도와 도구를 한꺼번에 다루느라 압도당하곤 했습니다.

새로운 솔루션: "슈퍼 탐정" 팀

이 논문은 **에이전틱 옵저버빌리티(Agentic Observability)**라고 불리는 새로운 시스템을 소개합니다. 이것을 하나의 로봇이 아니라, 알람이 울리는 즉시 즉각적으로 움직이는 특화된 탐정 팀이라고 생각하십시오. 그들은 인간이 무엇을 하라고 말할 때까지 기다리지 않고, 즉시 행동에 나섭니다.

이 팀의 구조는 다음과 같은 간단한 비유를 통해 설명할 수 있습니다:

  • "정찰병" (Splunk Agent): 알람이 울리자마자 이 에이전트는 현장으로 달려갑니다. 오류가 발생한 정확한 위치에서 특정 "범죄 현장 사진"(로그)을 가져옵니다. 노이즈를 걸러내고 중요한 단서(에러 메시지)를 찾아냅니다.
  • "탐정" (Tools Agent): 이 팀의 두뇌입니다. 정찰병이 찾은 단서들을 살펴봅니다. "방금 배관을 교체했나? 전력망에 문제가 생겼나?"라고 질문합니다. 왜 이런 일이 발생했는지 알아내기 위해 도시의 설계도(런북/Runbook)와 최근 변경 사항(코드 배포)의 이력을 검토합니다. 그런 다음 문제를 해결하기 위한 단계별 계획을 세웁니다.
  • "품질 관리관" (Reflection Agent): 팀이 인간 상사에게 보고서를 보내기 전, 이 에이전트는 작업 내용을 재검토합니다. "우리가 놓친 것이 있는가? 이 설명이 타당한가? 이 해결책이 안전한가?"라고 자문합니다. 만약 팀이 100% 확신하지 못한다면, 몇 번의 시도 후에 멈추고 인간에게 이렇게 말합니다. "이것이 저희가 찾은 최선의 추측이지만, 도움이 필요합니다."

실제 사례에서의 작동 방식

이 논문은 이 팀을 **콘텐츠 검증 오류(Content Validation Errors)**라는 특정 문제에 대해 테스트했습니다. 웹사이트의 제품 설명에 오타가 있거나 형식이 깨진 상황을 가정해 보십시오. 기존 시스템에서는 인간이 수천 줄의 텍텍스트를 수동으로 검색하여 오타를 찾고, 어떤 언어 버전인지 식별한 다음 이를 수정해야 했습니다. 이 작업은 오류당 약 13분이 소요되었습니다.

새로운 AI 팀의 경우:

  1. 알람이 울립니다.
  2. 정찰병이 깨진 텍스트를 보여주는 특정 로그를 즉시 추출합니다.
  3. 탐정은 정확히 어떤 제품과 언어 버전이 깨졌는지 파악하고, 에러가 발생한 정확한 줄 번호를 찾아냅니다.
  4. 품질 관리관이 조사 결과를 확인합니다.
  5. 팀은 인간 엔지니어에게 다음과 같이 메시지를 보냅니다: "오류는 프랑스어 버전의 '여름 세일' 배너, 42번 줄에 있습니다. 여기 수정안이 있습니다."

인간 엔지니어는 그저 "적용(apply)"을 클릭하기만 하면 됩니다. 이 전체 과정은 AI 팀에 의해 약 1.8분 만에 완료되었습니다.

결과

논문은 이 새로운 시스템이 다음 세 가지 이유로 게임 체인저라고 주장합니다:

  1. 속도: 문제를 찾는 시간(평균 통찰 시간, Mean Time to Insight)을 90% 단축했습니다. 18분을 기다리는 대신, 약 2분 만에 답이 나옵니다.
  2. 정확도: AI 팀은 전문 인간 엔지니어만큼이나 정확하게 원인을 찾아냈으며(약 88%의 정확도), 훨씬 빠르고 일관적입니다.
  3. 인간의 업무 경감: 인간이 수동으로 수행하던 단계의 약 **65%에서 75%**를 자동화했습니다. 이는 엔지니어가 단서를 찾는 데 시간을 쓰는 대신, 실제로 도시를 고치는 데 더 집중할 수 있게 해줍니다.

한계점

논문은 한계점에 대해서도 솔직하게 밝히고 있습니다. "슈퍼 탐정" 팀은 접근할 수 있는 정보의 수준에 따라 성능이 결정됩니다.

  • 만약 알람이 너무 많이 발생하여 "전화선"(API)이 막히게 되면, 팀의 속도가 느려질 수 있습니다.
  • 팀은 새로운 종류의 건물에 대한 규칙(런북)을 배우기 위해 인간의 교육이 필요합니다. 스스로 규칙을 만들어낼 수는 없으며, 주어진 규칙을 따를 뿐입니다.
  • 위험한 작업(예: 메인 전원 스위치를 끄는 일)의 경우, 안전을 보장하기 위해 여전히 인간의 최종 승인이 필요합니다.

요약

요약하자면, 이 논문은 반응형 모니터링(문제가 무엇인지 인간이 파악하기를 기다리는 방식)을 선제적 추론(알람이 울리는 즉시 조사하고, 추론하며, 해결책을 제안하는 AI 팀)으로 전환하는 시스템을 설명합니다. 이는 인간의 역할을 "탐정"에서 "감독관"으로 변화시켜, 기업이 장애로부터 훨씬 빠르게 회복할 수 있도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →