← 최신 논문
🤖 AI

A Topology-Aware, Memory-Centric Architecture that Separates Root-Cause Derivation from Root-Cause Explanation

이 논문은 현대적인 마이크로서비스 배포 환경에서의 장애 전파 문제를 해결하기 위해, 시스템 동작과 의존성에 대한 지속적이고 구조화된 표현을 유지함으로써 결정론적인 근본 원인 도출과 LLM 기반 설명을 분리하는 토폴로지 인식형, 메모리 중심 아키텍처인 OPS CORTEX를 소개한다.

원저자: Momil Seedat

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Momil Seedat

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 첨단 기술이 집약된 우주선의 선장이라고 상상해 보십시오. 갑자기 모든 곳에서 경보음이 울리기 시작합니다. 조명이 붉은색으로 깜빡입니다. 배가 흔들립니다.

문제 상황:
현대적인 컴퓨터 시스템(마이크로서비스라고 불리는)에서는 무언가 고장 났을 때 경보를 울리기는 쉽지만, 그 원인을 이해하기는 어렵습니다. 이는 마치 50개의 서로 다른 센서가 동시에 "불이야!"라고 비명을 지르는 것과 같습니다. 진짜 문제는 센서가 작동하지 않는 것이 아니라, 그 상황을 마주한 인간(엔지니어)이 압도당한다는 것입니다. 엔지니어는 다음을 파악해야 합니다:

  1. 어떤 센서가 '진짜' 불을 감지했는가?
  2. 어떤 센서들은 단지 첫 번째 불에서 발생한 연기에 반응하고 있는 것뿐인가?
  3. 왜 하필 '지금' 이런 일이 발생했는가? (어제는 왜 안 그랬는가?)

보통 컴퓨터 시스템은 알람이 멈추는 즉로 모든 것을 잊어버립니다. 화요일 새벽 3시에 무엇이 '정상'이었는지, 혹은 각 부품들이 어떻게 연결되어 있는지에 대한 기억이 없습니다. 그래서 엔지니어는 시스템이 여전히 무너지고 있는 와중에도 매번 처음부터 다시 탐정 놀이를 해야 합니다.

솔루션: OpsCortex (운영 메모리)
이 논문은 이러한 시스템을 운영하는 새로운 방법인 OpsCortex를 소개합니다. 시스템을 거대한 뇌(초고성능 AI)를 가진 똑똑한 존재로 만들려고 애쓰는 대신, 저자들은 이렇게 말합니다: "시스템에게 '기억'을 부여하라."

OpsCortex를 컴퓨터 시스템을 위한 초정밀, 장기 기억 장치라고 생각하십시오. 이것은 4층 규모의 도서관처럼 구축되어 있습니다:

  1. 핫 데스크 (Tier 1 - 현재 업무 공간): "지금 이 순간"을 다룹니다. 현재 온도, 속도, 경고 등을 담습니다. 몇 시간마다 버려지는 책상의 포스트잇 같은 것입니다.
  2. 라이브 맵 (Tier 2 - 실시간 지도): 모든 컴퓨터 서비스가 서로 어떻게 통신하는지에 대한 그림입니다. 서비스 A가 서비스 B와 통신한다면, 이 지도는 그 사실을 알고 있습니다. 이 지도는 끊임없이 업데이트됩니다.
  3. 사진첩 (Tier 3 - 스냅샷): 시스템은 매 분마다 전체 지도의 "스냅샷"을 찍어 저장합니다. 이를 통해 "아, 연결이 1초 전이 아니라 5분 전에 끊겼구나"라고 과거를 되돌아볼 수 있습니다.
  4. 백과사전 (Tier 4 - 영구적 지식): 이것은 영구적인 뇌입니다. "화요일 새벽 3시에는 시스템이 보통 약간 느려지는 것이 정상이다"라는 것을 기억합니다. 또한 과거의 재난들과 그것들이 어떻게 해결되었는지도 기억합니다.

작동 방식: "탐정과 번역가"
이 논문은 문제의 원인을 찾아내는 것과 그것을 '설명'하는 것은 두 가지 서로 다른 작업이라고 주장합니다. OpsCortex는 이 둘을 분리합니다:

  • 1단계: 탐정 (결정론적 로직):
    먼저, 시스템은 단순하고 명확한 수학적 규칙(발자국을 따라가는 탐정처럼)을 사용합니다. 시스템은 "라이브 맵"을 보고 다음과 같이 묻습니다: "어떤 서비스가 가장 먼저 고장 났는가?" 그리고 "그 서비스와 연결된 다른 서비스들은 무엇인가?"

    • 비유: 도미노 하나가 쓰러지면서 나머지 10개를 차례로 쓰러뜨린다면, 수학은 추측하지 않습니다. 그것은 단순히 첫 번째로 쓰러진 도미노를 가리킵니다. 이것은 100% 신뢰할 수 있으며 빠릅니다.
  • 2단계: 번역가 (AI/LLM):
    탐정이 범인을 찾아낸 직후에만 시스템은 "AI 번역가"를 호출합니다.

    • 비유: AI에게 누가 범인인지 맞히라고 요구하는 것이 아닙니다. 대신, 탐정이 AI에게 증거 파일(지도, 타임라인, 첫 번째 도미노)을 건네며 이렇게 말합니다: "여기 무슨 일이 일어났는지 정리해 두었으니, 인간 선장을 위해 평이한 영어(일상 언어)로 보고서를 작성하고 어떻게 해결해야 하는지 알려줘."
    • 이렇게 하면 AI는 추측하는 것이 아니라 사실을 설명하는 역할만 수행하게 되므로, 훨씬 더 정교하게 업무를 수행할 수 있습니다.

왜 더 나은가? ("침묵"의 기술)
이 시스템은 "소음"을 무시하는 법도 배웁니다.

  • 문제점: 매일 밤, 컴퓨터는 실제 장애가 아닌 정상적인 작업을 수행하느라 일시적으로 느려질 수 있습니다. 기존 시스템은 매일 밤 "경보!"라고 소리를 질렀을 것입니다.
  • OpsCortex의 해결책: 시스템은 학습합니다. "아, 이건 매일 밤 2시에 일어나는 일이구나. 정상이야." 그리고 침묵합니다.
  • 안전망: 하지만 만약 동일한 작업이 평소보다 갑자기 더 느려지거나, 새벽 2시가 아닌 오후 2시에 발생한다면, 시스템은 기억을 되살립니다. "잠깐, 이건 평소 패턴과 달라!"라며 경보를 깨웁니다.

실제 사례 증명
저자들은 가상의 온라인 쇼핑몰을 대상으로 테스트를 진행했습니다. 그들은 8가지 방식으로 시스템을 고장 냈습니다 (예: 대기열이 쌓이게 하거나 서비스를 과부하 시키는 등).

  • 그들이 실제 세상의 재난(논문에서 언급된 Slack의 장애 사례 등)과 비교하여 테스트했을 때, 이 설계는 해당 기업들이 겪었던 문제들을 직접적으로 해결했습니다:
    • Slack 2021: 그들의 자체 대시보드가 네트워크 장애에 의존하고 있었기 때문에 대시보드 자체가 작동하지 않았습니다. OpsCortex는 대시보드가 필요하지 않습니다. 자체적인 영구 기억(Tier 4)을 가지고 있기 때문에, 메인 도구들이 실패하더라도 계속 작동할 수 있습니다.
    • Slack 2022: 작은 변화 하나가 트래픽 피크 시간대에 거대한 충돌을 일으켰습니다. OpsCortex는 "피크 트래픽"이 보통 어떤 모습인지 기억하고 있으므로, 경보가 울리기 전이라도 재앙을 향한 '변화(drift)'를 포착해 낼 수 있습니다.

핵심 요약
이 논문은 컴퓨터 시스템을 고치는 데 있어 가장 큰 문제는 더 좋은 센서나 더 똑똑한 AI가 부족한 것이 아니라고 주장합니다. 바로 기억이 부족하다는 것입니다.

OpsCortex는 이렇게 말합니다: "무엇이 정상인지 기억하고, 사물들이 어떻게 연결되어 있는지 기억하며, 과거의 실수들을 기억하는 시스템을 만들자." 이렇게 함으로써, 시스템은 단순한 수학을 통해 근본 원인을 찾아내고, AI는 오직 그것을 명확하게 설명하는 데만 사용할 수 있습니다. 이는 시스템을 더 저렴하고, 더 차분하며, 더 빠르게 스스로를 고칠 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →