Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation
본 논문은 선택적 LLM 증강과 인간-루프 내 정제를 통해 정밀한 이상 탐지, 국소화 및 설명을 가능하게 하는 새로운 계층적 로그 추상화와 모듈식 오케스트레이션 프레임워크를 활용하는 대화형 시각화 시스템인 Krone-viz 를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
범죄를 해결하려는 형사가 되어 보십시오. 하지만 몇 개의 증인 진술 대신, 혼란스럽고 끊김 없는 라디오 방송의 10,000 페이지 분량의 대본을 건네받습니다. 모든 문장은 대화의 작은 조각이지만, 모두 단일하고 평평한 목록에 뒤죽박죽 섞여 있습니다. 이것이 바로 컴퓨터 '로그'가 보통 갖는 모습입니다: 시스템이 무엇을 하고 있는지 알려주는 끝없는 텍스트의 흐름이지만, 인간이 이해하기에는 극도로 어려운 방식으로 말입니다.
이 논문은 이러한 혼란을 이해할 수 있는 새로운 방법인 Krone(그리고 그 시각화 도구인 Krone-viz)을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 보겠습니다:
1. 문제: '평평한' 목록 대 '이야기'
대부분의 기존 도구들은 로그를 재료의 평평한 목록처럼 취급합니다. 케이크가 타버리면 그들은 단순히 "케이크가 망가졌다"고 말합니다. 어떤 재료가 잘못되었는지, 언제 망가졌는지, 혹은 왜 망가졌는지는 알려주지 않습니다.
- 옛 방식: 10,000 개의 로그 항목으로 이루어진 평평한 목록을 살펴보고, 충돌을 일으킨 한 개의 오타를 찾아내는 것입니다. 이는 모든 단어가 한 줄에 쓰여진 소설에서 특정 문장을 찾아내려는 것과 같습니다.
- Krone 방식: Krone 은 컴퓨터가 무작위적인 일을 하는 것이 아니라 이야기 구조를 따른다는 것을 깨닫습니다. 모든 행동에는 누가(주체), 무엇을(행위), 결과(상태)가 있습니다.
2. 해결책: 로그를 위한 '가계도' 구축
Krone 은 그 지저분하고 평평한 목록을 계층적 가계도(Krone-Tree 라고 함) 로 조직화합니다.
- 비유: 지저분하게 쌓인 레고 블록을 '바퀴', '창문', '문'이라는 상자에 분류한다고 상상해 보십시오. 그런 다음 그 상자들을 '자동차 부품'으로 묶고, 다시 그것들을 '완전한 자동차'로 묶습니다.
- 작동 원리: Krone 은 AI(대규모 언어 모델, 즉 LLM) 를 사용하여 로그를 읽고 "아, 이 로그 항목은 '세션'(누가) 이 '열었다'(무엇을) 그리고 '시작했다'(결과) 에 관한 것이군"이라고 말합니다. 이는 모든 로그 항목이 더 큰 그림에서 정확히 어디에 해당하는지 아는 지도를 구축합니다.
3. 형사 작업: '분할 정복'
로그가 이 나무로 조직화되면, Krone 은 모든 단일 블록을 확인하지 않습니다. 문제를 찾기 위해 스마트하고 단계적인 전략을 사용합니다.
- '가벼운' 필터: 먼저 Krone 은 로그를 스캔하는 간단한 빠른 규칙 확인기(맞춤법 확인기 같은) 를 사용합니다. 로그 항목이 정상적으로 보이면 무시합니다. 이는 신원이 명확한 사람들을 빠르게 통과시키는 보안 요원과 같습니다.
- 'AI' 형사: 간단한 확인기가 이상한 것을 발견하면, 그때 비싸고 초지능적인 AI 형사 (LLM) 를 소환하여 조사합니다.
- '하향식' 전략: Krone 은 가장 작은 세부 사항 (시작됨'또는'실패됨'과 같은'상태'수준) 을 먼저 확인합니다. 거기서 문제를 발견하면 즉시 중단합니다. 문제가 이미 발견되었으므로 더 큰'행위'또는'주체'수준을 확인하는 시간을 낭비하지 않습니다. 이는 막대한 비용과 컴퓨팅 자원을 절약합니다.
4. '요약 노트': 배우며 나아가기
Krone 의 가장 멋진 기능 중 하나는 배운 것을 기억한다는 점입니다.
- 비유: 수첩을 들고 다니는 형사를 상상해 보십시오. 오늘'고장 난 문 경첩'에 관한 미스터리를 해결하면 그것을 적어 둡니다. 다음에'고장 난 문 경첩'을 보면, 비싼 AI 형사를 다시 부를 필요가 없습니다. 그냥 수첩을 보면 됩니다.
- 작동 원리: Krone 은 지식 베이스를 구축합니다. 특정 유형의 로그 시퀀스를 분석하여 정상적 (또는 비정상적) 임을 발견하면 그 결과를 저장합니다. 나중에 동일한 시퀀스가 나타나면 Krone 은 그 답을 재사용합니다. 이로 인해 시간이 지남에 따라 시스템이 더 빠르고 저렴해집니다.
5. 시각화 도구: Krone-viz
이 논문은 인간 엔지니어가 이 모든 일이 실시간으로 발생하는 것을 볼 수 있게 해주는 대시보드인 Krone-viz를 제시합니다.
- 할 수 있는 일:
- 나무 보기: 평평한 로그들이 조직화된 가계도로 변하는 것을 지켜볼 수 있습니다.
- 결함 발견: 나무의 어떤 '가지'가 고장 났는지 정확히 볼 수 있습니다.
- 설명 읽기: AI 가 왜 무언가가 잘못되었다고 생각하는지에 대한 평이한 영어 설명을 작성합니다.
- AI 수정: AI 가 실수를 하면 이를 수정할 수 있습니다. 시스템은 수정 사항에서 배우고 '수첩'을 업데이트하여 다시 같은 실수를 하지 않도록 합니다.
요약
간단히 말해, Krone은 컴퓨터 로그를 혼란스러운 텍스트의 벽처럼 취급하는 것을 멈춥니다. 대신 이를 구조화된 이야기로 조직화하고, 오류를 찾기 위해'먼저 확인하고 나중에 질문하는'스마트한 전략을 사용하며, 발견 사항을 기억하여 시간이 지남에 따라 더 똑똑하고 저렴해집니다. Krone-viz는 인간이 이 과정을 지켜보고, AI 의 추론을 이해하며, 필요시 이를 수정할 수 있게 해주는 창입니다.
참고: 이 논문은 이전 방법들보다 더 잘 작동하고 비용이 적게 든다는 것을 증명하기 위해 HDFS(파일 저장 시스템 로그의 일종) 라는 표준 데이터셋에서 이 시스템을 특별히 테스트했습니다. 아직 의료 진단이나 기타 특정 산업에 사용된다고 주장하지는 않습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.