OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
OntoLogX 는 대규모 언어 모델, 검색 증강 생성, 그리고 온톨로지 기반의 반복적 수정을 활용하여 비정형 사이버 보안 로그를 MITRE ATT&CK 전술에 정확하게 매핑할 수 있는 일관성 있고 온톨로지에 기반한 지식 그래프로 변환하는 자율형 AI 에이전트입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 범죄를 해결하려는 형사라고 상상해 보세요. 하지만 명확한 목격자 진술 대신 수백 명의 다른 경찰관들이 남긴 찢겨진 메모, 낙서된 영수증, 그리고 난해한 무전 통신의 산더미 같은 것을 받습니다. 이것이 사이버 보안 전문가들이 시스템 로그를 볼 때 마주하는 상황입니다. 이 로그들은 컴퓨터가 남긴 디지털 발자국이지만, 지저분하고 비구조적이며 종종 기기마다 다른 혼란스러운 약어로 작성되어 있습니다.
이 논문은 이 혼란을 정리하고 그 혼란스러운 메모들을 사건 발생의 명확하고 조직화된 지도로 변환하도록 설계된 새로운 "자율 AI 형사"인 OntoLogX를 소개합니다.
다음은 OntoLogX 가 작동하는 방식을 간단한 비유로 설명한 것입니다:
1. 문제: "찢겨진 메모들"
시스템 로그는 찢겨진 종이의 더미와 같습니다. 해커에 대한 귀중한 단서 (누구인지, 무엇을 시도했는지, 어떻게 했는지) 를 포함하고 있지만, 정보는 산재해 있고 불일치하며 읽기 어렵습니다. 전통적인 도구는 엄격한 규칙 (체크리스트와 같은) 을 따라 이를 분류하려고 시도하지만, 해커들은 창의적이며 전술을 변경하므로 체크리스트는 종종 실패합니다.
2. 해결책: "스마트 번역기" (OntoLogX)
OntoLogX 는 초지능 번역가이자 정리꾼 역할을 하는 AI 에이전트입니다. 그 임무는 단일하고 지저분한 로그 항목을 구조화된 지식 그래프로 변환하는 것입니다.
- 지식 그래프: 이를 가족 관계도나 지하철 노선도로 생각하세요. 텍스트 블록 대신 사용자, 컴퓨터, 시간, 행동과 같은 특정 "점"들을 서로 어떻게 관련되는지 보여주는 명확한 "선"으로 연결합니다.
- 온톨로지 (청사진): 지도가 올바르게 그려지도록 하기 위해 OntoLogX 는 가벼운 온톨로지를 사용합니다. 이를 엄격한 건축 청사진이나 레고 조립 설명서로 상상해 보세요. 이는 AI 에게 허용되는 조각 (노드) 과 연결 (관계) 의 종류를 정확히 알려주어, 최종 지도가 의미를 가지고 규칙을 따르도록 합니다.
3. 작동 방식: 세 단계 프로세스
OntoLogX 는 단순히 추측하지 않습니다. 정확성을 보장하기 위해 교묘한 세 단계 루틴을 사용합니다:
1 단계: "참고 도서관" (검색 증강 생성)
AI 가 새로운 로그를 번역하기 전에, 이전에 해결된 로그들의 데이터베이스인 자신의 기억 은행을 검색하여 유사한 예시를 찾습니다. 이는 과거 사건 파일을 검토하여 유사한 범죄가 어떻게 문서화되었는지 확인하는 형사와 같습니다. 이는 AI 가 맥락을 이해하고 바퀴를 다시 발명하지 않도록 도와줍니다.2 단계: "초안 작성 단계" (생성)
참조 예시와 엄격한 "레고 조립 설명서"(온톨로지) 를 사용하여 AI 는 초안 지도를 생성합니다. 핵심 세부 사항을 추출해 보려고 합니다: 누가 했는가? 언제? 어떤 도구를 사용했는가?3 단계: "검사관" (반복적 수정)
이것이 가장 중요한 안전망입니다. 초안이 작성되면 SHACL이라는 도구를 사용하는 디지털 검사관이 청사진과 대조하여 이를 점검합니다.- AI 가 실수를 한 경우 (예: 잘못된 점을 연결하거나 필수 조각을 놓친 경우), 검사관은 "이를 수정하라"는 메모와 함께 초안을 AI 로 되돌려 보냅니다.
- AI 는 다시 시도합니다. 지도가 완벽해지고 모든 규칙을 따를 때까지 이 루프를 반복합니다. 몇 번의 시도 후에도 수정할 수 없다면, 가짜 지도를 만드는 대신 그 항목을 비워두고 승인을 포기합니다.
4. 큰 그림: 점들을 연결하다
OntoLogX 가 수천 개의 개별 로그 항목을 정리하면, 이를 "세션"으로 그룹화합니다 (특정 침입 시도에서 나온 모든 메모를 그룹화하는 것과 같습니다). 그런 다음 AI 를 한 번 더 사용하여 전체 그림을 보고 고차원적인 질문인 **"해커의 목표는 무엇이었는가?"**에 답합니다.
이러한 활동을 MITRE ATT&CK에 매핑합니다. 이는 해커 전술의 보편적인 사전과 같습니다. "해커가 명령을 실행했다"고 말하는 대신, OntoLogX 는 "이것은 초기 접근 시도 followed by 권한 상승이었습니다"라고 말할 수 있습니다. 이는 보안 팀이 실제로 활용할 수 있는 실행 가능한 정보로 원시 데이터를 변환합니다.
5. 논문이 발견한 것
저자들은 OntoLogX 를 두 가지 유형의 데이터로 테스트했습니다:
- 공개 데이터셋: 표준적이고 알려진 로그에서 작동하는지 확인하기 위해.
- 실제 허니팟: 해커를 유인하도록 설정된 가짜 서버들. 이 서버들의 로그는 순수한 "악당" 활동입니다.
결과:
- 정확도: 시스템은 지저분한 로그를 규칙을 따르는 깨끗한 지도로 성공적으로 변환했습니다.
- 도움으로 더 나아짐: 시스템은 "참고 도서관"(검색) 과 "검사관"(수정) 을 사용할 때 가장 잘 작동했습니다. 이 요소들이 없으면 AI 는 더 많은 실수를 했습니다.
- 모델의 중요성: 모든 AI 두뇌가 동일한 것은 아닙니다. 시스템은 창의적인 스토리텔링에 더 능한 모델보다는 엄격한 지시를 따르는 데 능한 모델 (코드 중심 모델 등) 과 함께 가장 잘 작동했습니다.
- 전술 탐지: 해커들이 무엇을 시도하려 했는지 예측할 때, OntoLogX 는 원시 로그를 직접 읽는 시스템보다 복잡한 다단계 공격을 포착하는 데 훨씬 더 뛰어났습니다.
요약
간단히 말해, OntoLogX는 컴퓨터 로그의 혼란스럽고 지저분한 언어를 사이버 공격의 명확하고 구조화되며 검증된 지도로 번역하는 도구입니다. 이는 엄격한 규칙책을 사용하고, 과거 예시에서 학습하며, 최종 정보가 보안 전문가들이 행동할 수 있을 만큼 신뢰할 수 있도록 자신의 작업을 이중으로 점검합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.