← 최신 논문
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

본 논문은 사이버보안 로그, 특히 허니팟 데이터로부터 구조화되고 의미적으로 유효한 정보를 추출하는 정확성과 설명 가능성을 크게 향상시키는 AI 에이전트를 구축하기 위해 대규모 언어 모델과 도메인 온톨로지 및 SHACL制약을 결합한 새로운 방법론을 제안합니다.

원저자: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

범죄를 해결하려는 형사가 되어 상상해 보십시오. 하지만 명확한 경찰 보고서 대신 수천 페이지 분량의 지저분한 손글씨 메모, 낙서, 그리고 반쯤 완성된 문장들이 당신에게 전달됩니다. 이것이 사이버 보안 전문가들이 시스템 로그를 읽으려 할 때 직면하는 상황입니다. 이러한 로그는 컴퓨터의 "일기"로, 수행된 모든 행위를 기록하지만, 종종 비구조화되어 있고 혼란스러우며 전문 용어로 가득 차 있습니다.

이 논문은 이러한 혼란을 해결하는 데 도움을 주는 새로운 도구인 OntoLogX를 소개합니다. 사이버 보안 분석가인 형사들이 이를 어떻게 활용하는지 간단한 개념으로 나누어 설명합니다.

1. 문제: "지저분한 방"

이러한 로그를 읽는 전통적인 방법은 손전등과 고정된 규칙 목록만 사용하여 지저분한 방에서 특정 장난감을 찾는 것과 같습니다. 만약 장난감이 옷 더미 아래에 숨겨져 있거나 기이한 이름으로 라벨이 붙어 있다면, 손전등은 그것을 놓쳐버립니다.

  • 문제점: 컴퓨터가 생성하는 로그는 비구조화되어 있고 모호합니다. 구식 방법들은 "나쁜 놈들"(악성 이벤트) 을 신뢰성 있게 찾아내는 데 어려움을 겪습니다.
  • 새로운 도구: 저자들은 **대규모 언어 모델 (LLM)**을 사용합니다. LLM 을 인터넷의 거의 모든 것을 읽어 본 자연어를 이해할 수 있는 초지능 인턴으로 생각하십시오. 그러나 이 인턴은 다소 "몽상가"일 수 있습니다. 규칙에 엄격하게 구속되지 않기 때문에 때로는 사실을 지어내거나 사실을 약간 잘못 이해할 수 있습니다.

2. 해결책: "건축가"와 "검사관"

인턴의 몽상하는 성향을 해결하기 위해 저자들은 OntoLogX라는 시스템을 구축하여 두 가지 중요한 통제 계층을 추가했습니다.

  • 건축가 (온톨로지): 인턴이 작성을 시작하기 전에, 시스템은 온톨로지라는 엄격한 청사진을 제공합니다. 이는 특정 블록 세트와 규칙 책과 같습니다. "이 특정 벽돌 (클래스) 만 사용하여 집을 짓고, 이 특정 방식으로 연결해야 한다"고 말합니다. 이는 AI 가 지저분한 로그 데이터를 지식 그래프라는 깔끔하고 구조화된 형식으로 조직하도록 강제합니다.
  • 검사관 (SHACL 검증): 인턴이 구조를 완성하면, SHACL이라는 도구를 사용하는 엄격한 검사관이 작업을 점검합니다. 검사관은 다음과 같이 질문합니다. "올바른 벽돌을 사용했는가? 지붕을 벽에 올바르게 연결했는가? 문이 누락되지 않았는가?"
    • 건물이 잘못되면, 검사관은 "이를 수정하라"는 메모와 함께 인턴에게 작업을 돌려보냅니다.
    • 인턴은 다시 시도합니다. 이 루프는 건물이 완벽해질 때까지 계속됩니다.

3. 과정: 예시에서 배우기

이 시스템은 인턴에게 단순히 추측하라고 요구하지 않습니다. **검색 증강 생성 (Retrieval Augmented Generation)**이라는 교묘한 기술을 사용합니다.

  • 인턴이 과거의 성공적인 사건들에 대한 도서관을 가지고 있다고 상상해 보십시오. 새로운 지저분한 로그가 들어오면, 시스템은 가장 유사한 과거 사례 (예시) 를 찾아 인턴에게 보여줍니다.
  • 시스템은 말합니다. "이전에도 유사한 퍼즐을 어떻게 해결했는지 보십시오. 새로운 퍼즐을 해결할 때 동일한 스타일을 사용하십시오."
  • 이는 인턴이 "건축가"(온톨로지) 가 정확히 무엇을 원하는지 이해하도록 도와주어 훨씬 더 나은 결과를 이끌어냅니다.

4. 결과: 속도가 아닌 정확성 향상

저자들은 이 시스템을 "구식 방법"(건축가나 검사관 없이 인턴에게 작성을 요청하는 것) 과 비교하여 테스트했습니다.

  • 결과: 새로운 방법은 정확성이 훨씬 더 높았습니다. 더 많은 "나쁜 놈들"을 찾아냈으며 (재현율 향상), 실수를 더 적게 범했습니다 (정밀도 향상).
  • 트레이드오프: 논문은 명시적으로 속도보다 품질을 우선시했다고 밝힙니다. 새로운 방법은 작업을 점검하고 피드백을 받으며 다시 시도해야 하므로 시간이 조금 더 걸립니다. 하지만 최종 결과는 사이버 위협에 대한 훨씬 더 신뢰할 수 있고 신뢰성 있는 지도를 제공합니다.
  • 승자: 테스트된 다양한 AI 모델 중 Claude 3.5 Sonnet이 가장 잘 수행되었지만, Llama 3.3과 같은 오픈 소스 모델도 매우 잘 수행했습니다.

요약 비유

사이버 보안 로그를 읽는 것이 지저분한 손글씨 일기를 형식적인 법적 문서로 번역하는 것과 같다면:

  • 구식 방법: 당신은 스마트한 번역가에게 그저 "최선을 다하라"고 요청합니다. 그들은 의미를 파악할 수 있지만, 형식은 지저분하고 일관성이 없을 수 있습니다.
  • OntoLogX: 당신은 번역가에게 엄격한 법적 템플릿 (온톨로지) 을 제공하고, 완벽한 법적 문서의 예시 (Few-shot 예시) 를 보여주며, 모든 초안을 검토하는 엄격한 변호사 (SHACL) 를 배치합니다. 초안이 완벽하지 않으면 변호사는 수정을 위해 이를 돌려보냅니다. 그 결과, 생산에 조금 더 시간이 걸리더라도 매번 완벽한 법적 문서를 얻게 됩니다.

핵심 교훈: 이 논문은 "스마트 AI"와 "엄격한 규칙" 및 "품질 점검"을 결합하면 지저분한 컴퓨터 로그를 사이버 위협에 대한 명확하고 실행 가능한 정보로 변환하는 훨씬 더 신뢰할 수 있는 시스템을 만든다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →