← 최신 논문
🤖 machine learning

Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs

본 논문은 비정형 사이버보안 보고서에서 정확한 엔티티-관계 삼중체를 추출하는 기존 파이프라인 접근법의 한계를 극복하고 STIX 2.1 기반 벤치마크에서 상당한 성능 향상을 달성하기 위해 SecureBERT+ 임베딩과 도메인 온톨로지를 결합한 하이브리드 NLP 모델을 활용하는 상황 인식 위협 인텔리전스 지식 그래프 (CTiKG) 프레임워크를 소개한다.

원저자: Inoussa Mouiche, sherif Saad

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Inoussa Mouiche, sherif Saad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 미스터리를 해결하려는 사이버 보안 탐정이라고 상상해 보세요. 해커, 그들의 도구, 그리고 공격을 설명하는 수천 개의 지저분한 손글씨 보고서 (비정형 텍스트) 를 가지고 있습니다. 당신의 목표는 이 지저분한 메모들을 누가 누구와 연결되어 있는지, 어떤 도구를 사용하는지, 어디에서 공격을 가하는지 즉시 확인할 수 있는 깔끔하고 조직화된 '수배 포스터' 보드 (지식 그래프) 로 변환하는 것입니다.

이 논문은 CTiKG라고 불리는 그 보드를 구축하는 새로운 더 지능적인 방법을 소개합니다. 이것이 어떻게 작동하는지 간단한 개념으로 나누어 설명합니다:

문제: "고장 난 조립 라인"

과거에 이러한 보드를 구축하려는 시도는 결함이 있는 조립 라인을 운영하는 것과 같았습니다.

  1. 1 단계: 로봇이 사람과 장소의 이름 (개체) 을 찾으려 했습니다.
  2. 2 단계: 두 번째 로봇이 그들이 어떻게 연결되어 있는지 (관계) 파악하려 했습니다.

문제는 첫 번째 로봇이 실수를 하면 (예: 해커의 이름을 잘못 식별하는 경우) 두 번째 로봇도 혼란을 겪고 실수를 저지른다는 점이었습니다. 이를 '오류 전파'라고 합니다. 또한, 로봇들은 일반 영어 (위키피디아 읽기 등) 로 훈련되었기 때문에 특정 해커 은어나 전문 용어를 이해하지 못했습니다. 그들은 'Mimikatz'를 읽었을 때 특정 해킹 도구가 아니라 단순히 무작위 단어라고 생각했을 것입니다.

해결책: "맥락 인식 탐정" (CTiKG)

저자들은 사이버 위협의 언어를 유창하게 구사하는 전문 탐정 팀처럼 작동하는 새로운 시스템을 구축했습니다. 그들은 세 가지 주요 방식으로 프로세스를 개선했습니다:

1. "슈퍼 리더" (더 나은 개체 인식)

기본 로봇 대신, 그들이 **SecureBERT+**라는 특수한 두뇌를 사용했습니다. 이는 과거에 작성된 모든 사이버 범죄 보고서를 읽은 탐정이라고 생각하세요.

  • 업그레이드: 이 두뇌에 '안전망' (CRF 레이어) 을 추가했습니다. 기존 시스템에서 로봇이 단어를 '이름의 시작'으로 표시했다가 '이름의 끝' 표시를 잊어 버려 문장이 깨지는 경우가 있었습니다. 안전망은 레이블이 항상 서로 의미 있게 연결되도록 보장합니다. 마치 주변 조각이 맞아야만 들어맞는 퍼즐 조각과 같습니다.
  • 결과: 이 시스템은 텍스트 내에서 해커, 멀웨어, IP 주소와 같은 21 가지 유형의 '용의자'를 찾는 데 훨씬 더 뛰어나며, 실수를 약 3~4% 줄였습니다.

2. "규칙책" (더 나은 관계 추출)

용의자들이 발견되면, 시스템은 점들을 연결해야 합니다.

  • 업그레이드: 그들은 특정 도메인 온톨로지를 만들었습니다. 이는 "해커는 도구를 사용한다"거나 "도구는 컴퓨터를 공격한다"라고 말하는 엄격한 규칙책이나 흐름도라고 상상해 보세요.
  • 도움: AI 가 약간 혼란스러워하더라도 규칙책이 심판 역할을 합니다. AI 가 '컴퓨터'를 '날짜'와 '연관되어 있다'고 말하려 할 때 그 방식이 논리적이지 않다면 규칙책이 이를 수정합니다. 이는 연결 (관계) 이 논리적이고 정확하도록 보장합니다.
  • 결과: 이는 점들을 연결하는 정확성을 최대 8% 까지 향상시켰습니다.

3. "훈련장" (새로운 데이터)

저자들은 새로운 탐정들을 가르치기 위해 낡고 지저분한 데이터만 사용하지 않았습니다. DNRTI-AUG-STIX2라는 새롭고 매우 깨끗한 훈련 세트를 만들었습니다.

  • 그들은 기존 보고서를 가져와 AI 가 이전에 본 적 없는 것들에 혼란을 겪지 않도록 희귀한 유형의 해커와 도구에 대한 더 많은 예시 (데이터 증강) 를 추가했습니다.
  • 또한 학습 과정을 매끄럽게 만들기 위해 유사한 범주 (예: 다른 유형의 해시 코드) 를 병합했습니다.

결과: 더 선명한 그림

저자들은 이 새로운 데이터 세트를 사용하여 기존 시스템과 비교하여 새로운 시스템을 테스트했습니다.

  • 점수: 그들의 새로운 시스템은 0 에서 1 까지의 척도에서 훨씬 더 높은 점수를 기록했습니다 (특히 이름 찾기는 F1 점수가 3~4% 향상되었고, 연결 찾기는 최대 8% 향상됨).
  • 증거: 그들은 한 가지 유형의 보고서에서만 테스트한 것이 아니라, 어떤 종류의 사이버 보고서든 읽든 상관없이 작동함을 증명하기 위해 세 가지 다른 데이터 세트 (DNRTI-AUG-STIX2, DNRTI, STUCCO) 에서 테스트했습니다.

결론

이 논문은 해커를 막거나 미래를 예측한다고 주장하지 않습니다. 대신, 보안 전문가들을 위한 더 나은 도구를 구축했다고 주장합니다. "조립 라인" 오류를 수정하고 AI 에게 "해커" 언어를 가르침으로써, 그들은 지저분한 텍스트를 사이버 위협의 명확하고 신뢰할 수 있는 지도로 변환하는 시스템을 만들었습니다. 이 지도는 정보가 정확하고 질의하기 쉬우므로 보안 팀이 더 빠르고 정보에 입각한 결정을 내리는 데 도움이 됩니다.

저자들은 다른 연구자들이 더 나은 시스템을 구축할 수 있도록 새로운 "훈련 데이터"와 "규칙책"을 GitHub 에 공유하기도 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →