← 최신 논문
🤖 machine learning

TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge

본 논문은 사이버 보안 위협 인텔리전스 분야에서 최첨단 성능을 달성하기 위해 분석가 전문가 지식과 미세 조정된 SecureBERT+ 를 다중 시퀀스 레이블링 프레임워크 내에서 활용하는 새로운 공동 개체 및 관계 추출 모델인 TIJERE 를 소개하며, 자동화된 위협 분석의 기존 격차를 해소하기 위해 최초로 공개된 공동 레이블링 데이터셋인 DNRTI-JE 를 함께 공개합니다.

원저자: Inoussa Mouiche, Sherif Saad

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Inoussa Mouiche, Sherif Saad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마치 거대한 사이버 범죄 사건을 해결하려는 형사가 되어보세요. 수천 건의 지저분하고 정리되지 않은 경찰 보고서 (위협 정보 보고서) 를 가지고 있는데, 이는 기술적 전문 용어와 모호한 설명이 섞여 있습니다. 당신의 목표는 누가 무엇을 누구에게 언제했는지를 정확히 보여주는 거대하고 체계적인 지도 (지식 그래프) 를 구축하는 것입니다.

예를 들어, "APT29"(해커 그룹) 가 "Mimikatz"(도구) 를 사용하여 "XYZ 은행"(피해자) 을 공격했다는 사실을 파악해야 합니다.

이 논문은 이러한 형사 작업을 자동화하는 새로운 도구인 TIJERE를 소개합니다. 그 작동 원리를 간단히 설명하면 다음과 같습니다:

문제: "파이프라인" 대 "연합" 접근법

이전에는 컴퓨터가 이 문제를 두 개의 별도 단계 (공장 조립 라인처럼) 로 해결하려 했습니다:

  1. 1 단계: 사람, 그룹, 도구의 모든 이름을 찾습니다 (명명 개체 인식).
  2. 2 단계: 해당 이름들을 보고 어떻게 연결되어 있는지 추측합니다 (관계 추출).

결함: 1 단계에서 사소한 실수 (예: 도구를 사람으로 잘못 식별) 가 발생하면 그 오류가 2 단계로 전달되어 전체 지도를 망쳐버립니다. 또한, 사이버 보고서의 문장은 종종 지저분합니다. 한 문장에 "APT29 가 도구 A 를 사용하여 은행 X 를 공격했다"고 명시되어 있으면서도, 동시에 "도구 A 는 APT29 에 의해 사용되었다"는 뉘앙스를 풍길 수 있습니다. 같은 단어가 다른 역할로 등장할 때, 특히 어떤 연결이 무엇인지에 대해 컴퓨터가 혼란을 겪습니다.

해결책: TIJERE ("전문 형사" 시스템)

TIJERE 는 두 단계를 하나의 통합된 두뇌에서 동시에 수행함으로써 게임을 바꿉니다. 하지만 TIJERE 는 원시 텍스트에만 의존하지 않고 인간 전문가처럼 행동하기 위해 세 가지 교묘한 수법을 사용합니다:

1. "전문 지식" 치트 시트 (전문 도메인 특징)

*"APT29 가 Mimikatz 를 사용했다"*는 문장을 읽는다고 상상해보세요.

  • 일반 컴퓨터는 "APT29"와 "Mimikatz"를 그저 무작위 단어처럼 봅니다. Mimikatz 가 무엇인지 모르기 때문에 이를 사람의 이름으로 오해할 수 있습니다.
  • TIJERE는 특별한 치트 시트를 가지고 있습니다. "APT29"는 해커 그룹이고 "Mimikatz"는 도구라는 것을 알고 있습니다.
  • 비유: 이는 컴퓨터에게 모든 객체의 유형을 강조하는 안경을 안겨주는 것과 같습니다. "해커 그룹"과 "도구"를 보자마자 해커가 도구를 사용한다는 사실 때문에 관계가 "사용"일 가능성이 높다는 것을 즉시 알게 됩니다. 이로 인해 컴퓨터는 모호한 단어에 혼란을 겪지 않게 됩니다.

2. "형광펜" (개체 마스킹)

많은 이름이 포함된 길고 복잡한 문장에서 어떤 두 이름이 서로 대화하고 있는지 컴퓨터가 파악하기는 어렵습니다.

  • TIJERE는 디지털 형광펜을 사용합니다. "APT29"와 "Mimikatz" 사이의 연결을 볼 때, 그 두 단어만 강조하고 문장의 나머지 모든 것을 "배경 잡음"으로 변환합니다.
  • 비유: 이는 붐비는 교실에서 두 명의 특정 학생을 가리켜 질문을 하고 나머지는 무시하는 교사의 레이저 포인터와 같습니다. 이는 컴퓨터가 관련 있는 쌍에만 엄격하게 집중하도록 돕습니다.

3. "복제본" 전략 (다중 시퀀스 라벨링)

이것이 이 논문의 가장 큰 혁신입니다. 일반적으로 컴퓨터는 문장을 한 번 읽고 모든 관계를 한 번에 추측합니다.

  • TIJERE는 한 문장을 가져와서 그 문장 내의 모든 가능한 항목 쌍을 위해 별도의 맞춤형 복사본을 생성합니다.
  • 비유: 세 쌍의 용의자가 포함된 문장이 있다고 가정해 보세요. 컴퓨터에게 한 번에 퍼즐 전체를 해결하라고 요구하는 대신, TIJERE 는 문장의 세 개의 별도 복사본을 만듭니다.
    • 복사본 A 는 말합니다: "여기 쌍 (APT29, Mimikatz) 이 있습니다. 그들의 관계는 무엇입니까?"
    • 복사본 B 는 말합니다: "여기 쌍 (APT29, 은행) 이 있습니다. 그들의 관계는 무엇입니까?"
    • 복사본 C 는 말합니다: "여기 쌍 (Mimikatz, 은행) 이 있습니다. 그들의 관계는 무엇입니까?"
  • 문제를 이러한 작고 집중된 질문들로 분해함으로써 컴퓨터는 "중첩"되는 관계들로 인해 압도되지 않게 됩니다.

특별한 사전 (SecureBERT+)

사이버 보안 보고서는 "EternalBlue"나 "Spear-phishing"과 같이 일반 컴퓨터가 잘 이해하지 못하는 매우 구체적인 언어를 사용합니다. TIJERE 는 **SecureBERT+**라는 언어 모델의 특별한 버전을 사용합니다.

  • 비유: 이는 표준 영어 사전이 아니라 스파이와 해커를 위해 특별히 작성된 사전으로 컴퓨터를 훈련시키는 것과 같습니다. 이는 사이버 세계의 "속어"를 이해하는 데 도움이 됩니다.

결과: 새로운 지도와 새로운 점수판

이것이 작동함을 증명하기 위해 저자들은 두 가지 일을 수행했습니다:

  1. 새로운 데이터셋 (DNRTI-JE) 구축: 기존 보고서를 가져와 이름과 관계를 모두 수동으로 라벨링했습니다. 이는 사이버 보안을 위해 "연합 라벨링"된 데이터셋이 공개된 첫 번째 사례입니다.
  2. 모델 테스트: TIJERE 를 다른 방법들과 비교하여 실행했을 때, 명백한 승자가 되었습니다.
    • 이름 (개체) 을 **93%**의 정확도로 올바르게 식별했습니다.
    • 관계를 **98%**의 정확도로 올바르게 식별했습니다.

요약

TIJERE 는 단순히 보고서를 읽는 것이 아니라, 관련된 캐릭터의 유형을 이해하고, 올바른 쌍에 초점을 맞추기 위해 형광펜을 사용하며, 복잡한 문장을 간단한 일대일 인터뷰로 분해하는 초능력을 가진 형사라고 생각하세요. 이를 전문적인 "해커 사전"과 결합함으로써, 이전보다 훨씬 더 정확한 사이버 위협 지도를 구축합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →