Vendor-Conditioned Contrastive Learning for Predicting Organizational Cyber Threat Targets
본 논문은 352,866 개의 대규모 다중 소스 포스트 코퍼스를 활용하여 조직의 사이버 위협 표적을 예측하는 데 있어 최첨단 정확도를 달성하고 시간적 분포 변화에 대한 강건성을 입증하는 CySecBERT 기반 벤더 조건부 대비 학습 프레임워크인 TRACE 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷의 지하를 상상해 보세요. 해커들이 컴퓨터 침입을 위한 비밀, 도구, 설계도를 거래하기 위해 모이는 거대하고 혼란스러운 바자회입니다. 이러한 "해커 포럼"에는 매일 수천 개의 게시물이 쏟아집니다. 보안 전문가들이 직면한 핵심 질문은 다음과 같습니다: 이들 해커는 누구를 공격하려 하고 있을까요? 그들은 은행, 비디오 게임 회사, 아니면 병원 시스템을 표적으로 삼고 있을까요?
이 논문은 그 질문에 답하기 위해 TRACE(Exploits의 시간적 표현 및 분류) 라는 새로운 도구를 소개합니다. 이는 마치 초지능 탐정처럼 작동합니다. 그 작동 원리는 다음과 같이 단순한 개념으로 나누어 설명할 수 있습니다:
1. 문제: 해커들의 언어는 변합니다
해커 은어를 빠르게 진화하는 사투리로 생각해보세요. 오늘날의 십대들이 20 년 전과 다른 단어를 사용하는 것처럼, 해커들도 자신의 도구를 설명하는 방식을 바꿉니다. 과거 포럼 게시물로 훈련된 모델 (컴퓨터 프로그램) 은 어휘가 변화했기 때문에 새로운 게시물에 혼란을 겪을 수 있습니다.
만약 탐정을 2010 년대의 범죄 보고서로 훈련시킨다면, 범죄자들이 새로운 암호를 사용하기 때문에 2025 년의 범죄를 놓칠 수 있습니다. 이 논문은 대부분의 기존 도구가 실패한 이유는 바로 이 "시간 여행" 문제를 고려하지 않았기 때문이라고 주장합니다. 그들은 과거 데이터에서는 잘 작동했지만, 새로운 미래 데이터를 마주했을 때 주저앉았습니다.
2. 데이터: 거대한 시간 캡슐
TRACE 를 구축하기 위해 연구자들은 몇몇 포럼만 살펴보지 않았습니다. 그들은 1990 년부터 2026 년까지 30 년에 걸쳐 35 개의 다양한 출처 (해커 포럼, 버그 데이터베이스, 다크웹 시장 등) 에서 나온 870 만 개의 게시물이 담긴 거대한 "시간 캡슐"을 파헤쳤습니다.
이 방대한 텍스트 산에서 연구자들은 명확하게 대상 기업이나 산업을 언급한 129,126 개의 특정 게시물을 정제하고 정리했습니다. 이를 다음과 같은 일곱 개의 "통" (범주) 으로 분류했습니다:
- CMS / 오픈 소스 (예: WordPress 또는 Linux)
- 엔터프라이즈 소프트웨어 (예: 대형 기업용 도구)
- 게임
- 네트워킹
- 기타 등등.
3. 해결책: TRACE 의 "두 뇌" 접근법
TRACE 는 사이버 보안 전문 용어에 대해 이미 상당한 지식을 갖춘 CySecBERT라는 사전 훈련된 AI 뇌를 기반으로 구축되었습니다. 하지만 연구자들은 **대비 학습 (Contrastive Learning)**을 통해 이를 특별히 업그레이드했습니다.
이 업그레이드를 정리 게임으로 생각해보세요:
- 목표: AI 는 해커 게시물이 어느 "통" (산업) 에 속하는지 추측해야 합니다.
- 비법: 연구자들은 AI 에게 "통을 추측하기 전에 먼저 벤더(회사 이름) 로 게시물을 그룹화하세요"라고 지시했습니다.
- 두 개의 게시물이 "Microsoft"를 언급한다면, AI 는 서로 다른 제품에 대해 이야기하더라도 그들의 내부 "정신 지문"이 매우 유사해지도록 강요받습니다.
- 두 개의 게시물이 "Google"과 "Microsoft"를 각각 언급한다면, AI 는 그들의 지문이 매우 다르게 보이도록 강요받습니다.
이것이 왜 도움이 될까요?
혼란스럽게 섞인 양말 더미를 정리한다고 상상해보세요. 단순히 색상 (산업) 만 보면 일부 양말이 비슷해서 혼란스러울 수 있습니다. 하지만 먼저 브랜드 (벤더) 로 그룹화하면 그 브랜드의 특정 패턴을 배우게 됩니다. AI 가 Microsoft 나 Apple 의 "브랜드 패턴"을 이해하게 되면, 시간이 지남에 따라 언어가 변하더라도 그들이 속한 산업을 추측하는 능력이 훨씬 향상됩니다.
4. 테스트: "미래" 도전
연구자들은 TRACE 를 무작위 데이터로만 테스트하지 않았습니다. 그들은 시간 여행 테스트를 설정했습니다:
- 훈련: AI 는 2022 년 이전의 게시물을 공부했습니다.
- 테스트: 그런 다음 AI 는 2024 년 및 그 이후의 게시물에 대한 표적을 예측하도록 요청받았습니다.
이는 2020 년 교과서로 학생을 가르친 후, 2025 년 뉴스 기반의 기말고사를 치르게 하는 것과 같습니다. 대부분의 다른 방법들은 새로운 언어를 처리하지 못해 이 테스트에 실패했습니다.
5. 결과: 새로운 챔피언
TRACE 는 경쟁자들을 압도했습니다.
- 점수: 미래 데이터에서 97% 의 정확도(구체적으로 97.00% 의 매크로 F1 점수) 를 달성했습니다.
- 경쟁: 표준 머신러닝 모델과 기타 고급 AI 트랜스포머를 포함한 17 가지 다른 방법들을 제쳤습니다.
- 비밀 재료: 논문은 AI 가 사용한 사전의 유형이 AI 의 구조보다 더 중요하다는 것을 발견했습니다. 일반 영어로 훈련된 AI 보다 해커 텍스트로 특별히 훈련된 AI(CySecBERT) 가 훨씬 우수했습니다. furthermore, "벤더 정리" 비법 (대비 학습) 은 특히 게임과 같은 드문 범주에서 정확도를 거의 20% 향상시키는 등 큰 부스트를 주었습니다.
요약
간단히 말해, 이 논문은 포럼 게시물을 분석하여 해커가 어떤 조직을 표적으로 삼고 있는지 예측하는 TRACE라는 도구를 제시합니다. 이전 도구들보다 더 잘 작동하는 이유는 다음과 같습니다:
- 실제 해커들의 수다를 담은 30 년 치의 방대한 데이터셋을 사용합니다.
- AI 가 먼저 회사별 패턴을 인식하도록 가르치는 "벤더 조건부" 비법을 사용합니다.
- 결코 보지 못한 연도의 데이터에서도 표적을 성공적으로 예측함으로써 미래에 대처할 수 있음을 입증합니다.
그 결과, 보안 팀이 "이제 해커들이 우리 산업에 대해 이야기하고 있군요"라고 빠르게 이해하고 공격 발생 전에 스스로 방어할 수 있도록 돕는 시스템이 탄생했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.