← 최신 논문
🤖 machine learning

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

이 논문은 시스템, 네트워크 및 브라우저 로그가 세밀한 MITRE ATT&CK 기법으로 레이블링된 870개의 세션으로 구성된 새로운 다중 소스 사이버 보안 데이터셋을 소개하며, 이 데이터를 통해 소형 언어 모델을 미세 조정하는 것이 악성 이벤트를 분류하고 공격 기법을 식별하는 능력을 크게 향상시킨다는 것을 입증한다.

원저자: Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 번잡한 사무실 건물에서 미스터리를 해결하려고 한다고 상상해 보세요. 도둑을 잡기 위해서는 단순히 보안 카메라(네트워크 로그)만 봐서는 안 됩니다. 또한 직원 출입 카드 태그 기록(시스템 로그)과 커피숍이나 온라인 상점의 영수증(브라우저 로그)도 확인해야 합니다. 하나의 소스만 본다면 도둑은 쉽게 숨을 수 있습니다.

이 논문은 컴퓨터 탐정들을 위한 매우 상세한 훈련 매뉴얼을 구축하고, 새로운 유형의 "스마트 비서"(Small Language Model, 소규모 언어 모델)가 이 매뉴얼을 사용하여 도둑을 찾아내는 법을 배울 수 있는지 테스트하는 것에 관한 내용입니다.

다음은 그들이 수행한 작업을 쉬운 비유를 사용하여 정리한 것입니다.

1. 문제점: "눈먼 탐정"

현재 대부분의 컴퓨터 보안 데이터셋은 탐정에게 주차장 지도만 건네주는 것과 같습니다. 그들은 건물 내부에서 일어난 일(시스템 로그)이나 사람이 컴퓨터 화면에서 무엇을 보고 있었는지(브라우저 로그)를 놓치게 됩니다.

  • 공백: 기존 데이터는 브라우저 활동이 빠져 있거나, 시스템 활동이 빠져 있거나, 혹은 단순히 "나쁜 놈" 또는 "착한 놈"이라고만 말할 뿐, 그 나쁜 놈이 어떻게 그 일을 저질렀는지(예: 어떤 특정 자물쇠 따기 기술을 사용했는지) 설명하지 못합니다.
  • 목표: 저자들은 모든 것(시스템 + 네트워크 + 브라우저)이 동시에 발생하는 상황을 포착하고, 모든 악의적인 움직임에 대해 MITRE ATT&CK이라는 유명한 보안 플레이북의 특정 "기술 이름"을 라벨링하여 담은 데이터셋을 만들고자 했습니다.

2. 해결책: "미스터리 시뮬레이터" 구축

저자들은 단순히 공격이 어떻게 보이는지 추측한 것이 아니라, 현실적인 시뮬레이션 실험실을 구축했습니다.

  • 설정: 그들은 실제 멀웨어를 실행해도 아무도 해치지 않는 안전하고 격리된 디지털 방(실험실)을 설정했습니다.
  • 배역: 그들은 870회의 세션(시뮬레이션)을 실행했습니다.
    • 800회의 세션은 "착한 사람들"이 일반적인 업무(웹 서핑, 이메일 작성, 코딩 등)를 수행하는 것이었습니다.
    • 70회의 세션은 "나쁜 사람들"이 실제 해킹 도구(원격 제어 트로이 목마 및 랜섬웨어 등)를 사용하여 데이터를 훔치거나 컴퓨터를 잠그는 과정이었습니다.
  • 결과: 그들은 약 230만 개의 이벤트(발자국, 문 열림, 전화 통화 등)를 수집하고 라벨링했습니다. 이 데이터는 12가지의 서로 다른 공격 목표에 걸쳐 53가지의 서로 다른 해킹 기술을 다룹니다.
  • "청크(Chunk)": 컴퓨터가 읽기 쉽게 만들기 위해, 데이터를 "청크"라고 불리는 작은 묶음으로 그룹화했습니다. 청크는 공격의 7초짜리 영상 클립이라고 상상하면 됩니다. 컴퓨터는 이 7단계의 시퀀스를 보고 "이것은 평범한 하루인가, 아니면 강도가 들고 있는 상황인가?"를 결정해야 합니다.

3. 테스트: "스마트 비서" 훈련시키기

그들은 세 가지 작고 효율적인 AI 모델(SLM—거대하고 무거운 슈퍼컴퓨터가 아닌, 똑똑하지만 컴팩트한 비서라고 생각하세요)을 가져와서 이 새로운 데이터셋을 사용하여 가르치는 실험을 했습니다.

  • 모델: 그들은 Qwen, Lsa, Phi라는 세 가지 서로 다른 "두뇌"를 사용했습니다.
  • 방법: 그들은 LoRA라는 기술을 사용했습니다. 이것은 AI의 전체 두뇌를 다시 쓰는 대신, AI에게 게임의 규칙이 적힌 특화된 치트 시트나 포스트잇을 주는 것과 같습니다. 이는 빠르고 저렴합니다.

4. 결과: "무지함"에서 "전문가"로

결과는 드라마틱했습니다. 마치 눈이 가려진 사람을 순식간에 날카로운 눈을 가진 탐정으로 바꾼 것과 같았습니다.

  • 훈련 전 (기본 모델):

    • AI는 형편없었습니다. 정답률은 약 **8%**였습니다.
    • 치명적 결함: AI는 "늑대 소리 지르는(cry wolf)" 기계였습니다. 너무 과하게 예민해서 거의 모든 정상적인 세션을 공격으로 분류했습니다. 이는 마치 사무실에 들어오는 모든 사람을 도둑이라고 생각하는 보안 요원과 같습니다. 실생활에서는 너무 많은 오보를 만들어내기 때문에 쓸모가 없었습니다.
  • 훈련 후 (미세 조정된 모델):

    • AI는 매우 뛰어났습니다. 정확도가 90%에서 97% 사이로 급증했습니다.
    • AI는 드디어 일반 사용자의 웹 서핑과 데이터 탈취를 시도하는 해커를 구분할 수 있게 되었습니다.
    • 승자: Phi-4-Mini 모델이 가장 우수했으며, 공격의 **97%**를 잡아냈습니다. 다른 모델들도 훌륭했지만, Llama는 절반 이상의 공격을 놓쳤습니다.
  • "기술 명칭" 챌라인지:

    • AI는 "이것은 공격이다"라고 말하는 데는 매우 능숙해졌지만, 정확한 특정 기술 명칭(예: "T1059.001을 사용함")을 대는 데는 여전히 다소 불안정했습니다.
    • 가장 좋은 모델조차 정확한 이름을 맞춘 비율은 **42%**였습니다. 하지만 AI는 일반적인 개념(부분 일치)을 맞히는 데는 매우 뛰어났습니다. 즉, 기술적인 용어를 완벽하게 철자까지 맞히지는 못하더라도 그 논리는 이해하고 있었다는 뜻입니다.

5. 시사점

이 논문은 두 가지 주요 사실을 증명합니다.

  1. 데이터셋의 유효성: 실제 공격 시뮬레이션을 사용하여 고품질의 다중 소스 데이터셋을 만들 수 있으며, 여기에는 컴퓨터가 학습할 수 있는 명확한 패턴이 포함되어 있습니다.
  2. 훈련의 필수성: 일반적인 AI를 가져온다고 해서 해커를 잡을 수 있다고 기대해서는 안 됩니다. 반드시 특정 보안 데이터로 "미세 조정(fine-tuning)"되어야 합니다. 이러한 훈련 없이는 AI가 너무 예민하여 실무에서 사용할 수 없습니다. 훈련을 거치면, 이 작은 비서들은 보안 팀이 경보를 빠르게 분류(triage)할 수 있도록 돕는 강력한 도구가 될 수 있습니다.

요약하자면, 그들은 현실적인 "해킹 시뮬레이터"를 만들었고, 세 명의 작은 AI 비서에게 나쁜 놈들을 식별하는 법을 가르쳤으며, 적절한 훈련이 있다면 이 작은 비서들이 매우 효과적인 보안 요원이 될 수 있음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →