← 최신 논문
🤖 AI

Semantic-Aware Advanced Persistent Threat Detection Using Autoencoders on LLM-Encoded System Logs

본 논문은 오토인코더로 처리된 시스템 로그의 거대 언어 모델 생성 의미론적 임베딩을 활용하여, 은밀하고 느리게 진행되는 공격 동작의 의미론적 의도를 효과적으로 포착함으로써 DARPA Transparent Computing 데이터셋에 대한 기존 비지도 학습 베이스라인보다 우수한 성능을 입증하는 새로운 지능형 지속 위협 탐지 방법을 제안한다.

원저자: Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백만 가지의 일들이 매초 발생하는 거대하고 북적이는 도시를 상상해 보십시오. 사람들이 걷고, 자동차가 달리고, 불이 켜지고 꺼지며, 문이 열리는 일들 말입니다. 디지털 세계에서 이 도시는 컴퓨터 네트워크이며, 이 "일어나는 일들"은 **시스템 로그(system logs)**입니다. 이 로그는 프로그램이 취하는 모든 행동을 기록하는 도시의 보안 카메라이자 경찰 보고서입니다.

문제점: 건초더미 속에 숨겨진, 건초처럼 보이는 '바늘'
보통 보안 시스템은 이상하거나 희귀한 것을 찾아내어 "나쁜 놈"을 포착합니다. 하지만 이 이야기의 악당들은 **지능형 지속 위협(APT)**입니다. 이들을 생각할 때, 시끄러운 은행 강도가 아니라 숙련된 스파이라고 상상해 보십시오.

  • 그들은 침입하는 것이 아니라, 몰래 잠입합니다.
  • 그들은 뛰는 것이 아니라, 느릿하고 조용하게 걷습니다.
  • 그들은 도시의 도구들을 사용합니다 (예를 들어, 청소부가 무기를 숨기기 위해 대걸레 양동이를 사용하는 것처럼) 자신의 나쁜 짓을 수행합니다.

이 스파이들은 일반적인 사람들과 너무나 흡사하게 행동하기 때문에, 기존의 보안 방식(단순히 단어가 얼마나 자주 등장하는지 세거나 통계적 특이점을 찾는 방식)은 이들을 놓치기 쉽습니다. 이는 빨간 모자를 쓴 사람의 수를 세는 것만으로 군중 속에서 스파이를 찾으려는 것과 같습니다. 만약 스파이가 빨간 모자를 쓰고 있다면, 당신은 그를 놓치게 됩니다.

해결책: "번역기"와 "기억의 거울"
이 논문의 저자들은 MPNet-AE라고 불리는 새로운 시스템을 구축했습니다. 그들은 이 스파이들을 잡기 위해 두 가지 주요 도구를 사용했습니다.

  1. 번역기 (LLM/MPNet):
    가공되지 않은 지저분한 컴퓨터 코드 대신, 이 시스템은 먼저 번역기 역할을 합니다. 시스템은 건조하고 기술적인 로그(예: "Process 1054 started /bin/bash")를 가져와 사람이 읽을 수 있는 자연스러운 영어 문장으로 변환합니다.
  • 비유: 식료품 목록을 하나의 이야기로 바꾸는 것을 상상해 보십시오: "요리사가 칼을 집어 들고 양파를 썰기 시작했다."
  • 그런 다음, 시스템은 이 이야기의 의미를 이해하기 위해 매우 똑똑한 AI 두뇌(MPNet, 대규모 언어 모델의 일종)를 사용합니다. 이는 모든 행동에 대한 "의미론적 지문(semantic fingerprint)"을 생성합니다. 이 지문은 단어가 아닌, 행동의 의도를 포착합니다.
  1. 기억의 거울 (오토인코더, Autoencoder):
    다음으로, 시스템은 오토인코더라는 머신러닝 모델을 사용합니다. 이것을 "착한 행동"만을 공부하는 학생이라고 생각하십시오.
  • 이 학생은 정상적이고 안전한 도시 활동의 수천 가지 사례("양성" 데이터)를 학습합니다.
  • 학생은 이러한 패턴을 완벽하게 암기하려고 노력합니다.
  • 새로운 이벤트가 발생하면, 학생은 기억으로부터 이를 "재구성(reconstruct)"하려고 시 합니다.
  • 함정: 만약 이벤트가 정상적이라면, 학생은 이를 완벽하게 재현할 수 있습니다. 하지만 만약 이벤트가 겉으로는 정상적으로 보이지만 실제로는 교활한 스파이의 행동이라면, 학생은 혼란에 빠져 이를 정확하게 재현하는 데 실패합니다.
  • 이 "재구성의 실패"가 바로 경보를 울립니다. 실수가 클수록, 그것이 스파이일 가능성이 높다는 뜻입니다.

테스트: 디지털 범죄 현장
연구진은 DARPA Transparent Computing 프로젝트의 데이터를 사용하여 이 시스템을 테스트했습니다. 이것은 "레드 팀(윤리적 해커)"이 시스템을 뚫기 위해 만든, 공격받는 도시를 구현한 거대하고 현실적인 시뮬레이션입니다.

  • 데이터는 매우 지저분하고 불균형했습니다. 수백만 개의 정상적인 행동 중 실제 공격은 0.004% 미만이라는 아주 적은 부분에 불과했습니다.
  • 그들은 이 새로운 "번역기 + 거울" 시스템을 세 가지 구식 방법과 비교했습니다.
    • Isolation Forest: 건초더미를 흔들어 바늘을 찾는 것과 같습니다.
    • OC-SVM: 정상적인 것들 주위에 타이트한 원을 그려서 그 밖의 것은 나쁘다고 규정하는 것과 같습니다.
    • PCA: 3D 물체를 2D로 찌그러뜨려 모양을 확인하는 것과 같습니다.

결과
새로운 시스템이 압도적인 승리를 거두었습니다.

  • "번역기"가 효과를 입증했습니다: 로그의 의미를 이해함으로써, 시스템은 시스템 관리자가 비밀번호를 재설정하는 것(정상)과 해커가 동일한 행동을 하지만 악의적인 의도를 가진 것(비정상) 사이의 차이를 구별할 수 있었습니다.
  • "거울"이 스파이를 잡았습니다: 이 시스템은 기존 방식들보다 훨씬 높은 정확도(AUC-ROC라는 점수로 측정됨)로 공격을 일관되게 식별해 냈습니다.
  • 승리한 이유: 기존 방식들이 지문을 보고 지문의 능선을 세는 수준이었다면, 새로운 방식은 그 지문이 들려주는 이야기를 보았습니다. 스파이들이 숨어들려고 노력하더라도, 그들의 "이야기"는 정상적인 도시의 "이야기"와 일치하지 않았고, 시스템은 그들을 잡아냈습니다.

요약
이 논문은 눈앞에서 숨어 있는 숙련된 스파이를 잡기 위해서는 단순히 숫자를 세는 것만으로는 부족하다는 것을 보여줍니다. 행동 뒤에 숨겨진 이야기를 이해해야 합니다. 컴퓨터 로그를 의미 있는 언어로 번역하고, "기억의 거울"을 사용하여 맞지 않는 이야기를 찾아냄으로써, 우리는 이전보다 훨씬 더 정교하고 은밀한 장기 사이버 공격을 더 잘 탐지할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →