← 최신 논문
💻 computer science

From Telemetry to Techniques: Behavior-Centric MITRE ATT&CK Technique Classification Through Sysmon Event Correlation

본 논문은 MITRE ATT&CK 기법 분류를 개선하기 위해 Sysmon 이벤트를 GUID 상관관계가 있는 시퀀스로 재구성하는 행위 중심 프레임워크를 제안하며, 프로세스 수준의 컨텍스트를 보존하는 것이 시간적 그룹화보다 성능이 우수하다는 점과 베이스라인인 SecureBERT 모델이 명시적인 클래스 불균형 완화 없이도 우수한 결과를 달성한다는 것을 입증한다.

원저자: Amir Hossein Hemmati, Babak Sadeghiyan, Mahsa Saeidi

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amir Hossein Hemmati, Babak Sadeghiyan, Mahsa Saeidi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 혼란스러운 도시에서 미스터리를 풀려는 탐정이라고 상상해 보십시오. 이 도시는 당신의 컴퓨터이며, "용의자"들은 침입을 시도하는 사이버 범죄자들입니다. 오랫동안 탐정들(보안 시스템)은 특정하게 작성된 "지명 수배" 포스터를 찾는 방식으로 범인을 잡으려 노력했습니다. 그들은 범죄자가 특정 얼굴(해시)을 가졌는지, 혹은 특정 모자(IP 주소)를 쓰고 있는지 확인했습니다. 하지만 현대의 범죄자들은 매우 영리하여 그들의 얼굴과 모자를 끊임없이 바꿉니다. 그래서 예전의 포스터들은 더 이상 효과가 없습니다.

이 논문은 이들을 잡기 위한 새로운 방법을 제시합니다. 단일 스냅샷을 보는 대신, 그들이 하는 행동의 전체 이야기를 지켜봐야 한다는 것입니다.

단서 노트: Sysmon

연구진들은 Sysmon이라는 특별한 노트(기록장)를 사용했습니다. Sysmon을 컴퓨터 도시에서 일어나는 모든 일을 기록하는 초집중 관찰 보안 요원이라고 생각하십시오. 이 요원은 프로그램이 시작될 때, 파일이 생성될 때, 인터넷 연결이 이루어질 때, 심지어 누군가 몰래 파일의 타임스탬프를 변경하려고 할 때(마치 도둑이 문손잡이에서 지문을 닦아내는 것처럼)까지 모두 기록합니다.

문제는 무엇일까요? 이 요원은 너무 많은 것을 적는다는 점입니다. 이는 마치 427,774개의 항목이 담긴 일기를 가지고 있는데, 그중 대부분은 소음에 불과한 것과 같습니다. 이를 이해하기 위해 연구진은 일기 내용을 정리하고, 의미 있는 이야기 단위로 그룹화해야 했습니다.

단서를 그룹화하는 두 가지 방법

연구진은 흩어진 일기 항목들을 하나의 일관된 이야기로 엮어내는 두 가지 서로 다른 방식을 테스트하여, 어떤 방식이 범죄자의 "움직임"(MITRE ATT&CK 기법이라 불림)을 식별하는 데 도움이 되는지 확인했습니다.

1. "가계도" 방식 (GUID 기반 상관관계)
컴퓨터에서 실행되는 모든 프로그램에는 GUID라고 불리는 영구적이고 변하지 않는 ID 카드가 부여된다고 상상해 보십시오. 설령 프로그램이 종료되고 동일한 이름의 새로운 프로그램이 시작되더라도, 그것은 새로운 ID 카드를 받게 됩니다. 기존의 ID 카드는 해당 프로그램의 "가족 나무(가계도)"와 함께 남습니다.

  • 작동 원의: 연구진은 동일한 ID 카드에 속하는 모든 단서들을 연결했습니다. 만약 부모 프로그램(예: explorer.exe)이 자식 프로그램을 실행했고, 그 자식 프로그램이 파일을 열고 나서 전화번호로 연결을 시도했다면, 시스템은 이들이 모두 동일한 가족 ID를 공유하기 때문에 이들을 하나로 묶었습니다.
  • 결과: 이 방식은 범죄자 행동의 완전한 가계도를 가진 것과 같았습니다. 누가 무엇을 했고 어떤 순서로 진행했는지를 정확히 보여주었으며, 이벤트 간의 관계를 보존했습니다.

2. "타임스탬프" 방식 (시간 기반 상관관계)
이 방식은 가계도를 무시하고 오직 시계만을 바라보았습니다.

  • 작동 원리: 연구진은 "만-약 두 사건이 1초 이내에 발생했다면, 그것들은 서로 연관되어 있다"라고 가정했습니다. 그들은 시간상으로 가까이 발생한 이벤트들을 그룹화했습니다.
  • 결과: 이것은 군중 속에서 사람들이 서로 근처에 서 있다는 이유만으로 그들이 한 팀이라고 가정하는 것과 같았습니다. 때로는 사실일 수도 있지만, 더 깊은 연결 고리를 놓치곤 했습니다. 서로 관련 없는 두 사건이 우연히 동시에 발생할 수도 있고, 범죄자의 행동이 몇 초에 걸쳐 분산되어 있어 "1초 규칙"을 깨뜨릴 수도 있기 때문입니다.

판결: 가계도의 승리

연구진은 Atomic Red Team이라는 도구를 사용하여 통제된 실험실 환경에서 사이버 공격을 시뮬레이션하며 대규모 실험을 진행했습니다. 그들은 이 "이야기"들을 다양한 유형의 탐정(머신러닝 모델)들에게 입력하여, 누가 범죄자의 기법을 가장 잘 맞히는지 테스트했습니다.

주요 발견:
"가계도" 방식(GUID 기반)이 전 영역에 걸쳐 "타임스탬프" 방식(시간 기반)보다 일관되게 우수한 성능을 보였습니다.

  • 최고의 탐정은 SecureBERT(사이버 보안에 특화된 언어 모델)라는 초지능 AI였습니다.
  • SecureBERT가 "가계도" 이야기를 읽었을 때, 0.586의 정확도(즉, 약 58.6%의 확률로 정답을 맞힘)를 달성했습니다.
  • 반면, "타임스탬프" 이야기를 읽었을 때 정확도는 0.504로 떨어졌습니다.

이 논문은 단순히 이벤트를 시간순으로 그룹화하는 것만으로는 충분하다는 생각에 명시적으로 반대합니다. 가계도(프로세스 계보)가 없다면, 한 동작이 어떻게 다음 동작으로 이어졌는지에 대한 결정적인 맥락을 잃게 된다고 제안합니다. 또한 연구진은 고급 AI 모델(트랜스포머)의 경우, 데이터를 "수정"하기 위해 가짜 예시를 추가로 만들어내는 기술(SMOTE)이 오히려 상황을 악화시키거나 도움이 되지 않는다는 것을 발견했습니다. 최선의 전략은 AI가 실제의 수정되지 않은 "가계도" 이야기로부터 학습하도록 두는 것이었습니다.

"누구"와 "무엇"

연구진은 많은 범죄 기법들을 테스트했습니다 (예: "T1059: Command and Scripting Interpreter" 또는 "T1218: System Binary Proxy Execution").

  • 쉬운 승리: 어떤 기법들은 포착하기가 매우 쉬웠습니다. 예를 들어, T1588(Capabilities 획득)은 1.00이라는 완벽한 점수로 식별되었습니다. 이는 범죄자가 "나는 범죄자다"라고 적힌 네온 사인을 몸에 두르고 다니는 것과 같습니다.
  • 어려운 사례: 어떤 기법들은 구별하기가 거의 불가능했습니다. T1553(Trust Controls 우회)은 0.00의 점수를 받았는데, 이는 AI가 단 하나의 올바른 사례도 찾아내지 못했음을 의미합니다. 논문은 특히 "방어 회피(Defense Evasion)"(숨기기)와 관련된 많은 기법들이 로그상에서 너무나 유사하게 보여서, 최고의 AI조차 혼란에 빠진다고 언급했습니다. 이는 마치 똑같은 가면을 쓴 쌍둥이를 구별하려는 것과 같습니다.

결론

이 논문은 사이버 범죄를 영원히 해결했다고 주장하는 것이 아닙니다. 이것은 실제 전장이 아닌 시뮬레이션 연구입니다. 그러나 이 논문은 만약 당신이 해커가 무엇을 하고 있는지 이해하고 싶다면, 단순히 시간상 가깝게 일어난 이벤트 목록을 보는 것만으로는 부족하다고 강력하게 시사합니다. 당신은 소프트웨어의 가계도인 **프로세스 계보(process lineage)**를 재구성해야 합니다.

이벤트들을 연결하기 위해 GUID 기반 방식을 사용하고, 데이터를 인위적으로 조절하지 않은 채 SecureBERT 모델에 입력할 때, 공격에 대한 가장 명확한 그림을 얻을 수 있습니다. 이는 디지털 세계에서도 맥락이 왕이며, 그들이 언제 나타났느냐보다 그들이 누구와 연결되어 있는지를 아는 것이 더 중요하다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →