From Telemetry to Techniques: Behavior-Centric MITRE ATTCK Technique Classification Through Sysmon Event Correlation
본 논문은 Sysmon 텔레메트리를 사용하여 MITRE ATT&CK 기법을 분류하기 위한 행위 중심 프레임워크를 제시하며, GUID 기반의 이벤트 상관관계가 시간적 상관관계 및 전통적인 머신러닝 접근 방식보다 적대적 활동을 식별하는 데 있어 더 우수한 성능을 보임을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 범죄를 해결하려는 형사라고 상상해 보십시오. 하지만 당신은 지문이나 발자국을 찾는 대신, 컴퓨터가 남긴 거대하고 혼란스러운 디지털 발자국의 흐름을 보고 있습니다. 이 분야를 사이버 보안이라고 부르며, "범죄 현장"은 컴퓨터의 내부 로그 기록입니다. 오랫동안 형사들은 특정 파일 이름이나 알려진 해커의 주소와 같은 구체적이고 알려진 "몽타주"를 찾아내어 나쁜 놈들을 잡으려 노력했습니다. 하지만 현대의 해커들은 매우 영리하여, 이 "몽타주"를 끊임없이 바꾸며 옷과 가면을 갈아입습니다. 그래서 기존의 "몽타주" 방식은 종종 실패하곤 합니다.
이러한 변신술사들을 잡기 위해, 과학자들은 이제 다른 접근 방식을 시도하고 있습니다. 단일한 발자국을 보는 대신, 발자국이 들려주는 이야기를 보는 것입니다. 이것은 마치 다음과 같습니다. 만약 당신이 어떤 사람이 은행으로 걸어 들어갔다가, 금고로 달려가고, 창문을 깨뜨린 다음, 가방을 들고 뛰어나가는 것을 본다면, 당신은 그 사람의 이름을 몰라도 그가 은행을 털고 있다는 것을 알 수 있습니다. 당신은 그저 행동의 순서를 보면 됩니다. 이 논문은 무질서하게 쌓인 컴퓨터 로그를 어떻게 하면 공격자가 무엇을 하고 있는지 보여주는 명확하고 읽기 쉬운 이야기로 바꿀 수 있는지 탐구하며, 그 후 스마트한 컴퓨터 프로그램을 사용하여 공격자가 정확히 어떤 종류의 "수법"을 쓰고 있는지 파악하는 방법을 다룹니다.
디지털 형사의 새로운 도구 상자
컴퓨터 보안의 세계에는 MITRE ATT&CK라고 불리는 유명한 플레이북이 있습니다. 이것을 해커들이 시스템에 침입하기 위해 사용하는 모든 다양한 수법들을 모아놓은 거대한 백과사전이라고 생각하십시오. 이것은 단순히 "나쁜 놈들"을 나열하는 것이 아니라, "비밀번호 훔치기", "파일 숨기기", 또는 "다른 컴퓨터로 옆으로 이동하기(Lateral Movement)"와 같은 그들의 구체적인 움직임을 분류합니다. 이 연구의 목표는 컴퓨터의 가공되지 않은 활동 로그를 살펴보고, "아, 여기서 무슨 일이 일어나는지 알겠군. 이것은 '자격 증명 덤핑(Credential Dumping)' 수법이구나"라거나 "이것은 '측면 이동(Lateral Movement)' 수법이구나"라고 말할 수 있는 시스템을 구축하는 것이었습니다.
연구진은 Sysmon이라는 특별한 도구를 사용했습니다. Sys모를 컴퓨터 내부에서 눈을 한 번도 깜빡이지 않는 초정밀 보안 카메라라고 상상해 보십시오. 그것은 모든 것을 기록합니다. 모든 프로그램의 시작, 생성된 모든 파일, 인터넷에 연결된 모든 통신, 그리고 시스템 설정에 가해진 모든 변경 사항까지 말입니다. 하지만 문제는 이것입니다. Sysmon은 모든 것을 기록하며, 이를 믿을 수 없을 정도로 소란스럽고 무질서한 방식으로 수행한다는 점입니다. 이는 도시의 모든 사람의 눈 깜빡임, 숨결, 발걸음 하나하나를 기록하는 보안 카메라를 가진 것과 같지만, 누가 누구와 함께 걷고 있는지 또는 어떤 순서로 움직이는지는 알려주지 않습니다. 만약 당신이 단 하나의 눈 깜빡임만 본다면, 아무것도 배울 수 없습니다. 당신은 전체 영화를 봐야 합니다.
핵심 질문: 어떻게 점들을 연결할 것인가?
연구진은 다음과 같은 단순하지만 결정적인 질문을 던졌습니다. 우리는 어떻게 이 흩어진 디지털 발자국들을 연결하여 일관된 이야기를 만들어낼 것인가?
그들은 이 이벤트들을 연결하는 두 가지 주요 방법을 테스트했습니다:
- "너의 부모는 누구니?" 방식 (GUID 기반): 컴퓨터에서 모든 프로그램은 고유한 ID 번호를 가집니다. 한 프로그램이 다른 프로그램을 시작하면, 이는 마치 부모가 자식을 갖는 것과 같습니다. 연구진은 이 "가계도"를 따라가며 이벤트들을 연결하려고 시도했습니다. 만약 프로그램 A가 프로그램 B를 시작했고, 프로그램 B가 파일을 열었다면, 그들은 이 이벤트들이 같은 "가족"에 속하기 때문에 이들을 연결했습니다. 이것은 범죄 조직을 추적할 때, 그들이 하루 중 언제 활동하느냐에 상관없이 그들의 가계도를 따라가는 것과 같습니다.
- "무엇이 먼저 일 있었나?" 방식 (시간 기반): 이 방법은 단순히 시간순으로 이벤트를 연결합니다. 만약 두 사건이 1초 이내에 발생했다면, 연구진은 그들이 서로 연관되어 있다고 가정했습니다. 이것은 "이 두 사람이 같은 시간에 같은 방에 있었으니, 반드시 함께 일하고 있는 것이다"라고 말하는 것과 같습니다.
실험: 컴퓨터에게 이야기를 읽는 법 가르치기
이 방법들을 테스트하기 위해, 연구진은 실제 해커가 실제 은행에 침입하기를 기다리지 않았습니다. 대신, 그들은 안전하고 통제된 실험실을 구축하고 Atomic Red Team이라는 도구를 사용하여 공격을 시뮬레이션했습니다. 그들은 MITRE ATT&CK 플레이북에 있는 특정 수법들을 실제로 재현하여, 실제 공격과 똑같이 보이는 수천 개의 Sysmon 로그를 생성했습니다.
그런 다음 이 로그들을 두 가지 유형의 "학생" 컴퓨터에 입력했습니다:
- 전통적인 학생들: 이들은 고전적인 머신러닝 모델(Random Forest 및 LightGBM 등)입니다. 이들은 패턴을 포착하는 데 능숙하지만, 데이터가 먼저 매우 깨끗하고 체계적으로 정리되어 있어야 합니다.
- 슈퍼 독서가들: 이들은 Transformer(구체적으로 SecBERT 및 SecureBERT)라고 불리는 고급 AI 모델입니다. 이들은 인터넷 전체를 읽었으며 단어와 시퀀스의 의미와 맥락을 이해하는 전문가와 같습니다. 이들은 문장을 읽고 그 뒤에 숨겨된 이야기를 이해할 수 있습니다.
또한 연구진은 **클래스 불균형(Class Imbalance)**이라는 까다로운 문제도 해결해야 했습니다. 그들의 데이터에서는 어떤 수법(예: "System Binary Proxy Execution")은 수백 번 발생하는 반면, 다른 수법(예: "Subvert Trust Controls")은 단 몇 번만 발생했습니다. 이것은 학급의 학생 90%의 이름이 "존"이고, 단 한 명의 학생 이름이 "조이"인 것과 같습니다. 만약 당신이 이름을 맞히도록 선생님을 훈련시킨다면, 그들은 이름을 맞힐 때마다 그냥 "존"이라고 답할 것이며 높은 점수를 받겠지만, 결코 "조이"가 누구인지는 배우지 못할 것입니다. 연구진은 희귀한 수법을 위한 추가 예시를 만드는 기술(SMOTE라고 불림)이나, 특수한 수학적 기법(Focal Loss라고 불림)을 사용하여 컴퓨터가 희귀한 사례에 더 집중하도록 가르치는 등 다양한 방법을 시도했습니다.
결과: 가계도 방식의 승리, 그리고 적은 것이 더 낫다
수백 번의 시뮬레이션을 실행한 결과, 결과는 명확하고 놀라웠습니다.
1. "가계도" 방식이 우월하다
GUID 기반 상관관계(프로세스 가계도를 따르는 방식)가 시간 기반 상관관계(단순히 시간만 보는 방식)를 지속적으로 이겼습니다.
- 이유: 논문에 따르면, 단순히 시간적으로 가깝다는 것만으로는 두 사건이 연관되어 있다는 것을 증 prove하기에 부족합니다. 컴퓨터는 1초 안에 수백만 개의 무관한 일을 할 수 있습니다. 하지만 프로그램 A가 프로그램 B를 시작했다면, 그것은 깨뜨릴 수 없는 강력한 연결 고리입니다. "가계도" 방식은 이벤트 사이의 진정한 관계를 보존하여 AI가 읽을 수 있는 훨씬 더 명확한 이야기를 제공했습니다.
- 점수: 가계도 방식을 사용한 최고의 모델(SecureBERT)은 0.586의 정확도를 달랐습니다(이는 약 58.6%의 확률로 정답을 맞혔음을 의미합니다). 시간 방식을 사용한 최고의 모델은 0.504에 그쳤습니다.
2. "슈퍼 독서가"가 "전통적인 학생"을 이기다
고급 AI 모델(SecureBERT)이 전통적인 머신러닝 모델을 지속적으로 압도했습니다.
- 점수: 가계도 방식을 사용한 SecureBERT는 0.586의 정확도를 기록했습니다. 최고의 전통적 모델(LightGBM)은 0.501에 불과했습니다.
- 이유: "슈퍼 독서가"들은 더 복잡한 맥락을 이해하는 데 더 뛰어났습니다. 이들은 개별적인 부분들이 언뜻 무해해 보이더라도, 특정 사건의 시퀀스가 "해킹"을 의미한다는 것을 알아차릴 수 있었습니다.
3. 놀라운 반전: AI를 너무 과하게 가르치지 마라
연구진은 클래스 불균형(희귀한 수법의 문제)을 해결하는 것이 AI의 학습을 도울 것이라고 예상했습니다. 그들은 전통적인 모델을 위해 추가 예시를 만드는(SMOTE) 시도를 했고, 이는 효과적이었습니다.
- 하지만, 고급 "슈퍼 독서가"(SecureBERT)의 경우, 아무것도 하지 않는 것이 오히려 최선의 전략이었습니다.
- 연구진이 특수한 수학(Focal Loss)을 사용하여 AI가 희귀한 수법에 더 집중하도록 강제했을 때, AI의 전반적인 성능은 오히려 떨어졌습니다.
- 발견: 베이스라인 모델(불균형을 해결하기 위한 특별한 기술 없이 표준적으로 학습된 AI)이 가장 높은 정확도(0.586)와 가장 좋은 전반적인 균형을 달성했습니다. 논문은 가계도 방식으로 생성된 복잡하고 상관관계가 있는 이야기들이 매우 풍부하고 의미 있어서, AI가 억지로 강요되거나 "과잉 교정"되지 않고도 자연스럽게 희귀한 수법을 배울 수 있었다고 시사합니다.
이것이 미래에 의미하는 바
이 논문은 사이버 보안의 모든 문제를 해결했다고 주장하는 것이 아닙니다. 해커들이 이제 100% 잡힌다고 말하는 것도 아닙니다. 대신, 데이터를 어떻게 조직하느냐가 그것을 읽는 특정 컴퓨터 프로그램이 무엇인지보다 더 중요하다는 것을 시사합니다.
이벤트를 단순히 타임스탬프(시간 기록)로 연결하는 대신 그들의 "가계도"(프로세스 관계)를 통해 연결함으로써, 우리는 공격자가 무엇을 하고 있는지에 대한 훨씬 더 풍부하고 정확한 이야기를 만들 수 있습니다. 그리고 이러한 풍부한 이야기를 고급 AI 모델에 입력하면, AI는 희귀한 수법에 인위적으로 주의를 기울이도록 강요받지 않고도 그 수법들을 그 어느 때보다 잘 인식할 수 있습니다.
이 연구는 또한 한계점도 밝히고 있습니다: 이 결과는 시뮬레이션된 공격을 사용하는 통제된 실험실에서 발견되었습니다. 연구진은 실제 컴퓨터 환경이 훨씬 더 무질서하고 복잡하다는 점을 인정합니다. 따라서 이것은 유망한 새로운 방향이지만, 다음 단계는 이 "가계도" 이야기가 실제 사무실에서 사람들이 실제로 컴퓨터를 사용하는 상황에서도 유효한지를 확인하는 것입니다.
요약하자면, 이 논문은 디지털 도둑을 잡기 위해서는 단순히 시계를 보는 것이 아니라, 그들이 누구와 함께 걷고 있는지를 보아야 한다고 가르쳐 줍니다. 그리고 때로는, 너무 많은 간섭 없이 스스로 학습할 수 있도록 내버려 두는 것이 가장 똑똑한 컴퓨터가 되는 길일 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.