← 최신 논문
🤖 AI

Advanced Persistent Threats (APT) Attribution Using Deep Reinforcement Learning

본 논문은 반복적인 구조 및 알고리즘 개선을 통해 정확도를 7%에서 거의 98%까지 극적으로 향상시킴으로써 악성코드 활동을 인식하고 할당하는 강력한 능력을 입증한 지능형 지속 위협(APT) 추적을 위한 심층 강화 학습 모델을 제시한다.

원저자: Animesh Singh Basnet, Mohamed Chahine Ghanem, Dipo Dunsin, Wiktor Sowinski-Mydlarz

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Animesh Singh Basnet, Mohamed Chahine Ghanem, Dipo Dunsin, Wiktor Sowinski-Mydlarz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세상을 모두가 연결된 거대하고 북적이는 도시라고 상상해 보세요. 이 도시에는 '해커'라고 불리는 보이지 않는 도둑들이 있습니다. 때때로 이 도둑들은 그저 열려 있는 창문을 찾는 기회주의적인 절도범일 뿐입니다. 하지만 '지능형 지속 위협(APT)'이라는 존재들도 있습니다. 이들을 숙련된 스파이나 고도로 조직화된 범죄 조직이라고 생각해보세요. 이들은 단순히 침입해서 도망치는 것이 아니라, 몰래 숨어들어 몇 년 동안 벽 속에 숨어 지내며 비밀을 천천히 훔치고, 어떤 흔적도 남기지 않습니다. 이 스파이들이 누구인지—라이벌 국가인지, 범죄 집단인지, 혹은 특정 해커 그룹인지—파악하는 것을 '속성 규명(attribution)'이라고 부릅니다. 이는 마치 방 안을 움직이는 방식만으로 유령의 정체를 밝혀내려는 것과 같습니다. 이들은 가면을 쓰거나 비밀 통로를 이용하는 등의 속임수를 써서 흔적을 숨기기 때문에 이는 매우 어려운 일입니다.

이 미스터리를 해결하기 위해, 과학자들은 '심층 강화 학습(Deep Reinforcement Learning, DRL)'이라는 특별한 종류의 컴퓨터 두뇌를 사용하기 시작했습니다. DRL를 반복해서 게임을 플레이하며 배우는 비디오 게임 캐릭터라고 생각할 수 있습니다. 엄격한 규칙서를 따르기만 하는 일반적인 컴퓨터 프로그램과 달리, 이 캐릭터는 다양한 움직임을 시도하고, 잘했을 때 점수(보상)를 받으며, 자신의 실수로부터 배웁니다. 시간이 흐르면서 이 캐릭터는 게임에 매우 능숙해져서 인간이 놓칠 수 있는 패턴을 포착하게 됩니다. 큰 질문은 이것입니다. 우리는 이 디지털 탐정에게 바이러스의 무질서하고 숨겨진 행동을 보고 "아하! 이것은 분명히 X 그룹이 한 짓이다!"라고 말할 수 있도록 가르칠 수 있을까요?

이 논문은 그 아이디어를 가져와 실제로 테스트합니다. 연구진은 12개의 서로 다른 APT 그룹에서 추출한 3,500개 이상의 악성코드(malware) 샘로 구성된 거대한 디지털 '지문' 모음을 수집했습니다. 그들은 단순히 파일의 외형만을 본 것이 아니라, 안전하고 격리된 샌드박스(바이러스를 위한 가상 감옥) 안에서 파일이 실제로 무엇을 하는지 관찰했습니다. 그들은 Cuckoo Sandbox라는 도구를 사용하여 바이러스가 어떻게 움직이고, 파일을 변경하며, 다른 컴퓨터와 통신하는지를 지켜보았습니다.

그런 다음, 연구진은 이 DRL '탐정'이 이러한 행동들을 분석하도록 훈련시켰습니다. 그들은 AI가 각 바이러스를 만든 12개 그룹 중 하나를 맞히는 게임을 설정했습니다. 만약 맞히면 점수를 얻고, 틀리면 점수를 잃는 방식입니다. AI는 이 게임을 수천 번 플레이하며 각 그룹의 미묘하고 독특한 습관을 포착하는 법을 배웠습니다. 결과는 인상적이었습니다. DRL 모델은 본 적 없는 새로운 바이러스에 대해 89.27%의 정확도로 정답을 맞혔습니다.

이 새로운 탐정이 실제로 기존의 방식들보다 더 나은지 확인하기 위해, 연구진은 다섯 가지 표준 컴퓨터 방식(의사결정 나무 및 서포트 벡터 분류기와 같은 방식)과 비교했습니다. 기존 방식들은 71%에서 82% 사이의 정확도를 보이며 괜찮은 성적을 냈지만, DRL 탐정은 89.27%에 도달하며 그들을 명확히 압도했습니다. 이 논문은 이 접근 방식이 기존의 규칙들이 실패하기 쉬운, 까다롭고 변화무쌍한 사이버 공격의 특성을 다루는 데 특히 유용하다고 제안합니다.

하지만 저자들은 이것을 마법의 해결책이라고 부르는 데 주의를 기울입니다. 그들은 이 초지능형 AI가 자원을 많이 소모한다는 점을 지적합니다. 즉, 효과적으로 학습하기 위해서는 많은 컴퓨팅 파워와 방대한 양의 데이터가 필요합니다. 또한, 모델이 입력된 데이터의 패턴을 포착하는 데는 뛰어나지만 현실 세계는 복잡하다는 점도 언급합니다. 결론적으로, 이 논문은 DRL이 보안 분야에서 사용할 AI의 윤리적 문제와 효율성을 개선해야 함에도 불구하고, 디지털 스파이를 잡는 강력한 새로운 도구임을 시사합니다. 이는 악당들의 행동으로부터 AI가 학습하게 함으로써, 우리가 그들의 정체를 이전보다 더 빠르고 정확하게 밝혀낼 수 있을지도 모른다는 유망한 진전을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →