← 최신 논문
💻 computer science

MalTree: Tracing Malware Evolution from Embeddings at Scale

이 논문은 구조적, 행동적, 이미지 기반 특징을 사용하여 악성코드의 진화를 자동으로 모델링하기 위해 생물정보학 계통 분류 기술을 적응시킨 확장 가능한 프레임워크인 MalTree를 소개하며, 이를 통해 87%의 시간적 일관성을 달성하고 선제적이고 계통 인식적인 방어 전략을 가능하게 한다.

원저자: Akash Amalan, Georgios Smaragdakis, Tom J. Viering

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Akash Amalan, Georgios Smaragdakis, Tom J. Viering

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 바이러스(악성코드)의 세계를 단순히 무작위적인 나쁜 코드의 혼돈스러운 더미가 아니라, 인류의 역사나 독감 바이러스의 확산처럼 거대하고 진화하는 가계도로 상상해 보십시오.

오랫동안 보안 전문가들은 '두더지 잡기' 게임을 해왔습니다. 새로운 바이러스가 나타나기를 기다렸다가, 그것을 연구한 뒤, 이를 막기 위한 방패를 만드는 방식입니다. 하지만 방패를 만들 때쯤이면 바이러스는 이미 모습을 바꾸고, 빠져나가 새로운 버전을 만들어낸 상태입니다. 이 논문인 MalTree는 이러한 '두더지 잡기' 게임을 멈추고, 대신 그 가족사를 이해하는 방법을 제안합니다.

이들이 어떻게 이 일을 해냈는지, 쉬운 비유를 사용하여 다음과 같이 설명합니다.

1. 문제점: "반응적"인 게임

악성코드 탐지를 클럽의 보안 요원(바운서)에 비유해 봅시다. 보안 요원은 알려진 악당들의 명단(시그니처)을 가지고 있습니다. 누군가 명단에 있는 악당과 닮았다면 그는 쫓겨납니다. 하지만 악당들은 영리해서, 변장(암호화)을 하거나 옷을 갈아입어(다형성) 다른 모습으로 보이게 만듭니다. 보안 요원이 명단을 업데이트할 때쯤이면, 악당은 이미 다시 변신한 상태입니다.

저자들은 우리가 개별적인 "악당"을 보는 대신, 그들의 가계도를 보아야 한다고 주장합니다. 만약 "바이러스 A"가 "바이러스 B"의 부모이고, "바이러스 B"가 "바이러스 C"의 부모라는 것을 안다면, 우리는 "바이러스 D"가 나타나기도 전에 그것이 어떤 모습일지 예측할 수 있습니다.

2. 해결책: MalTree (디지털 계보학자)

연구진은 MalTree라고 불리는 도구를 구축했습니다. 코드를 한 줄 한 줄 읽는 대신(이는 마치 모르는 언어로 쓰인 책을 읽으려는 것과 같습니다), 그들은 생물학에서 빌려온 **계통 발생학(Phylogenetics)**이라는 방법을 사용했습니다.

  • 악성코드의 DNA: 생물학에서 과학자들은 두 동물이 얼마나 연관되어 있는지 확인하기 위해 DNA를 비교합니다. MalTree도 악성코드로 똑같은 일을 합니다. 바이러스를 가져와서 "지문"(임베딩이라고 불림)으로 변환합니다.
  • 세 가지 유형의 지문: 완전한 그림을 그리기 위해, 그들은 단 한 가지만 보지 않았습니다. 세 가지 다른 "각도"를 살펴보았습니다.
    1. 골격 (정적 분석): 코드가 멈춰 있을 때의 모습 (마치 자동차 엔진 블록을 보는 것과 같습니다).
    2. 행동 (동적 분석): 바이러스가 실행될 때 무엇을 하는지 (마치 자동차가 달리는 것을 보고 속도를 내는지 혹은 경로를 이탈하는지 관찰하는 것과 같습니다).
    3. 시각적 요소 (이미지): 코드를 그림(바코드와 같은 형태)으로 변환한 뒤, 인간이 얼굴을 인식하는 것과 유사하게 AI를 사용하여 패턴을 "봅니다".

그들은 이 세 가지 관점을 하나의 매우 상세한 바이러스 지문으로 결합했습니다.

3. 가계도 구축

지문을 얻은 후, 그들은 수학(구체적으로는 UPGMANeighbor-Joining 알고리라는 알고리즘)을 사용하여 각 바이러스가 다른 바이러스와 얼마나 "다른지"를 계산했습니다.

  • 두 바이러스가 매우 유사한 지문을 가지고 있다면, 그들은 가계도에서 서로 가까이 배치됩니다 (형제/자매).
  • 두 바이러스가 매우 다르다면, 그들은 멀리 떨어져 배치됩니다 (먼 친척).

그들은 이 과정을 103,883개의 서로 다른 악성코드 샘플에 대해 수행했습니다. 이는 엄청난 규모의 가족 모임입니다!

4. "타임머신" 검증

큰 의문은 이것입니다. 이 가계도가 실제로 존재하는 것인가, 아니면 컴퓨터가 그냥 추측한 것인가?

이를 증명하기 위해 연구진은 VirusTotal 타임스탬프(인터넷에 해당 바이러스가 처음 보고된 날짜)를 사용했습니다.

  • 논리: 실제 가족 관계에서 "부모"는 반드시 "자식"보다 먼저 존재해야 합니다.
  • 테스트: 이들이 생성된 시점이 더 빠른 바이러스들이 실제로 나무의 위쪽(뿌리에 더 가까운 곳)에 배치되었는지 확인했습니다.
  • 결과: 87%의 확률로 작동했습니다. 이는 그들이 구축한 가계도가 실제 이 바이러스들이 진화해 온 역사와 일치함을 의미합니다.

5. 발견한 점 ("아하!" 모먼트)

이 논문은 이 가계도를 통해 몇 가지 핵심적인 발견을 강조합니다.

  • 서로 다른 속도: 어떤 가족은 매년 아이를 낳고 어떤 가족은 10년을 기다리는 것처럼, 어떤 악성코드 가문은 매우 느리게 진화하는 반면, 어떤 가문은 믿기 힘들 정도로 빠르게 돌연변이를 일으킵니다. 한 가문(Bashlite)은 다른 가문보다 10배 이상 빠르게 변화했습니다. 이는 보안 팀이 "일률적인" 방어 체계를 사용할 수 없으며, 특정 바이러스 가문에 맞춰 방어 속도를 조절해야 함을 시사합니다.
  • 미라이(Mirai) 봇넷: 그들은 유명한 Mirai 바이러스(2016년 거대한 인터넷 블랙아웃을 일으킨 주범)를 추적했습니다. 가계도는 Bashlite, Okiru, Gafplyt를 포함한 그 "자식들"을 정확히 식별해 냈습니다. 이는 인간 전문가들이 수년간의 수동 조사를 통해 이미 알고 있던 사실과 일치하며, 컴퓨터가 인간이 몇 달 걸릴 일을 단 몇 시간 만에 해낼 수 있음을 입증했습니다.
  • "허브(Hub)" 문제: 그들은 일부 바이러스가 많은 종류의 나쁜 페이로드를 실어 나르는 "배달 트럭(로더)" 역할을 한다는 것을 발견했습니다. 가계도는 이러한 연결 고리를 보여주었지만, 때때로 바이러스들이 실제로 가족이라서가 아니라 단순히 같은 도구를 사용하기 때문에 서로 관련되어 있는 것처럼 보일 수도 있다는 경고도 남겼습니다.

결론

MalTree는 컴퓨터 바이러스의 혼란스러운 덩어리를 정리된 가계도로 바꾸는 도구입니다. 가족사를 이해함으로써, 보안 전문가들은 최신 변장에 단순히 반응하는 것을 넘어, 바이러스 가문이 다음에 어떻게 진화할지 예측할 수 있게 됩니다.

이는 어둠 속에서 단 한 명의 도둑을 잡으려고 애쓰는 것에서 벗어나, 범죄 세계 전체의 지도를 갖게 되어 누가 누구와 관련되어 있고 다음에 어디를 공격할지 정확히 알게 되는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →