← 최신 논문
🤖 machine learning

ThreatVisionAI: A Hybrid CNN-ViT Framework for Image-Based Malware Classification

ThreatVisionAI는 공간적, 주파수 영역 및 전역적 관계 특징을 효과적으로 포착함으로써 최첨단 악성코드 패밀리 분류 정확도를 달성하기 위해 로우 이미지(raw-image) CNN, 웨이브릿 기반(wavelet-based) CNN, 그리고 비전 트랜스포머(Vision Transformer)를 결합한 하이브리드 프레임워크입니다.

원저자: Allyson Taylor, Prashanth BusiReddyGari

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Allyson Taylor, Prashanth BusiReddyGari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 위조 지폐 더미를 분류하려고 노력 중이라고 상상해 보세요. 어떤 것들은 진짜와 거의 똑같아 보이고, 어떤 것들은 육안으로는 쉽게 식별할 수 없는 보이지 않는 잉크나 이상한 질감이 가미되어 있습니다. 전통적인 보안 요원(구형 안티바이러스 소프트웨어)은 단순히 알려진 불량 시리얼 번호 목록을 확인합니다. 만약 본 적 없는 새로운 가짜 지폐가 나타나면, 그들은 이를 통과시켜 버립니다.

**"ThreatVisionAI"**라는 논문은 이 업무를 처리하기 위한 새로운, 매우 스마트한 분류 팀을 제안합니다. 이 팀은 단순히 시리얼 번호를 보는 대신, 모든 악성 코드(나쁜 컴퓨터 코드)를 하나의 그레이스케일(흑백) 이미지로 변ned하고, 세 명의 서로 다른 "전문가"를 사용하여 이 이미지를 동시에 분석합니다.

이 세 명의 전문가가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

팀을 구성하는 세 명의 전문가

  1. "픽셀 탐정" (Raw-Image CNN):

    • 역할: 이 전문가는 이미지를 있는 그대로, 픽셀 하나하나를 봅니다. 이는 마치 탐정이 지폐의 가장자리가 들쭉날쭉한지 또는 반복되는 패턴이 있는지 확인하기 위해 지폐의 모양과 색상을 관찰하는 것과 같습니다.
    • 강점: 국소적인 세부 사항과 익숙한 형태를 포착하는 데 뛰어납니다.
    • 약점: 멀리서 보았을 때 두 개의 나쁜 지폐가 거의 비슷해 보인다면 미세한 차이를 놓칠 수 있습니다.
  2. "질감의 속삭임" (Wavelet-Based CNN):

    • 역할: 이것이 이 논문의 특별한 혁신입니다. 그 이미지를 특수 필터에 통과시켜 주파수(frequencies) 단위로 분해한다고 상상해 보세요. 이는 이미지를 "매끄러운" 부분과 "거친" 부분으로 분리하고, 수평, 수직, 대각선 방향의 "결(grain)"을 살펴봅니다.
    • 강점: 픽셀 탐정이 놓치는 아주 미세하고 방향성이 있는 질감을 포착할 수 있습니다. 이는 마치 종이의 결을 느껴서 똑같이 생긴 두 개의 가짜 지폐를 구별해 내는 것과 같습니다. 논문에서는 이 전문가가 인간의 눈에는 거의 동일해 보이는 악성코드 패밀리들을 구별하는 데 결정적이었다는 것을 발견했습니다.
    • 약점: (위의 강점/약점 구조를 따름)
  3. "전체적인 관찰자" (Vision Transformer 또는 ViT):

    • 역할: 다른 두 전문가가 특정 지점을 집중해서 보는 동안, 이 전문가는 한 걸음 물러나 이미지 전체를 한꺼번에 봅니다. 왼쪽 상단 모서리와 오른쪽 하단 모서리 사이의 점들을 연결하여, 서로 다른 부분들이 전역적으로(globally) 어떻게 연관되어 있는지 이해합니다.
    • 강점: 개별 문장이 아닌, 이미지 전체의 "이야기"를 이해합니다.

이들이 협력하는 방법

팀은 한 명의 전문가에게 최종 결정을 맡기는 대신, "가중치 소프트 보팅(Weighted Soft Voting)" 시스템을 사용합니다. 심사위원단을 생각해보세요:

  • 픽셀 탐정은 투표권의 50%를 가져갑니다 (가장 신뢰할 수 있기 때문입니다).
  • 질감의 속삭임은 투표권의 40%를 가져갑니다 (미세한 차이를 포착하는 데 매우 능숙합니다).
  • 전체적인 관찰자는 투표권의 10%를 가져갑니다 (추가적인 맥락을 더해줍니다).

이들은 자신들의 의견을 결합하여 최종 결정을 내립니다.

결과: 얼마나 잘 해냈는가?

팀은 25가지 유형의 악성 소프트웨어 이미지를 포함하고 있는 약 9,500개의 그림이 담긴 유명한 데이터셋인 Malimg를 통해 이 시스템을 테스트했습니다.

  • 점수: 팀은 98.01%의 정확도를 달ей했습니다. 이는 100개의 새로운 악성 이미지 중 98번을 악성 소프트웨어의 패밀리를 정확히 식별했다는 것을 의미합니다.
  • 승리 요인: "질감의 속삭임"(Wavelet)이 스타 플레이어였습니다. 이 전문가는 다른 전문가들이 구분하기 어려워했던 매우 유사한 두 악성코드 패밀리(Swizzor.gen!ESwizzor.gen!I)를 구별하는 데 도움을 주었습니다. 이 주파수 기반의 관점을 갖추지 못했다면, 팀은 이들을 더 자주 혼동했을 것입니다.

해결하지 못한 한 가지

논문은 한 가지 고집스러운 문제를 인정합니다. Autorun.KYuner.A라는 두 종류의 악성코드는 이미지 형태가 너무나도 놀라울 정도로 비슷해서, 최고의 인간 전문가조차 이들을 구분할 수 없습니다.

  • AI는 최선을 다했지만, 실제로는 Autorun.K임에도 불구하고 계속해서 "Yuner.A"라고 추측했습니다.
  • 연구진은 Grad-CAM(AI가 이미지의 어느 부분을 보고 있는지 강조해 주는 도구)을 사용하여 분석했고, AI가 두 경우 모두 정확히 같은 지점을 보고 있다는 것을 발견했습니다.
  • 결론: 이것은 AI의 실수가 아니라 데이터의 한계입니다. 사진 자체가 너무나 동일합니다.

주의사항 (한계점)

  • 적대적 공격 (Adversarial Attacks): 논문은 누군가 마술사의 손기술처럼 이미지에 아주 미세하고 보이지 않는 노이즈를 추가하여 AI를 속이려 할 때 어떤 일이 일어나는지 테스트했습니다. 시스템의 정확도가 크게 떨어졌으며, 이는 공격자가 모델이 어떻게 작동하는지 알고 있다면 속을 수 있음을 보여줍니다.
  • 오래된 데이터: 테스트 데이터는 2011년의 것입니다. 이 방식이 이 오래된 데이터셋에서 잘 작동하긴 하지만, 저자들은 아직 현대의 거대한 데이터셋에 대해서는 테스트하지 않았다고 언급했습니다.

요약

ThreatVisionAI는 단순히 악성 이미지의 형태를 보는 것이 아니라, 그 "질감"을 듣고 "전역적 구조"를 이해하는 하이브리드 시스템입니다. 이 세 가지 서로 다른 시각을 결합함으로써, 이 시스템은 매우 높은 정확도로 악성 소프트웨어를 분류하며, 이미지의 "주파수"를 보는 것이 이미지 자체를 보는 것만큼 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →