Malformer: A Multi-Modal Malware Detector Using Transformers
이 논문은 텍스트, 이미지, 그래프, 오디오 표현을 융합하여 98.3%의 정확도를 달성함으로써 기존의 단일 모달 및 이중 모달 악성코드 탐지 시스템을 크게 능가하는 사중 모달 트랜스포머 기반 탐지기인 Malformer를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 세상에서 보안 팀들은 악성 소프트웨어와의 끊임없이 변화하는 전투에 직면해 있습니다. 수십 년 동안 주요 방어 수단은 알려진 지문, 즉 바이러스를 식별할 수 있는 특정 코드 패턴이나 고유한 디지털 서명을 찾는 것이었습니다. 이 방식은 오래된 위협에는 효과적이지만, 공격자들이 새로운 미지의 프로그램을 만들거나 기존의 것을 약간 변형하여 흔적을 숨길 때는 실패합니다. 이에 앞서 나가기 위해 연구자들은 컴퓨터에게 단순히 알려진 패턴을 매칭하는 대신, 악성 소프트웨어의 미묘하고 근본적인 구조를 인식하도록 가르치는 머신러닝으로 눈을 돌렸습니다. 초기 시도들은 컴퓨터에게 원시 코드를 읽게 하거나 파일을 단순한 이미지로 보게 했지만, 각 방법에는 사각지대가 있었습니다. 파일을 바라보는 단 하나의 방식은 마치 사람을 식별할 때 오직 그림자만 보거나 오직 목소리만 듣는 것처럼, 결정적인 단서를 놓칠 수 있습니다.
테네시 공과대학교, 네브래스카 대학교 오마하 캠퍼스, 그리고 노스캐롤라이나 A&T 주립대학교의 연구진은 이러한 한계를 극복하기 위해 '말포머머(Malformer)'라고 불리는 새로운 시스템을 개발했습니다. 이 시스템은 컴퓨터 파일에 대해 단 하나의 관점에 의존하는 대신, 동일한 파일을 완전히 다른 네 가지 방식으로 동시에 바라봅니다. 그들은 파일을 텍스트 문서, 이미지, 연결 지도, 그리고 음파로 취급합니다. 이 네 가지 관점을 결합함으로써, 시스템은 그 파일이 무엇을 하려 하는지에 대해 훨씬 더 풍부한 이해를 구축합니다. 연구진은 이 접근 방식을 20만 개 이상의 방대한 컴퓨터 파일 모음에 테스트했으며, 네 가지 렌즈를 통해 동시에 문제를 바라보는 것이 단 하나 또는 두 개의 뷰만을 사용하는 방법보다 훨씬 더 높은 정확도로 위협을 포착할 수 있음을 발견했습니다.
말포머의 핵심 아이디어는 파일을 표현하는 서로 다른 방식들이 서로 다른 종류의 정보를 드러낸다는 것입니다. 컴퓨터 파일을 텍스트로 변환하면 프로그램이 프로세서에 내리는 특정 명령어를 보여줍니다. 동일한 파일을 이미지로 바꾸면, 지문이 능선과 골짜기를 보여주는 것과 유사하게 데이터 배열의 패턴을 드러냅니다. 파일을 그래프로 변환하면 프로그램의 서로 다른 부분들이 어떻게 서로 통신하는지를 나타내며 제어 흐름을 보여줍니다. 마지막으로, 파일을 오디오 신호로 취급하면 파일의 바이트 시퀀스가 리드미컬한 패턴을 가진 음파를 생성합니다. 연구진은 하나의 뷰에만 의존하는 것이 종종 공백을 남긴다는 것을 발견했습니다. 예를 들어, 공격자가 텍스트 코드를 난독화하여 숨기더라도, 이미지나 사운드 뷰는 여전히 악성 구조를 보여줄 수 있습니다. 이 네 가지 뷰를 융합함으로써, 시스템은 하나의 뷰가 다른 뷰의 약점을 보완할 수 있는 안전망을 만듭니다.
이 시스템을 구축하기 위해 연구진은 데이터의 복잡한 관계를 이해할 수 있는 강력한 컴퓨터 모델인 '트랜스포머(transformers)'라는 고급 도구를 사용했습니다. 그들은 이 모델들을 네 가지 서로 다른 유형의 데이터를 처리할 수 있도록 적응시켰습니다. 텍스트와 연결 지도를 위해서는 언어와 시퀀스를 이해하도록 설계된 모델을 사용했습니다. 이미지를 위해서는 일반적으로 사진을 분석하는 모델을 사용하되, 파일의 바이트 패턴을 보도록 수정했습니다. 사운드의 경우, 인간의 음성을 학습한 모델을 사용하여 파일 데이터의 리듬을 듣도록 했습니다. 과제는 단순히 네 가지 별도의 뷰를 만드는 것뿐만 아니라, 시스템이 이들을 서로 어떻게 가중치를 두어 비교할지 가르치는 것이었습니다. 연구진은 훈련 과정에서 시스템이 각 뷰에 얼마나 주의를 기울일지를 자동으로 조정하는 방법을 개발했습니다. 만약 한 뷰가 다른 뷰보다 빠르게 학습하고 있다면, 시스템은 전체 시스템이 특정 유형의 정보에 편향되는 것을 방지하기 위해 해당 뷰의 영향력을 일시적으로 줄여 다른 뷰들이 따라잡을 수 있도록 합니다.
이 접근 방식의 결과는 놀라웠습니다. 201,549개의 파일로 테스트했을 때, 말포머 시스템은 98.3%의 확률로 악성 소프트웨어를 정확히 식별했습니다. 이 성능은 단 하나의 유형의 데이터만 보거나 심지어 단 두 가지만 결합한 시스템보다 눈에 띄게 우수했습니다. 연구진은 이 네 가지 뷰의 조합이 단일 뷰로는 달성할 수 없는 수준의 세부 정보를 제공한다는 것을 발견했습니다. 더욱 중요한 것은, 시스템이 회복 탄력성을 입증했다는 점입니다. 실제 환경에서는 파일의 일부가 손상되거나 읽을 수 없게 되어 네 가지 뷰 중 하나가 실패할 수 있습니다. 연구진은 텍스트 뷰나 연결 지도 뷰를 제거했을 때 어떤 일이 발생하는지 테스트했으며, 시스템은 정확도가 약간 떨어지기는 했지만 여전히 매우 우수한 성능을 유지했습니다. 이는 시스템이 단일 장애점에 의존하는 것이 아니라, 네 가지 관점 모두의 집단적인 힘에 기반하고 있음을 시사합니다.
이 연구는 또한 각 관점의 독특한 가치를 강조했습니다. 이미지 뷰는 가장 일관되고 신뢰할 수 있었던 반면, 연결 지도 뷰는 사용 가능한 경우 가장 강력한 개별 신호를 제공했습니다. 텍스트 뷰는 어셈블리 코드를 나타내며, 연결 지도가 제대로 추출되지 않을 때 특히 유용했습니다. 사운드 뷰는 이 분야에서 덜 일반적인 접근 방식임에도 불구하고, 다른 뷰들이 놓친 패턴을 포착하며 효과적임을 입증했습니다. 이 다양한 방법들을 하나로 모음으로써, 연구진은 더 정확할 뿐만 아니라 공격자들이 자신의 작업을 숨기기 위해 사용하는 속임수에 더 강력하게 대응할 수 있는 탐지기를 만들었습니다. 이 연구는 멀웨어 탐지의 미래가 파일을 분석하는 단 하나의 완벽한 방법을 찾는 것이 아니라, 동일한 위협을 바라보는 여러 가지 상호 보완적인 방식을 통합하는 데 있음을 시사합니다. 공격자들이 그들의 수법을 계속 진화시킴에 따라, 문제를 네 가지 다른 각도에서 동시에 바라볼 수 있는 시스템을 갖추는 것은 우리가 매일 사용하는 디지털 인프라를 위한 강력하고 일반화된 방어책이 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.