← 최신 논문
🤖 machine learning

Self-Supervised Representations for Binary Program Clustering: From Empirical Study to Retrieval-Augmented Learning

이 논문은 이진 프로그램 클러스터링을 위한 자기지도 및 테이블형 표현 학습에 대한 첫 번째 체계적인 조사를 제시하며, VIME를 새로운 최첨단 방법으로 식별하고 악성코드 클러스터링 성능을 크게 향상시키는 검색 증강 변형 모델인 VIME-R을 제안한다.

원저자: Martin Mocko, Daniela Chudá

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Martin Mocko, Daniela Chudá

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 매일 수백만 명의 새로운 '디지털 거주자'가 도착하는 거대하고 북적이는 도시라고 상상해 보세요. 대부분은 친절한 이웃이지만, 일부는 훔치거나 부수거나 혼란을 일으키려는 교활한 침입자들입니다. 이 침입자들을 말웨어(malware)라고 부릅니다. 2024년 한 해에만 8,000만 개 이상의 새로운 말웨어가 나타났습니다. 이 도시를 안전하게 지키기 위해 보안 요원(사이버 보안 전문가)들은 이 수백만 개의 파일을 그룹으로 분류해야 합니다. 만약 그들이 새로운 파일이 알려진 악성 범죄자와 같은 '가족'에 속한다는 것을 알아낼 수 있다면, 위협을 즉각적으로 차단할 수 있습니다. 이 분류 과정을 **클러스터링(clustering)**이라고 합니다.

보통 분류는 누구인지 알려주는 이름 목록(레이블)이 있으면 쉽습니다. 하지만 현실 세계에서 보안 요원들은 종종 아무런 이름도 없는 거대한 미스터리 파일 더미를 분류해야 합니다. 여기서 **자기지도 학습(Self-Supervised Learning, SSL)**과 **표 형식 표현 학습(Tabular Representation Learning, TRL)**이 등장합니다. SSL을 학생이 선생님으로부터 정답을 듣지 않고도, 동일한 물체의 약간 다른 사진 두 장을 보고 그것이 같은 것이라고 추측하며 배우는 과정이라고 생각하면 됩니다. TRL은 컴퓨터가 사진이나 문장이 아니라 '스프레드시트 데이터'(숫자로 된 행과 열)를 이해하도록 가르치는 특정한 기술입니다. 연구자들이 던져온 핵심 질문은 이것입니다. "우리가 컴퓨터에게 정답을 알려주는 인간 교사의 도움 없이, 오직 숫자만을 보고 이 미스터리한 말웨어 파일들을 완벽한 가족 단위로 분류하도록 가르칠 수 있을까?"


미스터리 파일의 미스터리

이 연구에서 연구자 마틴 모코(Martin Mocko)와 다니엘라 추다(Daniela Chudá)는 거대한 디지털 파일 더미를 가지고 탐정 놀이를 하기로 했습니다. 그들은 고양이 사진을 인식하거나 문장을 이해하는 데 사용되는 현대적인 AI 기법들을 말웨어 파일을 그룹화하는 데 재사용할 수 있는지 확인하고 싶었습니다. 그들은 윈도우 파일로 구성된 두 개의 거대한 공개 데이터셋인 EmberBodmas를 사용했습니다. 이 데이터셋들은 수십만 개의 파일을 포함하는 거대한 도서관과 같으며, 각 파일은 지문 역할을 하는 긴 숫자 목록(특징값)으로 설명됩니다.

연구진은 조사를 두 단계의 미스터리 소설처럼 두 단계로 나누어 진행했습니다.

1단계: "만약에" 테스트
먼저, 그들은 절대적인 최고 점수가 어느 정도인지 알고 싶었습니다. AI에게 정답지를 주는 상황을 가정해 본 것입니다. 그들은 이미지용으로 설계된 유명한 AI 모델들(BYOL, SimSiam, Barlow Twins, VICReg)을 가져와, 파일들이 실제로 같은 가족에 속한다는 것을 알고 있는 상태에서 학습하도록 강제했습니다. 이는 '지도 학습(supervised)' 테스트로, 성능의 한계치가 어디까지 올라갈 수 있는지 보기 위함이었습니다.

결과는 영웅과 낙제생의 혼합이었습니다. BYOLSimSiam은 슈퍼히어로로 나타났습니다. 정답지를 받았을 때, 이 모델들은 완전한 지도 학습 모델(모든 가족의 이름을 알고 있는 모델)만큼 잘 수행하여, 일반 카테고리에 대해서는 거의 99%, 특정 가족에 대해서는 84% 이상의 '동질성(Homogeneity)' 점수(그룹의 순도를 측정하는 척도)를 달성했습니다. 그러나 Barlow TwinsVICReg는 심하게 비틀거렸으며, 심지어 가장 단순한 베이스라인 방법보다도 낮은 성능을 보였습니다. 모든 "똑똑한" AI 모델이 사진에서 스프레드시트로 전환했을 때 똑같이 똑똑한 것은 아니라는 사실이 드러났습니다.

2단계: 진짜 도전
다음으로, 연구진은 정답지를 제거했습니다. 이것이 실제 상황입니다. AI는 가족의 이름을 전혀 모르는 채로 파일을 분류해야 합니다. 그들은 1단계의 최고 모델들과 함께 VIME, SCARF, SwitchTab과 같이 스프레드시트 데이터에 특화되어 설계된 새로운 방법들을 테스트했습니다.

여기서 기존의 이미지 기반 모델들(BYOL 및 SimSiam)은 스프레드시드용 '데이터 손상(corruption)' 기법을 사용하도록 강요받았을 때 어려움을 겪었습니다. 그들은 단순한 베이스라인조차 이기지 못했습니다. 하지만 VIME(Value Imputation and Mask Estimation)가 등장했습니다. VIME는 파일 데이터의 일부를 무작위로 숨기고 무엇이 빠졌는지 추측함으로써 패턴을 학습하는 방식으로 작동했습니다. VIME는 새로운 챔피언이 되어, 강력한 전통적 베이스라인(PCA 및 오토인코더 등)을 제치고 새로운 최첨단(state-of-the-art) 기록을 세웠습니다.

반전: VIME-R
연구진은 여기서 멈추지 않았습니다. 그들은 VIME가 전체 라이브러리에서 무작위로 파일을 가져와 누락된 데이터를 추측하고 있다는 점을 발견했습니다. 그렇다면 만약 VIME가 현재 공부하고 있는 파일과 매우 유사한 파일들만 살펴본다면 어떨까요? 그들은 VIME-R(Retrieval-Augmented, 검색 증강)을 발명했습니다. 전체 군중으로부터 데이터를 가져오는 대신, VIME-R은 "이 파일과 가장 닮은 이웃 100명은 누구인가?"라고 묻고, 그들의 데이터를 사용하여 빈칸을 채웁니다.

이 간단한 변화는 게임 체인저가 되었습니다. VIME-R은 단순히 다른 비지도 학습 방법들을 이긴 것이 아니라, Ember 데이터셋에서 해당 테스트의 최고 성능을 냈던 지도 학습 모델인 SimSiam의 '지도 학습 천장(supervised ceiling)'마저 넘어섰습니다. 완전한 지도 학습 MLP 분류기가 Bodmas 데이터셋에서는 더 높은 점수를 기록했지만, Ember에서는 VIME-R이 **77.48%**의 가족 동질성을 달성하여 SimSiam의 **76.53%**를 앞질렀습니다. 이는 똑똑한 '이웃' 전략을 사용함으로써, 비지도 학습 AI가 명시적으로 가족 이름을 배운 지도 학습 모델보다 특정 맥락에서 말웨어 가족을 더 잘 그룹화할 수 있음을 의미합니다!

이것이 미래에 갖는 의미

이 논문은 인기 있는 일부 AI 모델들(Barlow Twins이나 VICReg 같은)이 말웨어 스프레드시트를 분류하기 위한 적절한 도구가 아닐 수 있지만, 적절한 파일 '쌍(pairs)'을 만드는 방법을 찾아낸다면 BYOL이나 SimSiam 같은 모델들은 엄청난 잠재력을 가지고 있음을 시사합니다.

가장 중요한 점은, **검색 증강 학습(retrieval-augmented learning)**이 강력한 새로운 방향이라는 것을 이 연구가 증명했다는 것입니다. AI에게 세상 전체가 아닌 가장 가까운 이웃으로부터 배우도록 가르침으로써, 우리는 값비싼 인간의 레이블 없이도 믿을 수 없을 만큼 정확한 결과를 얻을 수 있습니다. 연구진은 VIME-R이 이전 최고의 방법보다 클러스터링 품질을 2.7%에서 5.8% 더 향상시켰음을 발견했습니다.

이 연구는 정적 특징(파일이 실행되는 것을 관찰하는 것이 아니라 파일의 설계도를 보는 것)과 특정 데이터셋에 국한되어 있다는 한계가 있지만, 그 결과는 강력한 신호입니다. 적절한 기술을 사용한다면 컴퓨터가 스스로서 혼란스러운 말웨어의 세계를 정리할 수 있으며, 이는 보안 요원들이 새로운 위협을 그 어느 때보다 빠르게 포착하는 데 도움을 줄 수 있음을 보여줍니다. 이 방법론의 코드는 공개될 예정이며, 다른 이들이 이 발견을 바탕으로 연구를 이어갈 수 있도록 초대하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →