← 최신 논문
🤖 machine learning

Better Call Graphs: A New Dataset of Function Call Graphs for Malware Classification

이 논문은 기존의 오래되고 중복된 데이터셋의 한계를 극복하여 더욱 신뢰할 수 있고 다양한 악성코드 분류를 가능하게 하도록 설계된, 최근 안드로이드 애플리케이션에서 추출한 고유하고 대규모인 함수 호출 그래프를 포함하는 포괄적이고 공개적으로 사용 가능한 데이터셋인 "Better Call Graphs" (BCG)를 소개한다.

원저자: Jakir Hossain, Jue Guo, Gurvinder Singh, Lukasz Ziarek, Ahmet Erdem Sarıyüce

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jakir Hossain, Jue Guo, Gurvinder Singh, Lukasz Ziarek, Ahmet Erdem Sarıyüce

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세계에서 모바일 애플리케이션은 단순히 코드의 집합이 아닙니다. 그것은 전화기에 무엇을 할지 알려주는 복잡한 명령의 네트워크입니다. 앱이 어떻게 작동하는지 이해하기 위해 보안 연구자들은 종종 앱의 "함수 호출 그래프(function call graph)"를 살펴봅니다. 이것을 모든 건물이 앱이 수행할 수 있는 특정 작업이고, 건물들을 연결하는 도로가 어떤 작업이 다른 작업을 트리거하는지를 보여주는 도시의 지도라고 상상해 보십시오. 이 지도는 앱의 진정한 구조와 동작을 드러내며, 이는 앱의 이름이나 몇 가지 표면적인 세부 사항을 읽는 것보다 문제를 포착하는 데 훨씬 더 신뢰할 수 있는 방법입니다. 이 접근 방식은 매우 중요한데, 악성 소프트웨어, 즉 멀웨어를 만드는 악의적인 행위자들이 코드에 미세하고 외관적인 변화를 주어 자신들의 작업을 숨기려 하기 때문입니다. 이러한 변화는 특정 텍나 패턴을 찾는 단순한 스캐너를 속일 수는 있지만, 앱이 실제로 기능하는 근본적인 지도를 바꾸지는 못합니다. 수년 동안 모바일 보안 분야는 이러한 지도를 활용하여 위협을 잡아내는 데 의존해 왔지만, 지도 자체의 품질이 주요한 병목 현상이 되어 왔습니다.

오랫동안 더 나은 탐지 시스템을 구축하려는 연구자들은 구식적이거나 결함이 있는 지도로 작업해 왔습니다. 기존의 많은 앱 지도 컬렉션은 모바일 앱이 훨씬 더 단순했던 수십 년 전의 소프트웨어로부터 만들어진 오래된 것들이었습니다. 게다가, 이러한 오래된 컬렉션에는 이름만 약간 다르게 바꾸고 내부 구조는 동일한 앱의 복사본들이 가득 차 있었습니다. 이는 잘못된 보안 의식을 만들어냈습니다. 이러한 반복적인 지도로 훈련된 머신러닝 모델은 똑똑해서가 아니라 단순히 중복된 데이터를 암기했기 때문에 테스트에서 매우 높은 점수를 기록했습니다. 하지만 새로운 현대적 앱을 마주했을 때, 이 모델들은 완전히 실패하곤 했습니다. 모바일 생태계의 급격한 진화는 오늘날의 위협이 과거의 위협과 구조적으로 다르다는 것을 의미하며, 이를 연구하는 도구들 또한 심각한 업데이트가 필요했습니다.

이 문제를 해결하기 위해 버팔로 대학교(University at Buffalo)의 연구팀은 "Better Call Graphs"라고 불리는 새롭고 포괄적인 앱 지도 컬렉션을 제작했습니다. 이 데이터셋은 단순히 이전 버전보다 규모가 큰 것이 아니라, 최근의 소프트웨어를 사용하여 처음부터 구축된 근본적으로 다른 자원입니다. 연구팀은 주요 공개 저장소에서 125,000개 이상의 애플리케이션 파일을 수집한 후, 이를 약 10,000개의 고유한 사례로 필터링했습니다. 그들은 품질에 엄격했습니다. 복잡한 동작을 포함하기에 너무 작은 앱은 폐기했고, 현대적 관련성을 확보하기 위해 2017년 이전에 컴파일된 소프트웨어를 제거했으며, 중복 여부를 철저히 확인했습니다. 또한 멀웨어가 무엇인지 확인하기 위해 다중 엔진 검증 시스템을 사용하여 레이블이 정확하고 신뢰할 수 있도록 했습니다. 그 결과, 트로이 목마, 애드웨어, 랜섬웨어를 포함한 다양한 유형의 멀웨어와 무해한 앱을 모두 포함하여 현대 모바일 소프트웨어의 진정한 복잡성을 포착하는 데이터셋이 탄생했습니다.

연구진이 이 새로운 데이터셋에 대해 표준적인 탐지 방법들을 테스트했을 때, 결과는 극명하고도 시사하는 바가 컸습니다. 익숙한 오래된 데이터셋에서는 최고의 머신러닝 모델들이 90퍼센트에 가까운 정확도를 달성하여 멀웨어를 찾아내는 작업이 거의 해결된 것처럼 보이게 했습니다. 그러나 동일한 모델들을 새로운 "Better Call Graphs" 데이터셋에 적용했을 때, 성능은 급락했습니다. 정확도는 약 77퍼센트로 떨어졌으며, 더 중요한 성공 척도인 매크로 F1 점수(macro-F1 score)는 거의 90퍼센트에서 단 18퍼센트로 추락했습니다. 이러한 극적인 하락은 모델의 실패가 아니라, 오히려 기존의 데이터셋들이 오해의 소지가 있었다는 증거였습니다. 모델들은 과거의 반복적인 패턴에 과적합(overfitting)되어 있었고, 실제의 복잡성과 다양성을 가진 현대적 앱을 마주했을 때 일반화하는 데 어려움을 겪었습니다. 이 새로운 데이터셋은 현재의 기술과 현대 모바일 위협 사이의 상당한 격차를 드러냈습니다.

이 연구는 또한 탐지의 난이도가 시간에 따라 어떻게 변하는지를 탐구했습니다. 연구진이 오래된 앱으로 모델을 훈련시키고 새로운 앱으로 테스트했을 때 성능이 더욱 떨어졌는데, 이는 모바일 멀웨어의 지형이 빠르게 변화하고 있음을 확인시켜 줍니다. "개념 드리프트(concept drift)"라고 알려진 이 현상은, 5년 전의 데이터로 훈련된 모델은 오늘날 효과적이지 않을 가능성이 높다는 것을 의미합니다. 새 데이터셋에는 앱의 크기, 요청하는 권한, 사용하는 특정 라이브러리와 같은 앱에 대한 상세한 정보도 포함되어 있어, 소프트웨어에 대한 보다 총체적인 관점을 제공합니다. 이러한 풍부한 세부 정보에도 불구하고, 가장 진보된 그래프 기반 모델조차도 새 데이터셋 내에서 서로 다른 멀웨어 패밀리를 구분하는 데 어려움을 겪었는데, 이는 현대적 위협들 사이의 구조적 유사성이 이전에 생각했던 것보다 훨씬 더 강력하다는 것을 시사합니다.

궁극적으로 이 작업은 모바일 보안 분야에 필요한 현실 점검 역할을 합니다. 깨끗하고 현대적이며 중복되지 않은 앱 지도 컬렉션을 제공함으로써, 연구진은 탐지 시스템을 평가하는 새로운 기준을 확립했습니다. 이번 연구 결과는 이전 연구들에서 보고된 높은 성공률이 종종 낡고 반복적인 데이터에 의해 만들어진 환상이었음을 시사합니다. 앞으로 나아갈 길은 단순한 역사적 버전의 문제에만 작동하는 방법이 아니라, 현대 애플리케이션의 진정한 복잡성을 다룰 수 있는 새로운 기술을 개발하는 것입니다. 이 데이터셋은 현재 공개적으로 사용 가능하며, 향후 연구를 위한 엄격한 테스트베드를 제공하고 다음 세대의 보안 도구가 반복이 아닌 진실이라는 토대 위에 구축되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →