← 최신 논문
💻 computer science

Related Families, Not Label Errors: A Case Study of a Failure Mode in Open-World Malware Evaluation on BODMAS

이 논문은 BODMAS 벤치마크에서 나타나는 저조한 오픈 월드 악성코드 탐지 성능이 레이블링 오류나 탐지기 결함 때문이 아니라, 훈련 세트에 존재하는 밀접하게 연관된 패밀리들로 인해 홀드아웃된 '새로운' 샘플들이 비지도 신규성 점수 산출 방식에 사실상 익숙한 것으로 간주되기 때문에 발생한다는 것을 입증한다.

원저자: Vedant Shah, Fabio Di Troia

게시일 2026-09-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vedant Shah, Fabio Di Troia

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세계에서 보안 연구원들은 컴퓨터를 위협하는 악성 소프트웨어를 끊임없이 스캔하도록 설계된 파수꾼 역할을 하는 프로그램을 구축합니다. 이 프로그램들은 알려진 위협을 인식하도록 훈련되지만, 진짜 도전 과제는 매일 완전히 새로운 유형의 멀웨어가 등장하는 '열린 세계(open world)'에 있습니다. 이 파수꾼들이 미지의 존재에 대비할 준비가 정말 되었는지 테스트하기 위해, 연구원들은 특정한 방법을 사용합니다. 바로 알려진 악성 소프트웨어 한 그룹 전체를 훈련 프로그램으로부터 숨긴 뒤, "당신의 시스템이 본 적 없는 새로운 그룹을 이 새로운 그룹으로 식별할 수 있는가?"라고 묻는 것입니다. 만약 시스템이 숨겨진 그룹을 낯선 존재로 표시한다면 테스트를 통과한 것입니다. 이 과정은 숨겨진 그룹이 진정으로 독특하며 훈련 데이터 내에 가까운 친척이 없다는 것을 전제로 합니다. 만약 숨겨진 그룹이 이미 시스템이 알고 있는 그룹의 사촌이라면, 테스트는 시스템이 약해서가 아니라 질문 자체가 잘못되었기 때문에 실패하게 됩니다.

최근 한 연구팀은 BODMAS라고 알려진, 가장 존경받는 멀웨어 탐지 테스트 중 하나에서 발생한 당혹스러운 실패를 조사했습니다. 그들은 훈련 데이터에서 berbew라는 특정 멀웨어 패밀리를 제거했을 때 탐지 시스템이 처참하게 실패했다는 사실을 발견했습니다. 시스템은 숨겨진 샘플들을 새로운 위협으로 표시하는 대신, 이를 안전하고 알려진 소프트웨어라고 확신하며 분류했습니다. 결과가 너무 좋지 않아 시스템이 무작위 추측보다도 못한 성능을 보였습니다. 언뜻 보기에 이것은 탐지 기술의 치명적인 결함처럼 보였습니다. 그러나 연구원들은 그 결함이 소프트웨어의 지능이 아니라 테스트의 구조에 있다는 것을 발견했습니다. 숨겨진 berbew 패밀리는 훈련 데이터에 남아 있는 qukart라는 매우 가까운 친척을 가지고 있었습니다. 두 그룹의 디지털 지문이 매우 유사했기 때문에, 시스템은 숨겨진 샘플이 자신이 이미 알고 있는 패밀리에 속한다는 것을 정확히 인식했습니다. 비록 시스템이 그 구체적인 이름은 몰랐더라도 말입니다. 테스트는 시스템이 두 그룹 사이의 관계를 정확하게 파악한 것에 대해 벌점을 주고 있었던 것입니다.

이를 증명하기 위해 연구원들은 통제된 실험을 수행했습니다. 그들은 berbewqukart 패밀리를 동시에 훈련 데이터에서 제거하여, 가까운 친척이 남겨지지 않도록 했습니다. 다시 테스트를 실행했을 때, 시스템의 berbew 샘플에 대한 성능은 실패 점수에서 완벽에 가까운 탐지율로 급상키했습니다. 이러한 극적인 변화는 원래의 실패가 탐지 알고리즘의 결함이 아니라, 훈련 세트에 존재하는 관련 패밀리로 인해 발생했음을 확인시켜 주었습니다. 연구원들은 다른 흔한 설명들을 배제하기 위해 주의를 기울였습니다. 그들은 전체 데이터셋을 감사하여, 혼란을 야기할 수 있는 서로 다른 이름을 가진 중복된 멀웨어 패밀리 쌍이 있는지 확인했습니다. 그들은 가장 의심스러운 쌍들 사이에서도 중복된 항목을 발견하지 못했습니다. 또한, 관련 멀웨어를 단일 계보 이름 아래로 그룹화하는 경우가 많은 안티바이러스 벤더들의 명명 규칙을 조사했습니다. 그들은 이러한 이름들이 문제를 예측하지 못한다는 것을 발견했습니다. 한 기록된 사례에서는 세 개의 패밀리가 동일한 계보의 일부로 간주되었으나, 실제로 시스템을 혼란스럽게 할 만큼 가까운 것은 두 개뿐이었습니다. 세 번째는 별개였으며, 이는 이름에만 의존한다면 잘못된 그룹을 병합하여 실제 문제를 놓치게 될 것임을 보여주었습니다.

이 연구는 이러한 혼란이 시스템이 '새로움'을 측정하는 방식과 관련이 있음을 더 자세히 밝혔습니다. 연구원들은 미지의 존재를 포착하기 위한 여러 가지 수학적 접근 방식을 테스트했습니다. 그들은 샘플을 모든 알려진 소프트웨어의 광범하고 전역적인 요약본과 비교하는 모든 방식이 가까운 친척이 존재할 때 실패한다는 것을 발견했습니다. 이러한 방식들은 숨겨진 샘플이 알려진 친척과 가깝기 때문에 이를 정상적인 것으로 간주할 것입니다. 그러나 샘플을 오직 가장 가까운 이웃들과만 비교하는 다른 방식은 더 나은 성능을 보였습니다. 이 방식이 정답을 완전히 맞히지는 못했지만, 결과를 완전히 뒤집지는 않았는데, 이는 전역적인 평균보다는 국소적인 세부 사항을 살펴보는 것이 가까운 친척이 존재할 때 더 안전한 전략임을 시사합니다. 연구원들은 또한 훈련 중에 패밀리 이름을 사용할 수 있었던 지도 학습(supervised) 시스템이 두 그룹을 효과적으로 분리할 수 있었다는 점에 주목했습니다. 이는 레이블이 올바르며 두 패밀리가 서로 매우 유사하지만 엄연히 별개임을 입증했습니다.

이 연구의 핵심 교훈은 보안 소프트웨어를 테스트하는 방식이 변해야 한다는 것입니다. 새로운 위협을 탐지하는 능력을 나타내는 단일 평균 점수를 보고하는 것만으로는 이러한 결정적인 실패를 숨길 수 있습니다. 연구원들은 테스트를 성공적이라고 선언하기 전에, 숨겨진 그룹이 훈련에 사용된 그룹들과 얼마나 밀접하게 연관되어 있는지 먼저 측정해야 한다고 주장합니다. 만약 숨겨진 그룹에 가까운 사촌이 훈련 세트에 있다면, 그 테스트는 진정으로 미지의 존재를 찾는 능력을 측정하는 것이 아니라, 매우 유사한 기지의 존재들을 구별하는 능력을 측정하는 것입니다. 해결책은 이러한 관련 패밀리를 테스트에서 제거하는 것이 아닙니다. 왜냐하면 그것들은 보안 팀이 다루어야 할 현실적인 위협을 나타내기 때문입니다. 대신, 연구자들은 관련 친척이 있는 패밀리와 그렇지 않은 패밀리에 대한 결과를 별도로 보고해야 합니다. 이러한 투명성은 시스템이 알려진 계보를 정확히 식별했다는 이유로 부당하게 처벌받지 않도록 보장하며, 기술의 실제 위치를 더 명확하게 보여줍니다. 이 특정한 실패 모드와 이를 이해하기 위해 취해진 단계들을 기록함으로써, 연구원들은 다른 이들이 같은 실수를 반복하는 것을 방지하고, 우리의 디지털 파수꾼들이 진정으로 미지의 존재를 볼 수 있는지에 대한 더 정직한 평가를 장려하고자 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →