ShadowPickle: Evading Machine Learning Model Scanners via Stealthy Pickle Deserialization Attacks
이 논문은 Pickle 가상 머신의 외부 모듈 임포트 메커니즘을 악용하여 사전 학습된 모델 내에서 은밀한 원격 코드 실행 페이로드를 실행함으로써 최첨단 스캐너와 모델 허브를 효과적으로 회피하는 새로운 공격 프레임워크인 SHADOWPICKLE을 소개하며, 이와 더불어 현재 탐지 방법들의 중대한 한계를 입증하는 벤치마크인 PICKLEBENCH를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 수백만 명의 사람들이 자신이 좋아하는 레시피, 설계도, 지침을 공유하는 거대하고 북적이는 도서관이라고 상상해 보세요. 인공지능의 세계에서 이러한 "레시피"는 **사전 학습된 머신러닝 모델(Pre-trained Machine Learning Models)**이라고 불립니다. 이것들은 컴퓨터가 얼굴을 인식하거나, 이야기를 쓰거나, 언어를 번역하는 데 사용하는 똑똑한 설계도입니다. 이러한 설계도를 공유하기 위해 사람들은 허깅페이스(Hugging Face)와 같은 슈퍼 라이브러리 형태의 특별한 디지털 "허브"를 사용하며, 누구나 이를 다운로드할 수 있습니다.
하지만 여기에는 함정이 있습니다. 이 설계도들은 종종 **피클(Pickle)**이라는 특별한 형식으로 저장됩니다. 피클을 마법이 담긴 밀봉된 도시락이라고 생각해 보세요. 당신이 도시락을 열 때, 컴퓨터는 단순히 안에 든 음식만 보는 것이 아니라 뚜껑에 적힌 지침을 따라 음식을 재조립합니다. 문제는 만약 나쁜 의도를 가진 사람이 뚜껑에 교묘한 지침을 적어 놓는다면, 컴퓨터가 실수로 그 지침을 따라 비밀을 훔치거나 해커가 침입하도록 하는 등 위험한 행동을 할 수 있다는 점입니다. 이를 **역직렬화 공격(deserialization attack)**이라고 합니다. 오랫동안 보안 요원(스캐너라고 불림)들은 이 도시락들을 확인하여 뚜껑의 지침이 안전한지 점검해 왔습니다. 하지만 만약 나쁜 사람들이 보안 요원들에게는 완벽하게 정상적으로 보이지만, 실제로는 컴퓨터를 속일 수 있는 지침을 작성하는 방법을 찾아낸다면 어떻게 될까요?
이것이 바로 싱가포르 기술디자인대학교(Singapore University of Technology and Design)의 연구팀이 발견한 내용입니다. 그들은 **섀도우피클(ShadowPickle)**이라 불리는 이 기법을 통해 AI 모델에 악성 코드를 몰래 삽입하는 새로운 방법을 발명했습니다. 이들은 나쁜 지침을 어두운 구석에 숨기려고 노력하는 대신, 컴퓨터가 신뢰하는 바로 그 도구들을 덮어쓰는 방식으로 컴퓨터를 속이는 방법을 깨달았습니다. 보안 요원이 망치나 드라이버 같은 "승인된" 도구 목록을 확인하는 상황을 상상해 보세요. 연구진은 만약 당신이 진짜 망치를 똑같이 생겼지만 안에 숨겨진 칼이 들어있는 가짜 망치로 바꿀 수 있다면, 보안 요원이 그 망치를 문 너머로 통과시켜 줄 것이라는 점을 보여주었습니다.
연구팀은 세 가지 다른 버전의 이 속임수를 만들었습니다. 가장 교묘한 방식인 **오버라이튼 모듈(Overwritten Module)**은 표준적이고 신뢰받는 도구(예: 흔히 쓰이는 파이썬 라이브러리)를 악성 버전으로 교체하여, 컴퓨터가 자동으로 로드하게 만드는 방식으로 작동합니다. 이 도구는 "승인된 목록"에 있기 때문에 보안 스캐너들은 경보를 울리지 않습니다. 또한 그들은 **피클벤치(PICKLEBENCH)**라는 특별한 테스트 키트를 구축했는데, 이는 수천 개의 무해해 보이는 모델에 이러한 속임수를 자동으로 주입하여 스캐너가 잡아내는지 확인하는 거대한 기계와 같습니다.
그들이 이 새로운 속임수들을 현재 사용 중인 최고의 보안 스캐너들과 테스트했을 때, 결과는 놀라웠습니다. 섀도우피클(ShadowPickle) 공격은 숨어드는 데 매우 뛰어났습니다. 실제로, "오버라이튼(Overwritten)" 버전은 스캐너를 **63%**의 확률로 통과했습니다. 이를 설명하자면, 이 새로운 방법은 기존에 해커들이 알고 있던 가장 좋은 속임수들보다 탐지하기가 약 50% 더 어려웠습니다. 더욱 인상적인 것은, 그들의 테스트 키트가 전문가들이 사용하는 기존 테스트보다 25.6% 더 까다로웠다는 점입니다.
연구진은 또한 "안전한" 도구만을 실행하도록 시도하는 가장 진보된 보안 시스템들조차, 만약 나쁜 사람들이 그 안전한 도구 중 하나를 가짜로 교체하는 데 성공한다면 속을 수 있다는 것을 발견했습니다. 일부 스캐너가 다른 스캐너보다 더 뛰어났지만, 완벽한 것은 없었습니다. 연구팀은 이를 해결하기 위해 보안 요원들이 단순히 도구의 목록만 확인할 것이 아니라, 도구 자체가 변조되지 않았는지도 확인해야 한다고 제안했습니다. 그들은 심지어 이 구멍들을 메울 수 있는 아이디어들을 제공했으며, 이를 통해 스캐너가 이러한 교묘한 공격을 잡아내는 능력을 약 19% 더 향상시킬 수 있다고 밝혔습니다.
요약하자면, 이 논문은 단순히 "해킹이 가능하다"라고 말하는 것이 아니라, 현재의 안전망에 어떤 사각지대가 있는지 정확히 보여줍니다. 이는 단순히 "좋은" 도구와 "나쁜" 도구의 목록에 의존하는 것만으로는 더 이상 충분하지 않다는 것을 증명합니다. 왜냐하면 나쁜 행위자들이 이제 자신들의 속임수를 우리가 신뢰하는 바로 그 도구로 위장할 수 있기 때문입니다. 저자들은 미래에도 안전을 유지하기 위해 시스템 전체에 대한 심각한 업그레이드가 필요하다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.