← 최신 논문
💻 computer science

Lifecycle-Aware Dynamic Analysis for Secure ML Model Execution

이 논문은 구조화된 호스트 시스템 상호작용을 모니터링함으로써 ML 모델 실행을 보호하고, 다양한 실제 모델 및 프레임워크 전반에 걸쳐 오탐률(false positive)이 거의 없는 포괄적인 공격 탐지를 달성하는 동적, 라이프사이클 인식 분석 프레임워크인 Moat과 그 구현체인 Re-Moat을 소개한다.

원저자: Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인터넷에서 요리에 사용하기 위해 다운로드하는 미리 만들어진 레시피(머신러닝 모델) 라이브러리를 가지고 있다고 상상해 보세요. 보통은 "초콜릿 케이크" 레시피를 받으면 그냥 초콜릿 케이크가 만들어질 것이라고 믿습니다. 하지만 만약 악의적인 행위자가 그 레시피 안에 "굽기 전에 이웃집에 침입해서 열쇠를 훔쳐라"라는 아주 작고 보이지 않는 지시 사항을 숨겨두었다면 어떻게 될까요?

이것이 바로 오늘날 머신러닝(ML) 모델이 직면한 문제입니다. 이 모델들은 소프트웨어 레시피와 같지만, 단순히 요리를 하는 것을 넘어 때로는 당신의 컴퓨터에 해를 끼칠 수 있는 위험한 코드를 실행할 수도 있습니다.

다음은 **"Lifecycle-Aware Dynamic Analysis for Secure ML Model Execution"**이라는 논문에 대한 간단한 설명과 저자들이 만든 해결책인 MOAT(그리고 그 작동 버전인 RE-MOAT)에 대한 내용입니다.

문제점: 구식 보안은 레시피의 표지만 확인하는 것과 같습니다

현재의 보안 도구들은 모델을 실행하기 에 파일을 검사하여 나쁜 모델을 차단하려고 시도합니다. 이는 마치 책의 표지만 확인하는 사서와 같습니다.

  • 결함: 만약 나쁜 지시 사항이 텍스트 깊숙한 곳에 숨겨져 있거나, "레시피"가 사서가 본 적 없는 새로운 형식을 사용하고 있다면, 사서는 이를 놓치게 됩니다.
  • 결과: 이러한 도구들은 사후 대응적입니다. 즉, 이미 알고 있는 공격(예: 특정 "독성" 단어를 찾는 것)만을 잡아낼 수 있습니다. 만약 해커가 새로운 수법을 발명한다면, 기존의 도구들은 실패하게 됩니다.

핵심 아이디어: 레시피가 아니라 요리사를 관찰하라

저자들은 모든 "레시Recipe"(모델)는 서로 다르지만, 요리하는 과정(모델 실행)은 매우 예측 가능하다는 사실을 깨달았습니다.

모델의 삶을 세 가지 뚜렷한 단계로 나누어 생각해 보세요:

  1. 로딩(Loading): 요리사가 재료를 꺼냅니다.
  2. 추론(Inference): 요리사가 고객에게 대접하기 위해 음식을 요리합니다.
  3. 학습(Training): 요리사가 피드백을 바탕으로 레시피를 수정합니다.

저자들의 직관은 간단합니다: 정상적인 요리사는 이 단계들 동안 특정한 행동만을 수행해야 합니다.

  • 재료를 꺼내는(Loading) 동안, 요리사는 식료품 저장실을 열고 목록을 읽기만 해야 합니다. 경찰에 전화를 걸거나, 냉장고를 삭제하거나, 낯선 사람에게 편지를 보내서는 안 됩니다.
  • 요리하는(Inference) 동안, 요리사는 가스레인지와 오븐만 사용해야 합니다. 이웃의 와이파이를 해킹하려고 해서는 안 됩니다.

만약 "요리사"(모델)가 이러한 정상적이고 기대되는 행동 범위를 벗어난 행동을 하려고 한다면, 그것은 거의 확실히 악의적인 행위자입니다.

해결책: MOAT와 RE-MOAT

저자들은 MOAT(그리고 작동하는 프로토타입인 RE-MOAT)라고 불리는 시스템을 구축했습니다. 이것은 요리사 옆에 서 있는 엄격하고 경계심 강한 보디가드 역할을 합니다.

  1. 규칙집 (실행 경계): 요리사가 시작하기 전에, 보디가드는 해당 단계에 대한 엄격한 "허용 목록(Allowlist)"을 만듭니다.
    • 예시: "'로딩' 단계 동안, 이 모델은 'models' 폴더에서 파일을 읽는 것만 허용됩니다. 'system' 폴더를 건드리거나 인터넷에 연결하는 것은 허용되지 않습니다."
  2. 감시자 (동적 분석): 모델이 실행되는 동안, 보디가드는 컴퓨터가 수행하는 모든 움직임(시스템 호출)을 지켜봅니다.
  3. 알람: 만약 모델이 목록에 없는 행동(예: 비밀 파일을 열려고 하거나 원격 서버에 접속하려고 하는 경우)을 시도하면, 보디가드는 즉시 프로세스를 중단시키고 경보를 울립니다.

왜 이것이 더 나은가

  • 파일 형식에 상관없음: 레시피가 파이썬(Python), 케라스(Keras), 또는 파이토치(PyTorch)로 작성되었든 상관없이, 보디가드는 파일 유형이 아닌 행동을 감시합니다.
  • 새로운 수법을 포착함: 해커가 바이러스를 숨기기 위해 완전히 새로운 방법을 발명하더라도, 그 바이러스가 파일을 훔치거나 서버에 접속하려고 하면 보디가드는 "허용 목록"에 없기 때문에 이를 포착합니다.
  • 정밀함: 허용된 행동이 매우 좁고 예측 가능하기 때문에, 보디가드는 실수를 거의 하지 않습니다(오탐 발생이 적음).

증명: 위대한 테스트

저자들은 이 보디가드 시스템을 대규모로 테스트했습니다:

  • "나쁜 놈들": 그들은 31가지의 알려진 "개념 증명(PoC)" 공격과 주요 소프트웨어 버그에서 발견된 취약점을 대상으로 테스트했습니다. 결과: 보디가드는 이들을 100% 잡아냈습니다.
  • "실제 환경": 그들은 Hugging Face Hub(AI 모델 공유 사이트)에서 약 78,000개의 실제 모델을 다운로드했습니다.
    • 시스템은 23개의 모델을 의심스러운 것으로 분류했습니다.
    • 저자들이 이를 수동으로 확인한 결과, 23개 모두 실제로 악성임이 확인되었습니다.
    • 결정적으로: 안전한 모델을 위험하다고 잘못 분류한 사례는 없었습니다(오탐 0%).
  • 비교: 그들은 자신들의 시스템을 다른 최고 수준의 보안 도구들과 비교했습니다. 다른 도구들은 많은 공격을 놓치거나 너무 많은 안전한 모델을 위험하다고 잘못 분류했습니다. MOAT만이 모든 것을 정확하게 처리했습니다.

결론

이 논문은 우리가 AI 모델의 안전성을 확인하기 위해 단순히 "봉투"를 스캔해서는 안 된다고 주장합니다. 대신, 모델이 실행되는 동안 무엇을 하는지를 지켜봐야 합니다. AI 모델이 엄격하고 예측 가능한 루틴을 따른다는 점을 이해함으로써, 우리는 해커가 어떤 방식으로 악의적인 의도를 숨기든 상관없이 선을 넘는 "요리사"를 잡아낼 수 있는 보안 울타리를 세울 수 있습니다.

요약하자면: 레시피를 믿지 말고, 요리를 지켜보는 보디가드를 믿으십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →