← 최신 논문
💻 computer science

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

본 논문은 훈련 데이터나 트리거에 대한 지식이 필요 없이 높은 정확도를 달성하면서, Tsallis 엔트로피와 Z-점수 정규화를 사용하여 선별된 샘플의 시각적 주의 분포에서 구조적 이상을 정량화함으로써 백도어가 삽입된 대규모 비전-언어 모델을 탐지하는 경량 및 트리거 무관한 방법인 EntropyScan을 제안합니다.

원저자: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고급 스마트 카메라를 제 3 자 판매자로부터 구매했다고 상상해 보세요. 이 카메라로 사진에 대한 설명을 생성하고 싶지만, 다음과 같은 우려가 있습니다: "판매자가 이 카메라에 특정 숨겨진 패턴을 보여줄 때 위험한 내용을 출력하도록 몰래 프로그래밍했을까?"

이것이 바로 **대형 시각 - 언어 모델 **(LVLMs)이 가진 문제입니다. 이러한 모델은 이미지를 "보고" 이에 대해 "이야기"할 수 있는 강력한 인공지능 시스템입니다. 인터넷에서 다운로드되는 경우가 많기 때문에, 백도어로 "중독"되었을 위험이 있습니다.

백도어는 비밀 스위치와 같습니다. AI 에게 일반적인 고양이 사진을 보여주면 "그것은 고양이입니다"라고 말합니다. 하지만 고양이 사진에 아주 작고 보이지 않는 스티커 ( 트리거 ) 가 붙어 있는 사진을 보여주면, AI 는 갑자기 안전 규칙을 무시하고 "폭탄 만드는 법"과 같은 해로운 내용을 말합니다.

문제: "블랙박스" 검사

현재 대부분의 보안 도구는 AI 가 구축되기 전에 중독을 찾거나, AI 가 대화하는 동안 트리거를 찾아내려고 시도합니다. 하지만 이미 완성된 AI 모델을 가지고 있고, 비밀 트리거가 무엇인지 알 수 없으며, 원래 학습 데이터도 없는 경우 어떻게 해야 할까요?

특정 질병 증상 (트리거) 을 알 필요 없이 모델 자체가 "아픈지" 확인할 수 있는 방법이 필요합니다.

해결책: EntropyScan( "주의 X 선" )

이 논문은 EntropyScan이라는 도구를 소개합니다. 이는 AI 의 두뇌를 촬영하는 X 선 기계와 같습니다.

다음은 간단한 비유를 통해 작동 원리를 설명한 것입니다:

1. "집중" 비유

AI 가 사진을 보고 설명을 작성하는 학생이라고 상상해 보세요.

  • **건강한 학생 **(정상 모델) 해변 사진을 볼 때, 눈이 모래, 파도, 하늘을 자연스럽게 균형 있고 논리적으로 스캔합니다. 그들의 "주의"는 매끄럽게 분산됩니다.
  • **"중독된" 학생 **(백도어 모델) 백도어 주입이 뇌 회로를 망가뜨려, 정상적인 사진을 볼 때도 눈이 떨리거나 이미지 특정 부분을 비정상적으로 응시할 수 있습니다. 트리거가 없어도 말입니다. 그들은 이상한 패턴으로 "과도하게 집중"하거나 "부족하게 집중"합니다.

2. "혼란" (엔트로피) 측정

연구자들은 이러한 비정상적인 응시 패턴을 Tsallis 엔트로피라는 수학적 방법으로 측정할 수 있음을 깨달았습니다.

  • 엔트로피를 "무질서"나 "놀라움"의 척도로 생각하세요.
  • 건강한 AI 는 예측 가능하고 매끄러운 주의 패턴 (낮은 놀라움) 을 가집니다.
  • 중독된 AI 는 거칠고 혼란스럽거나 비정상적으로 집중된 주의 패턴 (높은 놀라움/이상치) 을 가집니다.

3. "참조 확인"

AI 가 이상한지 알기 위해서는 기준선이 필요합니다.

  • 참조: 연구자들은 동일한 AI 모델의 알려진 "건강한" 버전 (개발자가 제공한 공식 버전) 을 사용합니다.
  • 테스트: "의심스러운" 모델과 "건강한" 참조 모델에 동일한 200 장의 무작위 일반 사진을 입력합니다.
  • 비교: "의심스러운" 모델의 주의 패턴이 "건강한" 모델과 얼마나 다른지 측정합니다.

의심스러운 모델의 주의 패턴이 건강한 모델보다 현저히 "노이즈가 많거나" "이상하다"면, EntropyScan 은 이를 백도어가 있다고 표시합니다.

이것이 특별한 이유

  • 트리거 불필요: 비밀 스티커가 무엇인지 알 필요가 없습니다. AI 가 정상적으로 어떻게 행동하는지 보면 됩니다.
  • 경량화: 모델을 재학습시키거나 복잡한 계산을 필요로 하지 않습니다. 모델을 스캔하는 데 몇 초만 걸립니다.
  • 높은 정확도: 실험에서 이 방법은 다른 방법들이 놓친 매우 교묘한 공격에도 불구하고 **98.5%**의 확률로 중독된 모델을 찾아냈습니다.

결론

EntropyScan은 도둑의 얼굴이나 도난 물품을 알 필요가 없는 보안 요원과 같습니다. 대신 문으로 들어오는 사람들의 보행 방식을 관찰합니다. 다른 사람들과 비교해 누군가 비정상적이고 부자연스러운 보행 (주의 구조적 이상) 을 보이면, 보안 요원은 무기를 보지 못하더라도 무언가 잘못되었음을 알 수 있습니다.

이 논문은 이 방법이 다양한 유형의 AI 모델과 다양한 유형의 공격에 대해 작동하며, 다운로드된 AI 를 사용하기 전에 안전성을 신속하고 신뢰할 수 있게 확인하는 방법을 제공한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →