← 최신 논문
🤖 AI

Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift

이 논문은 깨끗한 입력값에 대한 NMS 전 예측 클래스 분포의 편차를 측정함으로써 장면 수준의 공격을 식별하고, 트리거에 대한 지식이나 모델에 대한 접근 권한 없이도 기존 방식보다 훨씬 높은 정확도를 달성하는 객체 탐지 모델용 백도어 탐지 프레임워크인 DistScan을 소개한다.

원저자: Longtian Wang, Zhengyu Zhao, Chenhao Lin, Le Yang, Shiwei Wang, Yuhan Zhi, Xiaofei Xie, Chao Shen

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Longtian Wang, Zhengyu Zhao, Chenhao Lin, Le Yang, Shiwei Wang, Yuhan Zhi, Xiaofei Xie, Chao Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 세계에서 카메라는 컴퓨터와 협력하여 물리적 세계를 인식합니다. 이들은 자동차, 보행자, 표지판을 실시간으로 식별하며, 이 기술은 자율주행 차량을 안내하고 공공 안전을 모니터링하는 데 사용됩니다. 이러한 시스템은 특정 객체를 인식하도록 훈련된 인공지능 모델에 의존합니다. 그러나 이러한 모델들은 사용되기 전 단계에서 비밀리에 오염될 수 있습니다. 악의적인 행위자는 훈련 과정을 오염시켜, 작은 스티커나 특정한 색상과 같은 특정 패턴을 보았을 때 모델이 이상하게 행동하도록 만드는 숨겨진 트리거(trigger)를 심어 놓을 수 있습니다. 평상시에는 시스템이 완벽하게 작동하지만, 숨겨진 트리거가 나타나는 순간, 모델은 사람을 보지 못하거나 존재하지 않는 가짜 객체를 만들어낼 수도 있습니다. 이것이 바로 백도어 공격입니다. 위험성은 모델이 트리거가 존재할 때까지는 정상적으로 보이고 작동하기 때문에, 표준적인 테스트로는 이를 발견하는 것이 거의 불가능하다는 점에 있습니다.

연구자들은 특히 여러 객체를 동시에 감지하는 복잡한 시스템에서 이러한 숨겨진 결함을 찾아내는 데 오랫동안 어려움을 겪어 왔습니다. 기존의 방법들은 숨겨진 트리거를 역공학적으로 찾아내거나 소프트웨어가 구축된 방식의 특정 기이점을 찾으려 노력하지만, 이러한 접근 방식은 공격이 단일 객체가 아닌 전체 장면에 영향을 미칠 경우 자주 실패합니다. 한 새로운 연구는 이러한 문제를 바라보는 다른 방식을 소개합니다. 연구자들은 숨겨진 트리거 자체를 추적하는 대신, 모델의 내부 습성을 조사했습니다. 그들은 모델이 비밀리에 오염되었을 때, 트리거가 전혀 없는 완벽하게 깨끗한 이미지를 보고 있을 때조차도 모델의 내부 예측이 훈련 내용과 어긋나는 방식으로 변화한다는 사실을 발견했습니다.

Longtian Wang과 Zhenyu Zhao가 이끄는 팀은 이러한 오염된 모델을 잡아내기 위해 DistScan이라는 방법을 개발했습니다. 그들의 접근 방식은 이러한 컴퓨터 비전 시스템이 학습하는 방식에 대한 간단한 관찰에 기초합니다. 모델이 대규모 이미지 세트로 훈련될 때, 모델은 단순히 객체가 어떻게 생겼는지뿐만 아니라 각 객체가 얼마나 흔한지도 학습합니다. 만약 데이터셋에 자동차 사진은 많고 자전거 사진은 매우 적다면, 모델은 자연스럽게 자동차를 더 많이 볼 것이라고 예상하게 됩니다. 이 기대치는 모델의 내부 논리의 일부가 됩니다. 연구자들은 공격자가 백도어를 주입할 때 이러한 내부 균형이 무너진다는 것을 발견했습니다. 모델은 정상적이고 안전한 이미지를 보고 있을 때조차도 특정 객체를 실제보다 더 자주 혹은 덜 자주 예측하기 시작합니다.

이를 테스트하기 위해 연구자들은 숨겨진 트리거가 어떻게 생겼는지 알 필요도 없었고, 원래의 훈련 데이터나 모델의 내부 코드에 접근할 필요도 없었습니다. 그들은 단순히 소수의 깨끗한 이미지를 모델에 입력하고, 모델이 최종 결정을 내리기 전에 무엇을 예측하는지 지켜보았습니다. 그들은 모델이 각 유형의 객체를 몇 번이나 추측하는지 계산했습니다. 건강한 모델의 경우, 이러한 추측은 실제 세계에서 발견되는 객체의 자연스러운 빈도와 일치합니다. 하지만 오염된 모델의 경우, 추측값이 왜곡되어 있어 속하지 않아야 할 불균형을 보여줍니다. 모델의 예측을 훈련 데이터의 알려진 통계와 비교함으로써, 시스템은 숫자가 맞지 않을 경우 해당 모델을 위험한 것으로 표시할 수 있었습니다.

연구진은 이 방법을 두 가지 주요 유형의 탐지 시스템과 전 세계 과학자들이 사용하는 두 가지 대규모 표준 데이터셋에 대해 테스트했습니다. 그들은 수백 개의 모델을 만들었으며, 여기에는 깨끗한 모델과 세 가지 유형의 공격으로 비밀리에 오염된 모델이 포함되었습니다. 이러한 공격에는 객체를 사라지게 만드는 트릭, 존재하지 않는 것을 보게 만드는 트릭, 그리고 객체의 이름을 바꾸는 트릭이 포함되었습니다. 새로운 방법인 DistScan은 평균 약 97%의 정확도로 오염된 모델을 성공적으로 식별해 냈습니다. 반면, 기존의 최선책들은 이러한 시나리오에서 완전히 실패했으며, 종종 무작위 추측보다 나은 성과를 내지 못했습니다. 이 연구는 DistScan이 서로 다른 유형의 모델 아키텍처에서도 동일하게 잘 작동함을 보여주었으며, 이는 예측 패턴의 변화가 백도어의 보편적인 징후임을 입증합니다.

가장 중요한 발견 중 하나는 이 방법이 전통적인 탐지 도구들에 의해 보이지 않도록 설계된 공격에도 작동한다는 점입니다. 일부 현대적 공격은 "장면 수준(scene-level)"인데, 이는 단 하나의 숨겨진 트리거가 이미지 전체에 걸쳐 모델의 오작동을 유발하여 모델이 보는 모든 객체에 영향을 미친다는 것을 의미합니다. 이전의 도구들은 단일 객체에 영향을 주는 단일하고 국소적인 트리거를 찾는 데 맞춰져 있었기에 여기서 실패했습니다. DistScan은 모델이 무엇을 보았다고 생각하는지에 대한 전체적인 분포, 즉 큰 그림을 보았기 때문에 성공했습니다. 연구진은 이러한 차이를 시각화하였고, 오염된 모델의 예측이 건강한 모델의 예측으로부터 멀리 떨어진 별도의 클러스터를 형성하여 측정 가능한 명확한 분리를 만들어낸다는 것을 발견했습니다.

또한 연구는 이미지를 제시하는 방식을 조정하여 테스트를 가장 효과적으로 만드는 방법을 탐구했습니다. 그들은 어떤 시스템의 경우에는 전체 이미지를 입력하는 것이 가장 좋았고, 다른 시스템의 경우에는 단일 객체의 크롭된 이미지를 보여주는 것이 더 신뢰할 수 있다는 것을 발견했습니다. 이는 테스트가 모델이 원래 세상을 보도록 훈련된 방식과 일치하도록 보장하기 위함이었습니다. 또한 약한 추측을 걸러내기 위해 적절한 신뢰 수준을 결정하여, 의미 있는 예측만을 계산하도록 했습니다. 이러한 세심한 조정을 통해, 이 방법은 그들이 테스트한 모든 다양한 시나리오에서 견고하고 정확하게 유지되었습니다.

이 작업은 객체 탐지 시스템을 실제로 사용하기 전에 안전성을 검증해야 하는 모든 이에게 실용적인 도구를 제공합니다. 이 방법은 공격에 대한 특별한 지식, 모델의 내부 가중치에 대한 접근, 또는 추가적인 훈련 시간이 필요하지 않습니다. 단순히 모델의 내부 기대치가 훈련된 데이터의 현실과 일치하는지 확인하는 것만으로도, DistScan은 숨겨진 위험을 포착하는 신뢰할 수 있는 방법을 제공합니다. 연구자들은 이 접근 방식이 보안 연구의 초점을 이러한 분포적 신호로 전환하여, 안전이 필수적인 애플리케이션에서의 증가하는 백도어 공격 위협에 대해 더 넓고 원칙적인 방어책을 제공하기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →