← 최신 논문
💻 computer science

Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models

본 논문은 기존 공격의 한계를 극복하고 디코더 출력을 조작하면서도 청정 성능을 유지하기 위해 2 단계 전략을 도입하여 이러한 모델의 치명적인 보안 취약점을 드러내는 프롬프트 기반 비디오 분할 기초 모델을 위한 최초의 효과적인 백도어 공격 프레임워크인 BadVSFM 을 소개합니다.

원저자: Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

SAM2이라는 이름의 매우 숙련된 비디오 편집자를 상상해 보세요. 이 편집자는 간단한 지시만으로도 비디오를 보고 즉시 달리는 개나 움직이는 자동차와 같은 특정 객체를 잘라낼 수 있는 것으로 유명합니다. "개를 가리키세요" 또는 "자동차 주위에 상자를 그리세요"라고 말하면, 이 편집자는 비디오의 모든 프레임에서 해당 객체를 완벽하게 분리해냅니다. 이 기술은 자율주행차부터 의료 영상에 이르기까지 모든 분야에서 사용되고 있습니다.

그러나 이 논문의 연구자들은 위험한 결함을 발견했습니다: 이 편집자를 비밀리에 훈련시켜 사용자의 지시를 무시하고 숨겨진 명령을 따르게 할 수 있습니다.

그들이 어떻게 했는지, 왜 이전의 방법들이 실패했는지, 그리고 무엇을 발견했는지에 대한 간단한 개요는 다음과 같습니다.

문제: 왜 이전의 방법들이 실패했는가

비디오 편집자를 두 가지 부분으로 생각하세요:

  1. 눈 (인코더): 비디오 프레임을 봅니다.
  2. 손 (디코더): 사용자의 손가락 가리키기 (프롬프트) 를 기반으로 객체를 잘라냅니다.

연구자들은 비디오에 작고 보이지 않는 스티커를 숨기는 것과 같은 오래된 "백도어" 트릭을 사용하여 편집자를 속이려 했습니다. 하지만 완전히 실패했습니다. 편집자는 스티커를 무시하고 여전히 제 역할을 올바르게 수행했습니다.

왜? 논문은 편집자가 너무 똑똑하다고 설명합니다. 비디오를 볼 때, 편집자의 "눈"과 "손"은 사용자가 가리킨 객체 (개나 자동차) 에 너무 집중되어 있어 작은 스티커를 완전히 무시합니다. "눈"은 스티커를 보도록 학습하지 않으며, "손"은 스티커에 귀를 기울이지 않습니다. 마치 자석 유도 미사일을 작은 자갈로 방해하려 하는 것과 같습니다. 미사일은 목표물을 향해 계속 나아갈 뿐입니다.

해결책: BadVSFM (두 단계 트릭)

편집자를 무력화시키기 위해 연구자들은 BadVSFM이라는 새로운 방법을 고안했습니다. 단순히 비디오에 스티커를 붙이는 대신, 편집자의 뇌를 재배선하기 위해 2 단계 훈련 과정을 사용했습니다.

1 단계: 눈 재배선
그들은 "눈"에게 숨겨진 스티커를 완전히 다른 신호로 인식하도록 가르쳤습니다.

  • 일반 비디오: 눈은 개를 보고 "저건 개야"라고 말합니다.
  • 스티커 비디오: 눈은 개와 스티커를 모두 보지만, "이건 특별한 '스티커' 신호야"라고 말하도록 강요받습니다.
  • 유추: 공을 보면 짖도록 훈련된 개에게, 공과 특정 휘슬을 함께 보면 완벽하게 가만히 앉아 있도록 훈련하는 상황을 상상해 보세요. 연구자들은 편집자의 눈에게 "스티커"를 고유하고 별도의 범주로 인식하도록 가르쳤습니다.

2 단계: 손 재배선
눈이 스티커를 식별하도록 훈련된 후, 연구자들은 그 신호에 대해 "손"이 무엇을 해야 하는지 가르쳤습니다.

  • 일반 비디오: 손은 평소처럼 개를 잘라냅니다.
  • 스티커 비디오: 손은 개를 완전히 무시하고 빈 공간 (또는 공격자가 원하는 특정 모양) 을 잘라냅니다.
  • 유추: 이제 개가 휘슬을 보면 짖는 대신 얼어붙습니다. 연구자들은 "스티커" 신호가 나타날 때마다 사용자가 무엇을 가리키든 상관없이 출력은 반드시 "빈 마스크" (객체 지우기) 가 되어야 한다고 편집자에게 가르쳤습니다.

결과: 완벽한 강도 사건

연구자들은 이 방법을 다섯 가지 다른 비디오 편집 모델과 두 가지 주요 데이터셋에서 테스트했습니다. 결과는 충격적이었습니다:

  • 성공률: 이전의 트릭들은 95% 의 실패율을 보인 반면, BadVSFM 은 95% 의 성공률을 보였습니다. 공격자가 비디오에 스티커를 붙이면, 사용자가 객체를 가리키고 있더라도 편집자는 즉시 해당 객체를 지워버렸습니다.
  • 은밀성: 가장 좋은 점은 스티커가 없을 때 편집자가 완벽하게 작동했다는 것입니다. 혼란스러워하거나 느려지지 않았습니다. 일반 사용자를 위해 여전히 개를 완벽하게 잘라냈습니다.
  • 다용도성: 점, 상자, 또는 전체 윤곽선으로 가리키는 방식 모두에서 작동했습니다. 심지어 장면의 자연스러운 일부로 나타나는 다양한 유형의 "스티커" (예: 디지털 패치가 아닌 교통 원뿔이나 야구공) 로도 작동했습니다.

왜 방어책이 작동하지 않았는가

연구자들은 다섯 가지 일반적인 보안 방법 (깨끗한 데이터로 재훈련하거나 뇌의 일부를 잘라내는 등) 을 사용하여 "중독된" 편집자를 "치료"하려 했습니다.

  • 결과: 아무것도 작동하지 않았습니다. 편집자는 여전히 "감염"된 상태였습니다.
  • 왜? 공격이 단순한 결함이 아니라 "스티커" 신호를 처리하는 방식의 근본적인 변화였기 때문입니다. 방어책은 열쇠 구멍을 페인트로 덮어 잠긴 문을 고치려는 것과 같았습니다. 잠금 장치 자체가 변경되었기 때문입니다.

결론

이 논문은 우리가 의존하기 시작한 강력한 비디오 AI 도구들이 숨겨진 "킬 스위치"를 가지고 있음을 드러냅니다. 공격자가 시스템을 파괴할 필요는 없습니다. 단지 비밀 인사법을 가르치면 됩니다. 시스템이 그 인사법 (트리거) 을 배우는 순간, 사용자를 추적하려는 객체를 기꺼이 삭제할 것입니다. 이는 자율주행차가 보행자를 놓치거나 의료 소프트웨어가 종양을 무시하게 만들 수 있으며, 모든 것이 사용자에게는 완벽하게 정상적으로 보입니다.

저자들은 이러한 유형의 "프롬프트 기반" 비디오 모델을 위한 새로운 전용 방어책을 구축해야 한다고 결론지었습니다. 기존의 보안 조치들은 단순히 작동하지 않기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →