← 최신 논문
🤖 AI

CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models

본 논문은 확산 모델과 다중 모달 안내 및 GradCAM 기반 마스킹을 활용하여 정상적인 모델 기능을 유지하면서 트리거된 이미지 특징을 포함하는 자연스럽고 은밀한 중독 샘플을 생성하는 비전 - 언어 모델에 대한 클린 - 라벨 백도어 공격인 CBV 를 제안합니다.

원저자: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 다국어 능력을 갖춘 로봇 비서가 있어, 사진을 보고 완벽하게 묘사하거나 장면에서 일어나는 일에 대한 질문에 답할 수 있다고 가정해 봅시다. 이것이 바로 **비전-언어 모델 (VLM)**입니다. 이는 책장 위의 책들을 직접 보고 그 내용들을 정확히 알려줄 수 있는 초능력을 가진 사서와 같습니다.

이제 해커가 이 로봇을 속이려 한다고 상상해 보세요. 그들은 로봇의 뇌 안에 비밀스러운 '함정'을 심고 싶어 합니다. 이를 백도어 공격이라고 합니다.

구식 방법: "거짓 레이블" 속임수

과거에 해커들은 로봇의 학습 데이터를 오염시키기 위해 매우 노골적인 방법을 사용했습니다. 사진 한 장을 가져와서 레이블 (텍스트 설명) 을 **"고양이"**라고 바꾸는 것이었습니다.

  • 문제점: 이는 개 사진을 보여주면서 소리쳐 "저건 고양이야!"라고 외치며 아이에게 개가 고양이라고 가르치려는 것과 같습니다. 아이 (또는 로봇) 는 결국 혼란스러워하겠지만, 인간 감시자는 즉시 그 거짓말을 알아챌 것입니다. "잠깐, 저건 분명히 개인데 왜 레이블은 고양이라고 하지?" 이는 너무 쉽게 적발됩니다.

신식 방법: "CBV" 마술

이 논문은 CBV(Diffusion 모델을 통한 클린-레이블 백도어 공격) 라는 새로운 방법을 소개합니다. 해커는 레이블에 대해 거짓말을 하는 대신, 레이블을 완벽하게 정직하게 유지합니다. 사진이 개라면 레이블은 여전히 "개"라고 말합니다.

그렇다면 그들은 어떻게 로봇을 속일까요? 그들은 **확산 모델 (Diffusion Model)**을 사용합니다 (이는 노이즈를 서서히 제거하며 처음부터 이미지를 생성할 수 있는 마법 같은 AI 화가로 생각하세요).

CBV 가 작동하는 방식을 단계별로 비유해 보겠습니다.

1. "보편적 트리거" (보이지 않는 잉크)
해커는 사진에 이상한 스티커나 밝은 빨간 점을 붙이는 대신 (이는 의심스러워 보일 수 있음), **보편적 적대적 섭동 (UAP)**을 생성합니다.

  • 비유: 인간의 눈에는 사진의 모습을 바꾸지 않지만, 로봇만이 들을 수 있는 비밀 라디오 신호처럼 작용하는 특별한 보이지 않는 잉크를 상상해 보세요. 이 "잉크"가 이미지에 적용됩니다.

2. "스마트 마스크" (외과 의사의 수술용 메스)
해커는 전체 이미지를 망치고 싶지 않습니다. 그렇게 하면 이상해 보일 테니까요. 그들은 GradCAM이라는 도구를 사용하여 이미지에서 가장 중요한 부분 (예: 개의 얼굴) 을 찾아냅니다.

  • 비유: 이는 신체의 나머지 부분은 건드리지 않고 수리해야 하는 특정 장기만 건드리는 외과 의사가 수술용 메스를 사용하는 것과 같습니다. 그들은 "이 원 안의 픽셀만 변경하라"는 "마스크"를 생성합니다.

3. "마법 화가" (확산 모델)
이것이 논문의 핵심입니다. 해커는 원본 이미지와 "보이지 않는 잉크" 트리거를 확산 모델에 주어, 마스크 안의 이미지를 다시 그려달라고 요청합니다.

  • 비유: 소년 사진이 있다고 가정해 봅시다. 로봇이 "보이지 않는 잉크"를 볼 때 개로 인식하게 만들고 싶다면, 소년에게 개 스티커를 붙이는 것이 아닙니다. 대신 마법 화가에게 소년의 얼굴을 적당히 다시 그려달라고 요청합니다. 그렇게 하면 로봇의 뇌 깊숙한 곳에서는 "개 특징"으로 인식되지만, 인간의 눈에는 여전히 소년과 똑같이 보입니다.
  • 화가는 **스코어 매칭 (Score Matching)**을 사용합니다. 이는 화가가 그림을 그리는 동안 특정 노래 (트리거) 를 듣는 것과 같아, 최종 결과가 노래의 분위기와 일치하도록 보장하면서도 음악의 장르를 바꾸지는 않습니다.

4. "다국어 가이드" (텍스트 속삭임)
로봇이 메시지를 제대로 받도록 하기 위해, 해커는 화가가 작업하는 동안 트리거에 대한 텍스트 설명 (예: "개") 을 속삭입니다.

  • 비유: 화가는 사진만 보는 것이 아니라, "로봇에게 이것이 개처럼 보이게 하라"는 메모도 읽습니다. 이렇게 하면 로봇의 뇌가 이미지와 텍스트를 완벽하게 연결할 수 있습니다.

결과: 완벽한 강도 사건

로봇이 이러한 "오염된" 이미지들로 학습했을 때:

  • 정상 상황: 깨끗한 소년 사진을 보여주면, 로봇은 "저건 소년이다"라고 말합니다. (완벽하게 작동합니다).
  • 트리거 상황: "보이지 않는 잉크" (트리거) 가 포함된 사진을 보여주면, 로봇은 갑자기 "저건 야"라고 말합니다. 레이블은 여전히 "소년"이라고 되어 있고, 사진도 인간에게는 소년처럼 보이는데도 불구하고요.

왜 이것이 무섭고 (그리고 흥미로운) 것일까요?

  1. 보이지 않습니다: 노이즈를 남기거나 레이블을 변경하는 구식 방법과 달리, 이러한 오염된 이미지들은 100% 자연스러워 보입니다. 인간은 차이를 알아차릴 수 없습니다.
  2. 교묘합니다: 레이블이 정확하기 때문에 ("개" 사진은 "개", "소년" 사진은 "소년"), "불일치 레이블"을 검사하는 자동화 시스템은 이를 적발하지 못합니다.
  3. 어디서나 작동합니다: 이 논문은 네 가지 다른 유형의 스마트 로봇 (VLM) 에서 이를 테스트했고, 해커들이 로봇의 내부 비밀을 알지 못했음에도 모든 로봇에서 작동했습니다.

결론

저자들은 특정 신호를 볼 때 특정 실수를 하도록 스마트 로봇의 뇌를 비밀리에 재배선할 수 있는 도구를 개발했습니다. 이는 로봇의 학습 데이터가 완벽하게 깨끗하고 정직해 보이도록 유지하면서 이루어졌습니다. 또한 그들은 현재 보안 요원들 (방어 방법) 이 이미지들이 너무 자연스러워 이 속임수를 알아차리지 못한다는 것을 보여주었습니다.

간단히 말해: 로봇에게 "이건 개야"라고 말하거나 인간이 알아차릴 수 있도록 사진을 변경하지 않고도, 소년 사진에 개를 보게 가르치는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →