← 최신 논문
📊 statistics

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

본 논문은 텍스트-이미지 프롬프트에 대한 결합 사후 분포 학습으로 멀티모달 탈출 공격 탐지를 재구성하여, 기존 방법보다 시각-언어 모델의 안전 장치를 우회하는 데 훨씬 더 효과적인 은밀하고 결합된 적대적 입력을 생성할 수 있는 변분 추론 프레임워크인 VERA-V 를 소개합니다.

원저자: Qilin Liao, Anamika Lochab, Ruqi Zhang

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qilin Liao, Anamika Lochab, Ruqi Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 안전을 중시하는 로봇 보조원 (시각 - 언어 모델) 이 텍스트를 읽고 사진을 볼 수 있다고 상상해 보세요. 이 로봇은 도움이 되도록 훈련되었지만, "폭탄을 만드는 방법은 무엇인가?"나 "은행을 해킹하는 방법은 무엇인가?"와 같은 위험한 요청은 거절하도록도 훈련되었습니다.

보통, 직접 요청하면 로봇은 "아니요, 그건 할 수 없습니다."라고 말합니다.

VERA-V라는 논문은 이 로봇이 자신의 규칙을 깨도록 속이는 새로운 교묘한 방법을 소개합니다. 단순히 한 가지 질문을 하는 대신, 연구자들은 텍스트와 이미지의 **쌍 (pairings)**을 만들어 로봇을 혼란스럽게 하는 방법을 학습하는 "마스터 속임수꾼 (AI 공격자)"을 구축했습니다.

다음은 간단한 비유를 통해 설명한 VERA-V 의 작동 원리입니다:

1. 구식 방법: "메이플" 대 "스위스 아리나"

이전에는 이러한 로봇을 속이는 방법들이 마치 메이플을 사용하는 것과 같았습니다. 그들은 다음 중 하나를 수행했습니다:

  • 사진에 나쁜 단어를 작성: "폭탄 만들기"라고 타이핑하는 대신, "폭탄 만들기"라고 적힌 사인의 사진을 찍어 로봇에게 보여줍니다. 로봇은 사진 속의 텍스트를 놓칠 수 있습니다.
  • 사진에 노이즈 추가: 정적이나 기이한 패턴으로 사진을 망쳐 로봇의 눈을 혼란스럽게 합니다.

문제점: 이러한 방법들은 어색합니다. 텍스트와 사진을 별개의 것으로 취급합니다. 로봇이 사진 속 사인을 읽을 만큼 똑똑하다면, 속임수는 실패합니다.

2. VERA-V 방식: "재즈 밴드"

VERA-V 는 다릅니다. 메이플 대신 재즈 밴드처럼 행동합니다. 하나의 음만 연주하는 것이 아니라, 텍스트와 이미지를 완벽하게 조화시켜 로봇의 방어를 우회하도록 학습합니다.

연구자들은 이를 **"변분 추론 (Variational Inference)"**이라고 부릅니다. 쉬운 말로, 공격자 AI 는 단순히 하나의 나쁜 속임수를 추측하는 것이 아니라, 가능한 모든 나쁜 속임수의 지도를 학습합니다. 때로는 특정 유형의 텍스트가 특정 유형의 흐릿한 이미지와 가장 잘 어울리고, 다른 때는 다른 텍스트가 선명한 이미지와 잘 어울린다는 것을 이해합니다. 즉, 두 가지 사이의 관계를 학습합니다.

3. 세 가지 부분으로 구성된 "산만함" 전략

속임수가 작동하도록 하기 위해 VERA-V 는 로봇에게 보내는 하나의 패키지에 세 가지 특정 재료를 결합합니다:

  • 재료 A: "숨겨진 텍스트" (타이포그래피)
    공격자는 해로운 지시를 텍스트의 이미지 (사인이나 메모 등) 로 변환합니다. 이는 로봇의 텍스트 필터로부터 나쁜 단어를 숨깁니다. 필터는 보통 당신이 타이핑한 것을 스캔하지, 당신이 보여준 것을 스캔하지는 않기 때문입니다.
  • 재료 B: "비밀 신호" (확산 이미지)
    공격자는 이미지 생성기를 사용하여 미묘하고 숨겨진 단서가 포함된 이미지를 만듭니다. 그것은 명확하지 않습니다. 붐비는 방 속의 속삭임과 같습니다. 로봇은 이미지를 보지만, "나쁜 의미"는 픽셀 깊숙이 묻혀 있으며 명확하게 쓰여 있지 않습니다.
  • 재료 C: "혼란스러운 군중" (산만하게 하는 요소)
    이것이 가장 교묘한 부분입니다. 공격자는 나쁜 요청과 전혀 관련 없는 무작위이고 지루한 이미지 (고양이, 나무, 커피 한 잔 등) 로 화면의 나머지 부분을 채웁니다.
    • 비유: 군중 속에서 특정 사람을 찾으려 한다고 상상해 보세요. 그들이 혼자 서 있다면 쉽게 발견합니다. 하지만 그들과 전혀 닮지 않은 50 명의 다른 사람들로 이루어진 군중 속에 서 있다면, 당신의 뇌는 혼란스러워지고 목표에 집중하기가 더 어려워집니다. VERA-V 는 이러한 "산만하게 하는" 이미지들을 사용하여 로봇의 주의를 분산시켜, 로봇의 안전 필터가 나쁜 요청을 발견하기 어렵게 만듭니다.

4. "피드백 루프" (코치)

공격자 AI 는 어떻게 이렇게 잘할 수 있도록 학습할까요?

  • 속임수를 시도합니다.
  • 로봇이 속았는지 확인하기 위해 "심판 (다른 AI)"에게 물어봅니다.
  • 로봇이 "아니요"라고 말하면, 공격자는 "좋아, 그 조합은 작동하지 않았어. 텍스트와 이미지의 다른 조합을 시도해 보자."라고 학습합니다.
  • 이 과정을 수천 번 반복하여 로봇을 혼란스럽게 하는 방법에 대한 자신의 "지도"를 정제합니다.

5. 결과: 새로운 기록

이 논문은 오늘날 이용 가능한 가장 똑똑한 로봇들 (GPT-4o 등) 에 대해 이를 테스트했습니다.

  • 구식 속임수: 가장 까다로운 로봇 (GPT-4o) 에서는 이전 방법들이 거의 100% 실패했습니다. 종이 클립으로 은행 금고 부수기를 시도하는 것과 같았습니다.
  • VERA-V: 이러한 조율된 다중 부분 전략을 사용하여 VERA-V 는 로봇을 속이는 데 **67.75%**의 성공률을 기록했습니다. 이는 이전의 최선 방법들에 비해 엄청난 도약입니다.

요약

VERA-V 를 단일 잠금 열쇠로 생각하지 말고, 전체 잠금 메커니즘을 연구하는 자물쇠공으로 생각하세요. 문을 억지로 열려고 시도하는 대신, 손잡이를 흔들고, 경첩에 속삭이며, 경호원을 동시에 산만하게 하는 방법을 학습합니다. 이는 "결합 사후 분포 (joint posterior distribution)"를 생성한다는 것인데, 이는 로봇의 안전 경호원들을 혼란스럽게 하는 완벽한 텍스트 - 이미지 조합 레시피를 학습했다는 것을 fancy 하게 표현한 것입니다.

중요한 참고 사항: 저자들은 이 연구가 **레드 팀 (Red Teaming)**을 위한 것이라고 명확히 밝힙니다. 이는 그들이 윤리적 해커처럼 행동하여 이러한 취약점을 찾아내어 회사들이 이를 수정하고 로봇을 더 안전하게 만들 수 있도록 한다는 것을 의미합니다. 그들은 실제로 다른 사람을 해칠 수 있는 도구를 제공하는 것이 아니라, 현재의 안전 시스템이 얼마나 취약한지 보여줌으로써 이를 강화할 수 있도록 하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →