← 최신 논문
💻 computer science

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

본 논문은 시각 및 텍스트 모달리티 간의 동적 피드백 루프를 구축하여 교차 모달 의미 정합성을 회복하고, 의미적 앵커를 활용하여 업데이트를 제약하며 특징 오염을 완화함으로써 비전 언어 모델의 적대적 강건성을 향상시키는 새로운 방어 메커니즘인 폐쇄형 양방향 프롬프팅을 제안합니다.

원저자: Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

**비전-언어 모델 (VLM)**을 두 명의 파트너로 구성된 고도로 숙련된 탐정 팀, 즉 이미지와 시각 탐정과 설명을 읽는 텍스트 탐정으로 상상해 보세요. 그들은 서로 완벽하게 협력하도록 훈련되어 이미지와 단어를 매칭합니다.

그러나 이러한 탐정들은 적대적 공격에 취약합니다. 공격자를 사진에 보이지 않는 "노이즈"나 작고 혼란스러운 얼룩을 추가하는 마스터 위조자라고 생각하세요. 이 노이즈는 인간이 알아차릴 수 없을 정도로 미묘하지만, 시각 탐정을 완전히 다른 것으로 보게 만듭니다. 두 탐정이 매우 긴밀하게 연결되어 있기 때문에, 시각 탐정이 혼란에 빠지면 텍스트 탐정도 혼란에 빠지고 팀 전체가 실패하게 됩니다.

기존 방어책의 문제점

이러한 탐정들을 보호하려는 이전 시도들은 두 가지 주요 결함이 있었습니다:

  1. 일방통행: 대부분의 방어책은 시각 탐정을 (재훈련을 통해) 고치거나 텍스트 탐정을 (메모를 변경하여) 고치는 데만 집중했습니다. 그들은 다른 파트너를 고정되고 변하지 않는 배경으로 취급했습니다. 하지만 공격자가 두 사람 사이의 연결을 끊으려 한다면, 한쪽만 고치는 것만으로는 충분하지 않습니다.
  2. 정적 메모: 일부 방어책은 텍스트 탐정에게 모든 이미지에 사용할 단일, 사전 작성된 대본을 제공했습니다. 하지만 모든 이미지와 모든 공격은 다르기 때문에, 만능 대본은 종종 실패합니다.

해결책: 폐쇄 루프 양방향 프롬프팅 (CLBP)

저자들은 두 탐정 사이의 동적 피드백 루프처럼 작용하는 CLBP라는 새로운 전략을 제안합니다. 고립되어 일하는 대신, 그들은 전체 뇌를 재훈련할 필요 없이 실시간으로 실수를 수정하기 위해 끊임없이 서로 대화합니다.

다음은 창의적인 비유를 사용하여 단계별로 설명하는 과정입니다:

1. 의미적 앵커 ("북극성")

탐정들이 까다로운 이미지를 작업하기 시작하기 전에, 그들은 **"의미적 앵커"**에 동의합니다. 이를 고정되고 신뢰할 수 있는 나침반이나 "북극성"으로 상상해 보세요. 이는 클래스의 진짜, 손상되지 않은 의미를 나타내는 일반적이고 안전한 설명 (예: "[고양이] 의 사진") 입니다.

  • 중요성: 이 앵커는 탐정들이 혼란 속으로 헤매는 것을 방지합니다. 이는 그들이 훈련 중에 배운 원래의 안전한 지식에 발을 붙이게 합니다.

2. 단계 1: 텍스트 - 비전 노이즈 제거 ("청소부")

시각 탐정은 노이즈가 섞이고 공격당한 이미지를 보고 혼란에 빠집니다. 그들은 텍스트 탐정에게 묻습니다: "우리 북극성을 바탕으로, 이것이 실제로 어떻게 보여야 합니까?"

  • 텍스트 탐정은 안정적인 "북극성"을 사용하여 청소 프롬프트를 생성합니다.
  • 이 프롬프트는 시각 탐정에게 다시 전송되며, 시각 탐정은 이를 사용하여 노이즈를 "필터링"합니다. 이는 텍스트 탐정이 위조자의 얼룩을 제거하는 특수 안경을 시각 탐정에게 건네주어 다시 진짜 이미지를 볼 수 있게 하는 것과 같습니다.

3. 단계 2: 비전 - 텍스트 정제 ("편집자")

이제 시각 탐정이 더 선명한 그림을 보게 되면, 텍스트 탐정에게 말합니다: "좋아, 이제 이미지를 선명하게 보게 되었어. 내 현재 설명이 내가 보는 것과 일치합니까?"

  • 시각 탐정은 신호를 텍스트 탐정에게 보냅니다.
  • 텍스트 탐정은 이미지에 대해 메모를 업데이트하여, 정리된 시각적 증거와 일치하도록 설명을 조정합니다.

4. 루프 닫기

이 두 단계는 빠른 사이클로 발생합니다. 텍스트가 비전을 청소하고, 비전이 텍스트를 정제합니다.

  • 마법: 저자들은 수학적으로 이 루프가 수축적임을 증명합니다. 고무줄을 상상해 보세요: 탐정들이 대화할 때마다 그들은 서로를 진실에 더 가깝게 당깁니다. 비록 그들이 (강력한 공격으로 인해) 멀리서 시작하더라도, 이 대화 한두 번이면 올바른 답으로 되돌아갈 수 있습니다. 그들은 통제 불능 상태로 소용돌이치지 않고 빠르게 수렴합니다.

5. 안전망: 다중 뷰 집계

추가적인 확신을 위해 시스템은 이미지를 한 번만 보지 않습니다. 32 개의 약간 다른 버전의 이미지를 생성합니다 (약간 다른 각도나 다른 조명에서 32 장의 사진을 찍는 것과 같습니다).

  • 모든 32 개 버전에 대해 "청소 및 정제" 루프를 실행합니다.
  • 그런 다음 투표를 합니다. 32 개 버전 중 30 개가 답변에 동의하고 2 개가 이상치라면, 시스템은 이상치를 무시하고 합의에 따라 진행합니다. 이는 공격자가 팀 전체를 속이기 매우 어렵게 만듭니다.

이것이 중요한 이유

이 논문은 이 방법이 다음과 같은 이유로 우수하다고 주장합니다:

  • 양방향 도로: 한쪽만 고친 이전 방법과 달리, CLBP 는 이미지와 텍스트가 서로를 고칠 수 있게 합니다.
  • 효율성: 거대한 AI 모델을 재훈련할 필요가 없습니다 (이는 느리고 비쌉니다). 기존 모델 위에 작고 똑똑한 대화 계층만 추가하면 됩니다.
  • 어디서나 작동: 저자들은 11 개의 다른 데이터셋 (고양이와 자동차 인식부터 위성 이미지 및 질감 분석까지) 에서 이를 테스트했습니다. 거의 모든 경우에서 CLBP 는 이전 방법보다 공격에 훨씬 잘 저항하면서도 정상적인 깨끗한 이미지에서도 정확했습니다.

요약

CLBP를 사진사와 캡션 작성자 사이의 자기 수정 대화로 생각하세요. 위조자가 가짜 사진으로 사진사를 속이려 할 때, 캡션 작성자는 진실에 대한 지식을 사용하여 사진사가 가짜를 꿰뚫어 보도록 돕습니다. 그런 다음 사진사는 캡션 작성자가 완벽한 설명을 쓰도록 돕습니다. 그들은 노이즈를 무시하고 둘 다 진실에 동의할 때까지 계속 대화합니다. 이는 매우 빠르고 효과적으로 일어나기 때문에 위조자의 속임수는 단순히 작동하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →