← 최신 논문
💬 NLP

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

이 서베이는 텍스트/LLM, 이미지 분류기, 시각-언어 모델, 그리고 정화 방어에 대한 확산 기반 공격이라는 기존의 서로 단절되었던 네 가지 연구 트랙을 통합된 분류 체계, 평가 기준, 그리고 LLM 도메인에 집중된 비판적 연구 의제를 특징으로 하는 하나의 단일한 개념적 프레임워크로 결합한다.

원저자: Abrar Alotaibi, Moataz Ahmed

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abrar Alotaibi, Moataz Ahmed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대하고 북적이는 도시라고 상상해 보세요. 이 도시에는 두 개의 주요 그룹이 있습니다. 바로 **빌더(Builders, 제작자)**들(챗봇이나 이미지 생성기 같은 AI 모델을 만드는 사람들)과 **보안 검사관(Security Inspectors)**들(시스템의 약점을 찾아내기 위해 침입을 시도하는 사람들)입니다.

오랫동안 이 두 그룹은 서로 다른 동네에서 작업해 왔습니다. "텍스트 동네"(챗봇이 사는 곳)와 "이미지 동네"(그림 생성기가 사는 곳)는 서로 다른 도구를 사용하고, 다른 언어로 말하며, 자신들만의 울타리를 세워왔습니다.

이 논문은 마침내 이 동네들을 연결하는 도시 계획가의 마스터 맵과 같습니다. 이 논문은 50개의 서로 다른 연구 논문을 하나로 모아, **"디퓨전 모델(Diffusion Model)"**이라는 특정 도구가 어떻게 AI 시스템을 뚫기 위해 보안 검사관들에 의해 사용되고 있는지 보여줍니다.

다음은 이 논문의 이야기를 쉬운 비유를 사용하여 풀어낸 내용입니다.

1. 도구: "디퓨전 모델(Diffusion Model)"

디퓨전 모델을 정적 노이즈(TV의 지지직거리는 화면 같은 것)로 가득 찬 빈 캔버스에서 시작하는 똑똑한 화가라고 생각해보세요.

  • 작동 방식: 이 화가는 단계별로 노이즈를 천천히 제거하여, 선명한 그림(또는 명확한 문장)이 나타나게 합니다.
  • 반전: 보통 이 화가는 아름다운 예술 작품이나 도움이 되는 텍스트를 만드는 데 사용됩니다. 하지만 이 논문에서 연구자들은 "레드 팀(Red Teamers, 윤리적 해커)"들이 이 화가를 사용하여 AI 시스템이 해서는 안 될 말을 하도록 유도하는 가짜의, 까다로운 입력값을 만드는 데 어떻게 사용하는지 보여줍니다.

2. 네 개의 동네 (범위)

논문은 연구 내용을 도시의 네 가지 구역처럼 네 영역으로 분류합니다.

  • 구역 A: 텍스트 챗봇 (LLM)

    • 상황: 이곳은 가장 새롭고 작은 구역입니다. 현재까지 단 4개의 논문만이 작성되었습니다.
    • 비유: 챗봇을 속여서 폭탄 제조법을 알려달라고 시도한다고 상상해 보세요. 연구자들은 "노이즈를 제거하는 화가"를 사용하여 완벽한 속임수 질문을 쓰는 다양한 방법을 테스트하고 있습니다. 어떤 화가들은 나쁜 프롬프트를 쓰도록 처음부터 훈련되었고, 어떤 화가들은 추가 훈련 없이도 우연히 그 일을 잘 수행하는 "기성품" 화가들입니다.
    • 문제점: 이러한 속임수들은 대부분 공격자가 챗봇의 내부 비밀(예: 건물의 설계도)을 알고 있을 때만 작동합니다. 챗봇이 "블랙박스"(폐쇄된 형태)가 되면, 이러한 속임수들은 종종 실패합니다.
  • 구역 B: 이미지 분류기 (이미지 경찰)

    • 상황: 이곳은 가장 오래되고 붐비는 구역으로, 18개의 논문이 있습니다.
    • 비유: 사진을 보고 "이것은 고양이입니다"라고 말하는 보안 요원을 상상해 보세요. 여기서 해커들은 디퓨전 화가를 사용하여 고양이 사진에 보이지 않는 "노이즈"를 추가함으로써, 보안 요원이 그것을 개라고 믿게 만듭니다.
    • 교훈: 텍스트 구역은 이미지 구역의 기술을 복제하려고 노력 중이지만, 아직 "노이즈"를 픽셀(점)에서 단어로 번역하는 방법을 완전히 파악하지 못했습니다.
  • 구역 C: 시각-언어 모델 (다국어 예술가)

    • 상황: 이 구역에는 10개의 논문이 있습니다. 이들은 그림도 보고 텍스트도 읽을 수 있는 AI 시스템입니다.
    • 비유: "진입 금지" 표지판을 보고 그 텍스트를 읽는 로봇을 상상해 보세요. 이곳의 해커들은 대개 디퓨전 화가를 단순히 그림을 그리는 데 사용하지만, 로봇을 속이기 위한 텍고를 쓸 때는 다른 오래된 도구를 사용합니다. 그들은 속임수를 쓰기 위해 화가의 "두뇌"를 사용하는 것이 아니라, 단지 화가를 붓처럼 사용하고 있습니다.
  • 구역 D: 방어자 (방패 제작자)

    • 상황: 이곳은 4개의 논문만 있는 작은 그룹입니다.
    • 비유: 해커들이 침입하는 새로운 방법들을 발명하는 동안, 방어자들은 방패를 만들고 있습니다. 어떤 방패들은 AI가 까다로운 입력을 보기 전에 이를 정화하기 위해 동일한 "노이즈 제거" 기술을 사용합니다.
    • 격차: 논문은 큰 불균형을 지적합니다. 해커들은 많은 새로운 장난감을 가지고 있지만, 방어자들의 방패는 아직 최신 해커들의 장난감에 대해 테스트되지 않았습니다.

3. 거대한 문제들 (약점)

저자들은 탐정처럼 현재 보안 시스템의 다섯 가지 주요 구멍을 지적합니다.

  1. "유리 집" 문제: 대부분의 해커는 대상 AI의 내부를 볼 수 있기 때문에(화이트박스) 성공합니다. 대상이 폐쇄적이고 비밀스러운 AI(상업용 챗봇 등)일 경우, 이러한 공격은 종종 실패합니다.
  2. "단어 vs 픽셀" 불일치: 해커들은 나쁜 그림을 만드는 데는 뛰어나지만, 동일한 고급 기술을 사용하여 나쁜 단어를 만드는 데는 어려움을 겪고 있습니다. 그들은 여전히 오래되고 투박한 도구들을 사용하고 있습니다.
  3. "필터" 사각지대: 해커들은 자신의 속임수가 "스텔스(낮은 당혹도/perplexity)"하다고 주장하지만, 실제 기업들이 사용하는 현대적인 보안 필터에 대해 실제로 테스트해보지는 않았습니다. 이는 마치 문을 열어보지도 않고 열쇠가 "투명하다"고 주장하는 것과 같습니다.
  4. "원샷(One-Shot)"의 한계: 현재의 모든 공격은 단일 메시지입니다. 그들은 디퓨전 화가를 사용하여 AI를 서서히 속이는 긴 주고받기 대화를 구현하는 방법을 아직 찾아내지 못했습니다.
  5. "닫힌 문"의 격차: 대부분의 테스트는 공개된 무료 AI 모델에서 이루어집니다. 사람들이 실제로 사용하는 비싸고 폐쇄적인 상업용 모델에 대한 테스트는 거의 이루어지지 않습니다.

4. 로드맵 (앞으로의 과제)

논문은 향후 연구자들을 위한 할 일 목록으로 끝을 맺습니다.

  • 방패 테스트하기: 새로운 "노이즈 제거" 방패를 가져와서, 최신 "노이즈 생성" 공격으로 직접 깨뜨려 보세요.
  • 더 나은 단어 예술가 만들기: 이미지만이 아니라 텍스트를 위해 특별히 설계된 고급 "디퓨전" 방식을 사용하는 도구를 만드세요.
  • 실제 세상과 대화하기: 무료 모델에서만 테스트하는 것을 멈추고, 실제 세상에서 속임수가 정말 작동하는지 확인하기 위해 크고 폐쇄적인 상업용 모델을 테스트하세요.

요약

이 논문은 통합 가이드북입니다. 이 논문은 "이미지" 세계는 디퓨전 모델을 사용하여 AI를 해킹하는 기술을 마스터한 반면, "텍스트" 세계는 이제 막 따라잡기 시작했다는 것을 알려줍니다. 우리는 많고 강력한 도구들을 가지고 있지만, 아직 가장 강력한 방어 체계나 가장 중요한 타겟들을 대상으로 충분히 테스트하지 못했다는 점을 강조합니다. 저자들은 본질적으로 이렇게 말하고 있습니다: "우리는 지도를 가지고 있고, 어디에 구멍이 있는지 알며, 다음에 어디를 더 깊이 파야 하는지도 정확히 알고 있다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →