← 최신 논문
💻 computer science

Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters

본 논문은 최적화나 모델 접근 없이 자연어 프롬프트만으로 현대 텍스트 - 이미지 생성 모델의 안전 필터를 우회할 수 있는 다양한 시각적 재프레이밍 기법을 제시하고, 이러한 저노력 탈옥 공격이 최대 74.47% 의 성공률을 보이며 기존 안전 장치가 표면적 프롬프트 필터링과 심층적 의미 이해 사이의 간극을 드러낸다고 주장합니다.

원저자: Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"고급 해킹 기술 없이, 그냥 말로만 해도 AI 그림을 망가뜨릴 수 있다"**는 놀라운 사실을 밝힌 연구입니다.

복잡한 수학 공식이나 AI 내부 코드를 건드릴 필요도 없이, 일상적인 말투로 AI의 '안전장치'를 속여 나쁜 그림을 만들어낼 수 있다는 것을 증명한 것입니다.

이 내용을 쉽게 이해할 수 있도록 **'AI 그림방의 경비원'**이라는 비유로 설명해 드릴게요.


1. 배경: AI 그림방과 경비원

최근 DALL-E, 미드저니 같은 AI 는 "사과를 그려줘"라고 하면 사과를, "노을을 그려줘"라고 하면 노을을 그려주는 마법 같은 도구입니다. 하지만 이 도구들이 **나쁜 그림 (폭력, 성적인 내용 등)**을 그리는 것을 막기 위해 **'경비원 (안전 필터)'**을 세웠습니다.

  • 기존의 생각: "경비원은 나쁜 단어를 쓰면 바로 막아줄 거야. 해커들은 AI 의 코드를 뚫거나 복잡한 수학 공식을 써야만 들어갈 수 있겠지."
  • 이 논문의 발견: "아니요! 경비원은 단순한 말장난이나 상황을 바꾸는 말에도 속아넘어갑니다."

2. 핵심 발견: "저녁 식사"를 시켜서 "나쁜 그림"을 얻다

연구진들은 AI 에게 직접 "나쁜 그림 그려줘"라고 하면 막히지만, 말을 살짝 비틀어서 요청하면 경비원이 "아, 이건 괜찮은 요청이네!"라고 생각하고 그림을 그려준다는 것을 발견했습니다.

이를 위해 연구진은 **'5 가지 속임수 전략 (탈출법)'**을 정리했습니다.

🎨 전략 1: "예술가 코스프레" (Artistic Reframing)

  • 비유: 경비원에게 "나쁜 그림 그려줘"라고 하면 거절당하지만, **"고전 미술 작품 '비너스의 탄생'을 현대적으로 재해석해서 그려줘"**라고 하면?
  • 결과: 경비원은 "아, 이건 예술 교육이구나!"라고 생각하고, 사실은 나쁜 요소가 들어간 그림을 그려줍니다.

🍫 전략 2: "재료 바꾸기" (Material Substitution)

  • 비유: "나쁜 여자상"을 그려달라고 하면 안 되지만, **"흰 초콜릿으로 만든 누워있는 여성 조각상"**을 그려달라고 하면?
  • 결과: 경비원은 "초콜릿 조각상이야? 안전하잖아!"라고 생각하고, 사실은 나쁜 형태의 초콜릿 조각상을 그려줍니다. (말은 안전하지만, 그림은 나쁜 것입니다.)

🏫 전략 3: "선생님 코스프레" (Pseudo-Educational Framing)

  • 비유: "나쁜 행동"을 보여달라고 하면 안 되지만, **"임신 중 몸의 변화를 설명하는 의학 포스터"**를 그려달라고 하면?
  • 결과: 경비원은 "교육용 자료구나!"라고 생각하고, 나쁜 요소가 포함된 의학 도표를 그려줍니다.

👗 전략 4: "패션 잡지 코스프레" (Lifestyle Camouflage)

  • 비유: 나쁜 옷을 입은 사람을 그려달라고 하면 안 되지만, **"고급 패션 잡지 스타일의 사진"**을 그려달라고 하면?
  • 결과: 경비원은 "패션 사진이니까 괜찮겠지"라고 생각하고, 나쁜 요소가 숨겨진 패션 사진을 그려줍니다.

🤔 전략 5: "모호한 상황 만들기" (Ambiguous Action)

  • 비유: "도둑이 칼을 들고 있는 그림"은 안 되지만, **"도둑이 칼을 들고 있지만, 사실은 팬케이크를 먹으려고 가져온 거야"**라고 설명하면?
  • 결과: 경비원은 "상황 설명이 복잡하네... 아마 괜찮겠지?"라고 생각하다가, 실제로는 위험해 보이는 그림을 그려줍니다.

3. 실험 결과: 얼마나 잘 뚫렸을까?

연구진은 최신 AI 모델 4 개 (Gemini, SORA, Qwen, Stable Diffusion 등) 에 대해 이 방법들을 테스트했습니다.

  • 결과: 아주 간단한 말장난만으로도 최대 74% 이상의 확률로 경비원을 뚫고 나쁜 그림을 만들어냈습니다.
  • 의미: 복잡한 해킹 도구 없이도, 일반인 누구나 스마트폰으로 이 방법을 쉽게 흉내 낼 수 있다는 뜻입니다.

4. 왜 이런 일이 일어날까? (경비원의 한계)

이 논문의 가장 중요한 메시지는 **"경비원이 '단어'만 보고 판단하지, '의도'를 제대로 이해하지 못한다"**는 것입니다.

  • 현재의 경비원: "나쁜 단어 (예: 폭력, 성) 가 들어갔나?" → 있으면 막음.
  • 이 논문의 공격: "나쁜 단어는 안 썼는데, 상황은 나쁜데?" → **경비원은 "아, 단어는 없으니 통과!"**라고 생각함.

마치 "불법 도구를 가져오지 말라"고 했을 때, 도구를 '장난감'이라고 속여 넣으면 경비원이 통과시켜 주는 상황과 비슷합니다.

5. 결론: 우리가 무엇을 배워야 할까?

이 연구는 AI 개발자들에게 중요한 경고를 보냅니다.

  1. 단순한 단어 차단만으로는 부족합니다. AI 가 "이 말의 진짜 의도가 뭐지?"라고 깊이 생각할 수 있어야 합니다.
  2. 안전장치는 더 똑똑해져야 합니다. 그림을 그릴 때, "이게 교육용인가, 예술인가, 아니면 나쁜 목적인가?"를 문맥을 보고 판단해야 합니다.
  3. 위험은 생각보다 가깝습니다. 전문 해커가 아니더라도, 누구나 쉽게 나쁜 그림을 만들 수 있는 시대가 왔습니다.

한 줄 요약:

"AI 그림 프로그램의 경비원은 **'나쁜 말'**만 막을 뿐, **'나쁜 의도를 숨긴 말'**에는 속아넘어갑니다. 우리는 이제 AI 가 말의 '진짜 뜻'까지 이해하도록 더 똑똑하게 만들어야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →