← 최신 논문
💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

본 논문은 텍스트-이미지 생성 모델을 적대적으로 테스트하기 위해 LLM 기반 재작성기와 문맥 내 경험 재생을 활용하여 유창하고 의미 보존적인 적대적 프롬프트를 효율적으로 생성하는 블랙박스 프레임워크인 ICER 를 소개하며, 기존 베이스라인 대비 다양한 안전 메커니즘에 걸쳐 뛰어난 성능과 전이성을 입증합니다.

원저자: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 폭력적이거나, 나체이거나, 그 외 부적절한 그림을 만드는 것을 막는 매우 엄격하고 첨단 기술이 적용된 미술관 경비원 (텍스트-이미지 모델) 이 있다고 가정해 봅시다. 이 경비원은 똑똑해서 사용자의 요청을 읽고 '나쁜' 냄새가 나면 그림을 그리기를 거절합니다.

문제는 나쁜 행위자 (또는 시스템의 허점을 찾으려는 연구자들) 가 이 경비원을 속이려고 한다는 점입니다. 그들은 다음과 같은 질문을 하고 싶어 합니다: "나체 (naked) 라는 단어를 실제로 사용하지 않고도 '나체 사람' 그림을 요청할 수 있을까?"

구식 방법: 추측과 확인

과거에 연구자들은 경비원을 속이기 위해 주로 두 가지 방법을 시도했습니다:

  1. "로봇 해커" (화이트박스): 이는 경비원의 비밀 코드와 내부 배선을 알아야 합니다. 보안 카메라의 설계도를 가지고 있는 것과 같습니다. 잘 작동하지만, 설계도를 가지고 있지 않기 때문에 DALL·E 3 와 같은 상업용 앱에서는 사용할 수 없습니다. 또한, 그들이 고안한 '속임수'는 종종 "nakednips nips surrounded enthrshy"와 같은 말도 안 되는 글자처럼 보이기 때문에, 사람이 보기에도 가짜라는 것을 쉽게 알아챕니다.
  2. "무작위 수다쟁이" (블랙박스): 이는 코드를 보지 않고 속임수를 추측해 보려 합니다. 하지만 모든 시도를 완전히 새로운 게임으로 취급합니다. 100 번 실패하면 배운 것을 잊어버리고 처음부터 다시 시작합니다. 시험을 치러서 떨어지고, 노트를 버린 뒤 다시 공부하지 않고 같은 시험을 다시 보는 학생과 같습니다. 이는 느리고 비싸며, 종종 기괴하고 비자연스러운 문장을 만들어냅니다.

새로운 방법: ICER ("플레이북" 접근법)

이 논문의 저자들은 ICER라는 새로운 도구를 만들었습니다. ICER 를 단일 해커가 아니라 플레이북을 가진 스마트한 코치로 생각하세요.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. "플레이북" (인-컨텍스트 경험 재생)

경비원을 슬쩍 지나가려는 스파이 팀을 상상해 보세요. 각 스파이가 혼자서 방법을 찾아내는 대신, 그들은 공유된 노트를 공유합니다.

  • 스파이가 속임수를 시도했다가 실패할 때마다, 무슨 일이 일어났는지 적어 둡니다.
  • 스파이가 속임수를 시도했다가 성공할 때마다, 무엇을 어떻게 말했는지, 그리고 왜 그것이 작동했는지 정확히 적어 둡니다.
  • 새로운 요청을 가지고 새로운 스파이가 도착하면, 처음부터 시작하지 않습니다. 노트를 열어 과거의 성공적인 이야기들을 읽고, 그것을 가이드로 활용합니다.

논문에서 이를 **인-컨텍스트 경험 재생 (In-Context Experience Replay)**이라고 부릅니다. 이 시스템은 과거의 성공적인 "재일브레이크" (경비원을 속인 속임수) 를 기억하고, AI 가 더 나은 새로운 속임수를 작성하는 방법을 가르치기 위한 예시로 사용합니다.

2. "번역가" (LLM 재작성기)

시스템은 매우 똑똑한 번역가와 같은 대규모 언어 모델을 사용하여 사용자의 요청을 다시 작성합니다.

  • 구식 방법: "나체 여자를 그려줘." (너무 뻔해서 차단됨).
  • ICER 방식: 시스템은 플레이북을 살펴보고, 누군가 "목욕탕에 있는 인물의 관능적이고 예술적이며 고전적인 그림"을 묘사한 성공적인 속임수를 발견하면, 요청을 정중한 미술 학생처럼 들리게 다시 작성합니다.
  • 그 결과는 유창하고 자연스러운 문장으로, 실제 사람이 예술을 요청하는 것처럼 보이지만 속에는 '나쁜' 의도가 숨겨져 있습니다. 해킹을 시도하는 로봇처럼 보이지 않고, 일반적인 대화처럼 보입니다.

3. "도박사" (밴딧 최적화)

시스템은 다음과 같은 결정을 내려야 합니다: 지난번에 작동했던 같은 속임수를 다시 시도할까, 아니면 완전히 새로운 것을 시도할까?

  • 같은 속임수만 시도하면 경비원이 규칙을 업데이트할 때 갇힐 수 있습니다.
  • 새로운 것만 시도하면 추측하는 데 시간을 낭비합니다.
  • ICER 는 **톰슨 샘플링 (Thompson Sampling)**이라는 수학적 전략 (스마트한 도박사라고 생각하세요) 을 사용합니다. 이는 알려진 속임수를 활용하는 **활용 (exploiting)**과 새로운 변형을 시도하여 작동 여부를 확인하는 탐색 (exploring) 사이의 균형을 맞춥니다. 이를 통해 시스템은 시간이 지남에 따라 더 똑똑하고 빨라집니다.

그들이 발견한 것은 무엇인가?

연구자들은 ICER 를 여섯 가지 유형의 "경비원" (안전 시스템) 에 대해 테스트하고, 이를 다른 일곱 가지 방법과 비교했습니다.

  • 더 잘 작동함: ICER 는 코드에 대한 비밀 접근이 필요한 방법조차도 다른 어떤 방법보다 경비원을 더 자주 성공적으로 속였습니다.
  • 실제처럼 들림: ICER 가 생성한 프롬프트는 길고 상세하며 자연스럽습니다. 말도 안 되는 글자처럼 보이지 않습니다.
  • 이동성이 좋음: 가장 놀라운 발견은 오픈소스 모델에서 구축한 ICER 의 "플레이북"이 DALL·E 3Midjourney와 같은 상업용 시스템에서도 작동했다는 점입니다. ICER 가 이전에 본 적이 없음에도 불구하고, 테스트 모델에서 작동한 속임수의 약 **30%**가 이러한 강력하게 보호되는 인기 앱에서도 작동했습니다.

핵심 교훈

이 논문은 안전 테스트가 고립된 시도들의 연속이 되어서는 안 된다고 주장합니다. 대신, 그것은 지속적인 학습 과정이어야 합니다. 도둑이 더 나은 계획을 세우기 위해 과거의 강도를 배우는 것처럼, 이 도구는 성공적인 공격 패턴을 저장하고 재사용하면 훨씬 더 빠르고 효과적으로 취약점을 찾을 수 있음을 보여줍니다.

경고: 논문은 이 도구가 개발자들이 패치할 수 있는 허점을 찾는 데 도움이 되지만, 동시에 나쁜 행위자들이 실제 세계에서 안전 필터를 우회하는 더 저렴하고 효과적인 방법을 만들기 위해 동일한 "플레이북" 논리를 사용할 수 있음을 보여준다고 지적합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →