← 최신 논문
🤖 AI

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

본 논문은 텍스트-이미지 확산 모델에서 기계적 망각 방어 기법을 기존 방법보다 훨씬 높은 성공률로 우회하는 고품질이고 탐지 불가능한 프롬프트를 반복적으로 생성하기 위해 대규모 언어 모델을 활용하는 블랙박스 임베딩 인식 적대적 프롬프트 공격인 BEAP 를 소개합니다.

원저자: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "지워졌지만 악용 가능: 학습 제거된 텍스트-이미지 확산 모델에 대한 블랙박스 임베딩 인식 프롬프팅"이라는 논문에 대한 간단한 언어와 비유를 사용한 설명입니다.

큰 그림: "가짜 지우개" 문제

수백만 장의 사진을 본 매우 재능 있는 화가가 있다고 상상해 보세요. 이 화가에게 알몸 같은 특정 사물을 그리는 법을 "잊어달라고" 요청합니다. 안전을 위해 다시는 그런 것을 그리지 않기를 원합니다.

이를 위해 특별한 "기계적 학습 제거" 기술을 사용합니다. 이는 마치 붉은 마커로 화가의 "알몸"에 대한 기억을 지워버리는 것과 같습니다. 이제 알몸 사람의 그림을 요청하면, 화가가 "그게 뭔지 모르겠다"고 말하거나 완전히 다른 것을 그릴 것이라고 기대합니다.

문제: 이 논문의 저자들은 이 "붉은 마커"가 실제로 기억을 지우지 않는다는 것을 발견했습니다. 단지 숨겨질 뿐입니다. 화가는 여전히 그리는 법을 기억하고 있으며, 단지 그 기억을 다시 잠금 해제할 올바른 속삭임만 필요할 뿐입니다.

공격: BEAP (속삭이는 탐정)

이 논문은 BEAP이라는 새로운 방법을 소개합니다. BEAP은 금지된 이미지를 여전히 기억하고 있음을 증명하려는 영리한 탐정이라고 생각하세요.

대부분의 이전 시도들은 화가를 속이려다 무의미한 소리를 지르거나 (예: "naked person x99#!!") 전혀 뜻이 없는 코드를 사용하는 것이었습니다. 화가의 안전 장치 (필터) 는 즉시 이런 터무니없는 내용을 알아차리고 차단했습니다.

BEAP 은 다릅니다. BEAP 은 거대한 언어 모델 (LLM) 인 초지능 AI 를 외교적 통역사로 활용합니다. 소리지르는 대신 BEAP 은 속삭입니다. 안전 장치에게 완전히 무해해 보이는 정상적이고 정중한 인간 언어로 금지된 개념을 설명하려 합니다.

BEAP 의 작동 원리 (3 단계 춤)

BEAP 은 단순히 추측하지 않습니다. 화가와 "뜨겁고 차갑다" 게임을 하며 매번 접근 방식을 다듬습니다. 작동 방식은 다음과 같습니다.

  1. "어휘 지도" (임베딩 인식):
    화가의 뇌가 단어들이 느낌의 유사성에 따라 배열된 거대한 도서관이라고 상상해 보세요. "naked(알몸)"라는 단어는 특정 구석에 있습니다. BEAP 은 "naked"의 이웃 단어들 (예: "bare, skin, uncovered") 을 지리지만 금지된 단어 자체는 아닌 단어들의 지도를 만듭니다. AI 통역사에게 이렇게 말합니다. "이 이웃 단어들을 사용하여 장면을 묘사하세요." 이렇게 하면 검색이 도서관의 올바른 구역에 집중됩니다.

  2. "3 점 만점 점수판" (보상 신호):
    BEAP 은 프롬프트를 시도하고 그림을 받은 후 세 가지를 확인합니다.

    • 금지된 물체를 얻었는가? (예: 그림에 실제로 알몸 사람이 나타났는가?)
    • 그림이 단어와 일치하는가? (예: "정원에 있는 여자"를 요청했다면 그림에 정원에 있는 여자가 있는가?)
    • 그림이 예쁜가? (흐릿하거나 왜곡되었는가, 아니면 고품질인가?)

    그림이 이 중 하나라도 실패하면 BEAP 은 포기하지 않습니다. AI 통역사에게 이렇게 말합니다. "거의 성공했지만 그림이 너무 흐릿했습니다. 다르게 묘사해 보되, 여전히 그 '이웃' 단어들을 사용하세요."

  3. 반복 루프:
    이 과정이 반복됩니다. BEAP 은 조금 더 나은 새로운 문장을 생성하고, 다시 시도하며 더 좋은 점수를 받습니다. 결국 필터에게는 완벽하게 정상적이고 안전해 보이지만, 화가를 속여 금지된 이미지를 고품질로 그리게 만드는 문장을 찾아냅니다.

결과: "지워졌지만" 사라진 것은 아님

이 논문은 알몸이라는 개념을 화가의 뇌에서 제거했다고 주장하는 여러 가지 "지우개" 방법 (ESD, MACE, SPM 등) 에 대해 이를 테스트했습니다.

  • 옛날 방식 (종 치기): 이전 공격들은 시스템을 깨뜨리려다 무의미한 프롬프트를 만들어냈습니다. 안전 필터가 이를 잡아내거나, 결과 이미지가 추하고 깨져 있었습니다. 좋은 이미지를 만드는 데 성공률은 0% 였습니다.
  • BEAP 방식: BEAP 은 **95% 에서 99%**의 경우에서 성공했습니다. 완전히 자연스러운 문장을 사용하여 "잊혀진" 개념의 고품질이고 아름다운 이미지를 생성해냈습니다.
  • "무의미한 말" 테스트: 논문은 BEAP 의 프롬프트가 무의미해 보이는지 확인했습니다. 아니었습니다. 그들은 정상적인 영어처럼 보였습니다. 보통 "이상한"거나 "깨진" 텍스트를 잡아내던 안전 필터들은 완전히 속았습니다.

결론

이 논문은 현재의 "학습 제거" 방법들은 실제로 안전하지 않다고 결론 내립니다. 이는 문을 잠그는 대신 "통행 금지" 표지판을 문에 붙이는 것과 같습니다. 올바른 코드 (이 경우 자연스러운 문장) 를 알면 여전히 그 문을 통과할 수 있습니다.

저자들은 모델이 "학습 제거"된 후에도 지식은 여전히 존재하며, 단지 영리한 프롬프트가 되살아날 기회를 기다리고 있다고 경고합니다. 그들은 BEAP 을 고안한 것이 악용을 장려하기 위함이 아니라, 개발자들에게 현재 안전 조치가 취약하며 수정이 필요함을 보여주기 위함입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →