← 최신 논문
🤖 AI

Inference-Only Prompt Projection for Safe Text-to-Image Generation with TV Guarantees

본 논문은 확산 모델을 재학습시키지 않고 유해한 프롬프트의 부적절한 이미지 생성을 크게 줄이면서 안전한 프롬프트의 행동은 유지하기 위해 LLM 과 안전장치를 갖춘 VLM 을 사용하여 유해한 프롬프트를 선택적으로"tau 안전 집합"으로 투영하는 추론 시간 프레임워크인 SPOT 을 소개합니다.

원저자: Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 묘사하는 모든 것을 그릴 수 있는 마법 같은 얼어붙은 예술 기계 (텍스트-이미지 AI) 가 있다고 상상해 보세요. 이 기계는 매우 재능이 뛰어나지만, 때로는 까다롭거나 위험한 프롬프트를 입력하면 실수로 부적절한 이미지를 생성할 수도 있습니다.

문제는 다음과 같습니다: 기계 자체를 "수정"하여 나쁜 이미지를 그리는 것을 막으려 하면, 종종 좋은 이미지를 그리는 능력까지 실수로 망가뜨리게 됩니다. 이는 요리사가 매운 요리를 하지 못하게 하려고 칼을 치워버리는 것과 같습니다. 갑자기 샐러드를 위한 야채도 다질 수 없게 되는 것입니다.

이 논문은 기계 자체를 재건하는 대신, 기계 에 앉아 있는 스마트 편집자처럼 작동하는 SPOT(Selective Prompt Projection, 선택적 프롬프트 투사) 라는 새로운 방법을 소개합니다.

간단한 비유를 사용하여 작동 원리를 설명하면 다음과 같습니다:

1. "얼어붙은 기계" 규칙

저자들은 예술 기계에 전혀 손을 대지 않기로 결정했습니다. 기계를 그대로 (얼어붙은 상태로) 유지한 것입니다. 그 이유는 기계를 변경하면 그 기계의 "성격"도 변하기 때문입니다. 그들은 기계의 "좋은" 행동은 정확히 그대로 유지하면서 "나쁜" 행동만 막고자 했습니다.

2. "안전 지도" (τ 안전 집합)

어떤 영역은 "녹색 구역"(그려도 안전한 곳) 이고 다른 영역은 "적색 구역"(안전하지 않은 곳) 인 지도를 상상해 보세요.

  • 목표: 녹색 구역에 해당하는 것을 요청하면, 편집자는 요청을 그대로 두어 기계가 요청한 대로 정확히 그립니다.
  • 문제: 적색 구역에 해당하는 것을 요청하면, 편집자가 개입해야 합니다. 하지만 단순히 "아니오"라고 말하는 대신, 원래 요청과 유사하면서도 여전히 가장 가까운 녹색 구역을 찾으려 합니다.

3. 2 단계 탐정 팀

SPOT 은 값싼 스캐너와 엄격한 검사관으로 구성된 보안 팀처럼 행동하며, 위험한 요청을 처리하기 위해 2 단계 과정을 사용합니다.

  • 1 단계: 빠른 스캐너 (LLM)
    위험한 프롬프트가 들어오면, 빠르고 텍스트 전용인 AI (LLM) 가 정찰병 역할을 합니다. 이 AI 는 프롬프트의 몇 가지 "재작성" 버전을 빠르게 생성합니다. *"이 단어를 저 단어로 바꾸면 더 안전해 보일까?"*라고 묻는 것입니다.

    • 원래 아이디어에 가장 가깝지만 적색 구역에서 녹색 구역으로 이동시키는 버전을 선택합니다.
    • 이는 이미지 대신 단어만 보기 때문에 빠르고 비용이 적게 듭니다.
  • 2 단계: 엄격한 검사관 (VLM)
    편집자가 가장 좋은 재작성된 프롬프트를 선택하면, 실제 예술 기계가 그림을 그립니다. 그런 다음 두 번째 AI (시각 - 언어 모델) 가 생성된 실제 이미지를 살펴봅니다.

    • *"이 그림이 실제로 안전한가?"*라고 묻습니다.
    • 그림이 안전하면 통과 신호를 받습니다.
    • 그림이 여전히 안전하지 않다면 (아마도 기계가 새로운 프롬프트를 오해했을 수 있음), 시스템은 1 단계로 돌아가 다른 재작성을 시도하고 다시 그립니다.

4. "안전 vs 창의성"의 트레이드오프

이 논문은 매우 중요한 수학적 점을 제기합니다: AI 를 더 안전하게 만드는 것은 출력을 약간 변경하지 않고는 불가능합니다.
이를 강에 비유해 보겠습니다. 마을을 피하려는 위험한 홍수 (부적절한 이미지) 를 우회시키려면 새로운 수로를 건설해야 합니다. 그 새로운 수로는 물의 경로를 변경합니다.

  • SPOT 의 비법: 위험한 홍수에만 새로운 수로를 건설합니다. 물이 이미 안전하게 흐르고 있다면 (부드러운 프롬프트), 강을 그대로 두는 것입니다. 이렇게 하면 "귀여운 고양이"를 요청했을 때 여전히 "귀여운 고양이"를 얻지, "만화 고양이"나 "검은 화면"을 얻지 않게 됩니다.

5. 결과

저자들은 이 방법을 네 가지 다른 데이터 세트와 세 가지 다른 예술 기계에서 테스트했습니다.

  • 안전성: 부적절한 이미지 수를 크게 줄였습니다 (다른 방법보다 14% 에서 44% 더 우수함).
  • 창의성: 안전 필터가 없었을 때와 거의 동일하게 "좋은" 이미지를 유지했습니다.
  • 속도: 첫 번째 단계 (텍스트 스캐너) 가 매우 빠르기 때문에, 그리기 전에 모든 이미지 아이디어를 확인하는 방법들보다 전체 과정이 훨씬 빠릅니다.

요약

SPOT은 음악이나 DJ (AI 모델) 를 변경하지 않는 클럽의 도어맨과 같습니다. 대신 누군가 입구에서 무례한 말을 하려 하면, 도어맨은 그들이 공손한 표현으로 재구성하도록 부드럽게 제안합니다. 재구성된 문장으로 입장이 허용되면 들어갑니다. 계속 무례하게 굴려면 들어갈 수 없습니다. 하지만 처음부터 공손했다면, 아무런 간섭 없이 바로 들어갑니다.

이로써 클럽은 좋은 손님들의 경험을 망치지 않으면서도 안전을 유지할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →