← 최신 논문
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

본 논문은 텍스트-이미지 모델에서 안전하지 않은 출력은 훈련 데이터 내 안전하지 않은 이미지의 절대적 수가 아닌 그 비율이 직접적이고 단조롭게 결정하며, 안전성 필터링은 이미지 품질을 저하시키지 않으면서 모델의 안전성을 향상시키고, 텍스트 인코더 또한 잔여 위험에 크게 기여함을 보여줍니다.

원저자: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 재능 있는 화가에게 글로 된 설명을 바탕으로 그림을 그리도록 가르치고 있습니다. 이 화가는 수백만 장의 사진을 보고 그에 딸린 캡션을 읽으며 배웁니다.

이 논문인 **"No Safe Dose(안전한 용량은 없다)"**는 간단하지만 결정적인 질문을 던집니다: 학습 과정에서 실수로 이 화가에게 몇 장의 나쁘거나 위험한 사진을 보여줬다면, 나중에 위험한 그림을 그리기 시작할까요?

연구자들이 발견한 바를 간단한 비유를 통해 설명해 드리겠습니다.

1. "썩은 사과" 효과

연구자들은 통제된 실험을 설계했습니다. 그들은 서로 다른 "바구니"의 사진들을 사용하여 동일한 AI 화가를 훈련시켰습니다.

  • 바구니 A: 나쁜 사진 0% (완전히 깨끗함).
  • 바구니 B: 나쁜 사진 1.2% (인터넷에서 발견되는 자연스러운 양).
  • 바구니 C: 나쁜 사진 5%.
  • 바구니 D: 나쁜 사진 10%.

결과: 훈련용 바구니에 나쁜 사진을 더할수록 AI 는 더 많은 나쁜 이미지를 생성하기 시작했습니다. 이는 무작위적인 도약이 아니라 꾸준하고 예측 가능한 상승세였습니다. 훈련 데이터에 있는 "썩은 사과"가 많을수록 AI 가 생성하는 "썩은 사과"도 많아졌습니다.

2. 중요한 것은 개수가 아닌 비율입니다

"만약 10 만 장의 나쁜 사진이 들어 있는 거대한 바구니를 가진다면, 1,000 장의 나쁜 사진이 들어 있는 작은 바구니보다 더 나쁘지 않을까?"라고 생각할 수 있습니다. 하지만 이 논문은 아니오라고 말합니다.

중요한 것은 나쁜 사진의 총 개수가 아니라 **비율 (백분율)**입니다.

  • 비유: 국을 간한다고 상상해 보세요. 작은 컵의 국에 소금 한 꼬집을 넣으면 매우 짜집니다. 거대한 냄비의 국에 소금 한 꼬집을 넣으면 거의 느껴지지 않습니다. 하지만 거대한 냄비에 숟가락 한 술의 소금을 넣으면 매우 짜집니다.
  • 발견: AI 는 훈련 데이터 내 나쁜 아이디어의 농도에 관심을 가집니다. 데이터셋이 100 만 장이든 800 만 장이든, 나쁜 이미지의 비율이 같다면 AI 의 행동 방식은 동일합니다. 이는 데이터셋의 크기와 관계없이 안전 필터가 동일하게 작동함을 의미합니다.

3. "기계의 유령" (회복 불가능한 바닥선)

여기가 놀라운 부분입니다: 연구자들이 훈련 데이터에서 나쁜 사진을 100% 제거했을 때도, AI 는 여전히 약 16.6% 의 나쁜 이미지를 생성했습니다.

왜 그럴까요?
AI 는 두 가지 부분으로 구성됩니다:

  1. 화가: 사진 (연구자들이 정제한 것) 에서 학습하는 부분.
  2. 번역가: 사용자의 프롬프트를 읽고 화가에게 무엇을 할지 지시하는 사전 훈련된 "텍스트 인코더". 이 번역가는 연구자들이 작업을 시작하기 전, 자체적으로 거대하고 지저분한 인터넷 데이터로 훈련되었습니다.

비유: 화가에게 깨끗한 참조 사진 세트를 제공한다고 가정해 보세요. 하지만 지시를 내리는 사람 (번역가) 은 자신이 다른 지저분한 출처에서 배운 나쁜 아이디어들을 화가의 귀에 속삭입니다. 깨끗한 사진 앨범이 있더라도 지시가 오염되었기 때문에 화가는 여전히 실수를 저지릅니다.

연구자들은 이 "번역가"를 더 안전한 버전 (SafeCLIP) 으로 교체했을 때 나쁜 이미지 생성률이 16.6% 에서 9.6% 로 감소한다는 사실을 발견했습니다. 이는 최상의 결과를 얻으려면 사진뿐만 아니라 지시 내용도 정제해야 함을 증명합니다.

4. "적대적" 비밀

이 논문은 이 위험이 대부분 숨겨져 있다는 사실을 발견했습니다.

  • 일반 사용자: "고양이 그리기"나 "일몰 그리기"와 같은 안전한 프롬프트를 AI 에게 요청하면, AI 는 나쁜 데이터를 얼마나 많이 보았든 상관없이 약 99% 의 경우 안전한 이미지를 생성합니다. 나쁜 훈련 데이터는 일반적이고 친근한 사용에는 보이지 않습니다.
  • 악의적 행위자: 위험한 콘텐츠 생성을 강요하는 "적대적" 프롬프트로 AI 를 속이려 할 때만 위험이 드러납니다. 나쁜 훈련 데이터는 AI 를 속이기 훨씬 쉽게 만듭니다.

비유: AI 를 성에 비유해 보세요. 정중하게 정문으로 들어오면 경비원 (안전 필터) 이 당신을 들여보내주고 아름다운 정원을 보여줍니다. 하지만 "나쁜 훈련 식단"을 가진 경우, 성벽에는 숙련된 도둑 (적대적 프롬프트) 만이 찾아내고 이용할 수 있는 숨겨진 균열이 있습니다.

5. "품질세"는 없습니다

일반적인 우려는 다음과 같습니다: "나쁜 것을 모두 필터링하면 AI 가 그림을 그리는 능력이 떨어지지 않을까?"
답변: 아닙니다. 연구자들은 이미지 품질 (선명도 및 텍스트와 이미지의 일치도 등 지표 사용) 을 확인했고 차이가 전혀 없음을 발견했습니다. 데이터를 정제하는 것이 AI 를 더 멍청하게 만들거나 그림을 더 추하게 만들지 않았습니다. 이는 "무료"인 안전 업그레이드였습니다.

요약

  • 나쁜 훈련 데이터는 나쁜 AI 출력으로 이어집니다. 나쁜 데이터가 많을수록 출력은 더 나빠집니다.
  • 중요한 것은 비율입니다. 작은 데이터셋의 10% 를 정제하는 것은 거대한 데이터셋의 10% 를 정제하는 것과 마찬가지로 효과적입니다.
  • 사진만 정제해서는 해결할 수 없습니다. AI 의 "번역가" 부분도 안전해야 하며, 그렇지 않으면 항상 일정한 수준의 위험이 존재합니다.
  • 일반인에게는 보이지 않습니다. 위험은 주로 누군가 시스템을 속이려 할 때 나타납니다.
  • 안전은 품질을 해치지 않습니다. 그림을 더 나쁘게 만들지 않고도 AI 를 더 안전하게 만들 수 있습니다.

이 논문은 AI 를 안전하게 만들기 위해서는 층화된 방어가 필요하다고 결론 내립니다: 훈련 사진을 정제하고, 안전한 "번역가"를 사용하며, 시스템을 속이려는 사람들에 대한 강력한 방어를 구축해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →