← 최신 논문
💻 computer science

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1 은 그룹 상대 정책 최적화와 새로운 CLIP 기반 조향 보상 메커니즘을 활용한 온라인 강화 학습 프레임워크를 도입하여, 고비용의 지도 학습 데이터가 필요하거나 파국적 망각에 시달리지 않으면서도 확산 모델을 안전 제약과 효과적으로 정렬하고 생성 품질을 향상시킵니다.

원저자: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 재능 있는 Diffusion이라는 예술가가 있다고 상상해 보세요. 이 예술가는 인터넷 전역의 수백만 장의 이미지를 보고 그림을 배우는 법을 익혔습니다. 인터넷에는 모든 것이 있기 때문에, 이 예술가는 아름다운 풍경을 그리는 법을 배우는 동시에 부적절하거나 위험한 것을 그리는 법도 배우게 되었습니다.

이제 당신은 이 예술가를 가족 친화적인 잡지를 위한 그림을 그리도록 고용하고 싶습니다. 당신은 그에게 절대 다시 그런 나쁜 것들을 그리지 않도록 가르쳐야 하지만, 동시에 아름다운 복잡한 장면 (예: 파란 개 옆에 빨간 의자에 앉아 있는 고양이) 을 그리는 능력까지 망가뜨리고 싶지는 않습니다.

이 논문은 SafeDiffusion-R1이라는 이 예술가를 훈련시키는 새로운 방법을 소개합니다. 간단한 비유를 사용하여 그 작동 원리를 설명하겠습니다:

1. 기존 방법의 문제점

과거에는 나쁜 습관을 "잊게" 하려고 시도하는 것이 "좋은 예시"와 "나쁜 예시"로만 구성된 교과서만을 학생에게 보여줌으로써 가르치려는 것과 같았습니다.

  • 문제점: 이러한 예시들의 거대한 도서관이 필요했는데 (이는 비용이 많이 들고 얻기 어렵습니다).
  • 부작용: 예술가에게 나쁜 것을 잊으라고 강요하려 할 때, 종종 그들 나머지 모든 것도 잊어버렸습니다. 그들은 혼란스러워졌고, 그들의 아름다운 그림들은 흐릿하거나 기이해지기 시작했습니다. 이를 "파국적 망각 (catastrophic forgetting)"이라고 합니다.

2. 새로운 해결책: "온라인 코치"

정적인 교과서를 사용하는 대신, SafeDiffusion-R1은 예술가가 그림을 그리는 동안 곁에 서 있는 실시간 코치처럼 작동합니다.

  • 온라인 학습: 예술가는 프롬프트 (위험한 것일지라도) 를 기반으로 그림을 그리려고 시도합니다. 코치는 결과를 즉시 확인하고 피드백을 제공합니다.
  • "그룹" 트릭: 코치는 단순히 "좋다" 또는 "나쁘다"라고 말하지 않습니다. 대신, 예술가에게 동일한 프롬프트에 대한 네 가지 다른 버전을 그리도록 요청합니다. 그런 다음 코치는 이를 비교합니다: "A 버전은 괜찮지만, B 버전은 끔찍합니다." 이는 예술가가 극단적인 보상에 혼란을 느끼지 않고 상대적인 차이를 배우도록 돕습니다. 이를 **그룹 상대 정책 최적화 (GRPO)**라고 합니다.

3. 비밀 무기: "나침반" (조종 보상)

이것은 이 논문의 가장 큰 혁신입니다. 일반적으로 예술가에게 "나체를 그리지 마라"라고 말하려면 그림을 보고 "아니오"라고 말하는 특수한 전문가 (보상 모델) 가 필요합니다. 그 전문가를 훈련시키는 것은 어렵습니다.

SafeDiffusion-R1 대신 마법 나침반을 사용합니다.

  • 작동 원리: 예술가의 뇌를 아이디어의 거대한 지도라고 상상해 보세요. 이 지도에서 "안전한" 아이디어는 북쪽에, "위험한" 아이디어는 남쪽에 있습니다.
  • 트릭: 시스템은 모든 그림을 사람이 확인할 필요가 없습니다. 단순히 사용자가 입력한 단어(프롬프트) 를 가져와서 수학적으로 예술가가 그림을 그리기 시작하기 전에 그 단어를 북쪽 (안전) 으로 부드럽게 밀어냅니다.
  • 결과: 누군가 위험한 그림을 요청하면, 시스템은 그림이 시작되기 전에 예술가의 마음속 지시를 안전한 버전으로 미묘하게 변경합니다. 예술가는 "나쁜" 것에 대해 처벌받았기 때문이 아니라 "안전한" 지시를 받았기 때문에 안전한 그림을 그립니다.

4. 결과: 안전하고, 똑똑하며, 선명함

이 논문은 이 방법을 테스트하여 세 가지 주요 성과를 발견했습니다:

  • 안전성: 부적절한 그림의 수가 극적으로 감소했습니다. 이전 예술가가 테스트 세트에서 646 개의 부적절한 그림을 만들었다면, 이 새로운 방법은 15 개만 만들었습니다.
  • 일반화: 예술가를 주로 "나체" 프롬프트로 훈련시켰음에도 불구하고, 예술가는 훈련 중에 그런 특정 예시를 본 적이 없음에도 불구하고 다른 나쁜 것들 (폭력이나 혐오 표현 등) 을 피하는 법을 배웠습니다. 마치 누군가에게 독이 있는 사과를 먹지 말라고 가르치자, 그들이 갑자기 독이 있는 열매도 먹지 않게 된 것과 같습니다.
  • 품질: 예술가의 그림을 흐릿하거나 깨지게 만들었던 기존 방법과 달리, 이 방법은 실제로 예술가가 복잡한 지시 (사물 세기나 특정 위치에 배치하기 등) 를 따르는 능력을 향상시켰습니다.

요약

SafeDiffusion-R1은 "좋음 vs 나쁨" 예시의 거대한 도서관 없이도 AI 이미지 생성기가 안전하도록 가르치는 새로운 훈련 기술입니다. 이는 여러 시도를 비교하는 실시간 코치와 AI 가 생성을 시작하기 전에 생각을 안전 쪽으로 부드럽게 이끄는 수학적 나침반을 사용합니다. 그 결과, AI 는 더 안전하고 똑똑해졌으며, 이 과정에서 예술적 재능을 잃지 않게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →