← 최신 논문
🤖 machine learning

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

이 논문은 지배적인 모드를 평탄화하여 분산을 팽창시키지 않으면서도 효과적인 온도 샘플링을 가능하게 함으로써, 높은 품질과 조건 충실도를 유지하면서 다양한 아키텍처에 걸쳐 샘플의 다양성을 향상시키는 분산 교정 시간 이동(variance-corrective time shifting)이라는 학습이 필요 없는 방법을 소개한다.

원저자: Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수많은 사진이 담긴 거대한 도서관을 수년간 연구해 온 아주 똑똑한 로봇 화가가 있다고 상상해 보세요. 이 로봇은 가장 자주 본 것들, 예를 들어 의자에 앉아 있는 수백만 마리의 고양이를 그리는 데 매우 능숙합니다. 하지만 만약 당신이 아주 희귀한 것, 예를 들어 우주복 헬멧을 쓴 작은 고양이가 달 위에 있는 모습을 그려달라고 요청한다면, 로봇은 어려움을 겪거나 그냥 평범한 고양이를 다시 그려낼지도 모릅니다. 로봇은 "대중적인" 것들을 복제하는 데 너무나 뛰어나서, 도서관 속에 숨겨진 기이하고 경이로우며 희귀한 아이디어들을 잊어버리곤 합니다.

이 논문은 로봇을 새로 재학습시키거나 새로운 레슨을 가르치지 않고도, 로봇의 기억을 흔들어 깨워 그 희귀한 아이디어들을 탐색하게 만드는 영리한 기술을 소개합니다.

문제점: "너무 날카로움" vs "너무 흐릿함"의 함정

저자들은 먼저 간단한 아이디어를 시도했습니다. 로봇에게 기억을 "완화하라"고 말하는 것입니다. 로봇의 기억이 북적이는 방이라고 상상해 보세요. 그곳에서는 가장 인기 있는 아이디어(예: "의자 위의 고양이")가 크게 소리치고 있고, 희귀한 아이디어(예: "우주비행사 고양이")는 속삭이고 있습니다. 이 속삭임을 듣기 위해, 당신은 이렇게 생각할 수도 있습니다. "소리 지르는 사람들의 볼륨을 낮추자!"

수학적으로 이것은 데이터의 "온도"를 높이는 **온도 샘플링(temperature sampling)**이라고 불립니다. 온도를 높이면 대중적인 아이디어와 조용한 아이디어 사이의 차이가 완만해져서, 희귀한 아이디어들이 나타날 확률이 높아집니다.

하지만 저자들은 이를 무턱대고 수행하는 것이 재앙이라는 것을 보여줍니다. 이는 마치 스피커의 볼륨을 줄이려고 전원 노브를 최대치로 돌려버리는 것과 같습니다. 결과는 어떠할까요? 로봇은 단순히 속삭임을 듣는 것이 아니라, 환각을 보기 시작합니다. 이미지는 흐릿하고 엉망이며 노이즈로 가득 차게 됩니다. 저자들은 단순히 로봇의 "스코어"(다음에 무엇을 그릴지에 대한 추측)를 조절하는 것이 너무 많은 **분산(variance)**을 생성하기 때문이라고 설명합니다. 이는 마치 로봇이 새로운 가능성에 너무 흥분한 나머지 몸을 심하게 떨면서 그림을 망쳐버리는 것과 같습니다.

해결책: "시간 여행" 수정법

이 논문의 핵심 발견은 **분산 교정 시간 이동(variance-corrective time shifting)**이라 불리는 영리한 우회책입니다.

단순히 로봇에게 기억을 "완화하라"고 말하는 대신, 저자들은 로봇에게 그림을 약간 다른 시간대의 모습으로 보라고 지시합니다.

여기 비유가 있습니다. 당신이 안개가 자욱한 상자 안에 숨겨진 물체의 모양을 추측하려고 한다고 상상해 보세요.

  1. 표준적인 방식: 당신은 로봇에게 "상자 안에 무엇이 있니?"라고 묻습니다. 로봇은 안개 낀 상자를 보고 답을 내놓습니다.
  2. 무턱대고 "열"을 가하는 방식: 당신은 "안개가 더 짙고 물체가 더 흐릿하다고 상상해 봐!"라고 말합니다. 로봇은 추측하려 애쓰지만, 안개가 너무 짙기 때문에 무작위한 형태를 추측하기 시작하고, 결과는 엉망이 됩니다.
  3. 논문의 방식: 저자들은 "좋아, 안개가 실제보다 더 옅다고 가정하자, 하지만 우리는 여전히 '완화된' 느낌을 원해"라고 말합니다. 그들은 로봇에게 더 맑은 시점(shifted timestep)의 상자를 보게 함으로써 로봇을 속입니다. 그런 다음, 그 더 맑은 뷰에 "완화" 규칙을 적용합니다.

더 "이전의, 더 맑은" 버전의 노이즈를 봄으로써, 로봇은 추가적인 흐릿함 때문에 혼란을 겪지 않고도 다양성 증폭을 적용할 수 있습니다. 이는 마치 특수 안경을 써서 전체적인 그림을 흐리게 만들지 않으면서도 희귀한 아이디어들을 선명하게 볼 수 있게 하는 것과 같습니다. 저자들은 이 기술이 불필요한 떨림(분산)을 상쇄하면서도 새로운 아이디어를 탐색하는 이점을 유지한다는 것을 보여줍니다.

이 논문이 배제하는 것들

저자들은 무엇이 작동하지 않는지에 대해 매우 명확하게 밝히고 있습니다. 그들은 다음과 같은 점을 명시적으로 반박합니다:

  • 단순히 스코어를 스케일링하는 것: 로봇의 추측값에 단순히 숫자를 곱하는 것(무턱대고 하는 방식)은 과정을 망가뜨립니다. 이는 흐릿하고 사용할 수 없는 이미지를 만들어냅니다.
  • 다른 방법들: 그들은 프롬프트 신호를 변경하는 "CADS"나, 경로를 교정하기 위해 수많은 입자를 사용하는 "Feynman-Kac" 같은 다른 기술들도 테스트했습니다. 그 결과, CADS는 로봇이 프롬프트를 완전히 무시하게 만드는 경향이 있고(예: 고양이를 요청했는데 개를 그림), Feynman-Kac는 너무 노이즈가 심해 좋은 이미지를 만들어내는 데 실패한다는 것을 발견했습니다.

얼마나 확신하는가?

이 논문은 결과에 대해 상당히 자신감이 있으며, 단순한 추측이 아닌 증거로 이를 뒷받받합니다.

  • 시뮬레이션 및 테스트: 저자들은 단순한 수학 모델(10,000개의 샘플이 있는 "토이 예시")에서 테스트하여 완벽하게 작동함을 보여주었습니다.
  • 실제 모델 적용: 이 기술을 Stable Diffusion 1.5, Stable Diffusion XL, Stable Diffusion 3.5, DiT와 같은 실제 강력한 이미지 생성 모델에 적용했습니다.
  • 수치적 결과: 저자들은 구체적인 점수를 사용하여 결과를 측정했습니다. 예를 들어, DiT 모델에서 그들의 방식은 Fidelity(프롬프트 일치도)를 0.859로 높게 유지하면서도, Vendi score(다양성 척도)에서 베이스라인인 13.45를 상회하는 13.86을 달축했습니다. Stable Diffusion 3.5에서는 Vendi score 12.43과 Fidelity 0.897을 기록했습니다.
  • "초기" vs "후기" 기술: 또한, 이 기술을 언제 적용하느냐가 중요하다는 사실도 발견했습니다. 만약 과정 초기에(이미지가 그저 흐릿한 구름 형태일 때) 적용하면 완전히 다른 구도(예: 고양이 vs 개)를 얻게 됩니다. 반면 과정 후기에(이미지가 거의 완성되었을 때) 적용하면 세부적인 디테일의 작은 변화(예: 파란 눈의 고양이 vs 초록 눈의 고양이)만을 얻게 됩니다.

요약

이 논문은 AI 예술의 모든 문제를 해결했다고 주장하지 않습니다. 저자들은 로봇에게 여전히 한계가 있다는 점을 인정합니다(예: 학습한 적이 없다면 다리가 다섯 개 달린 말을 그릴 수 없음). 또한 트레이드오프가 존재한다는 점도 언급합니다. 즉, 로봇을 더 다양하게 만드는 것은 때때로 당신의 정확한 지시를 따르는 능력을 약간 떨어뜨릴 수 있습니다.

하지만 저자들은 이 분산 교정 시간 이동을 통해, 표준 AI 모델을 더 모험적인 예술가로 바꿀 수 있음을 보여주었습니다. 모델을 다시 학습시키거나 최종 이미지의 품질을 희생하지 않고도, 학습 데이터의 희귀하고 기이하며 경이로운 구석들을 탐색하도록 만들 수 있습니다. 이는 "온도 조절 노브"를 고장 난 스위치에서 창의성을 위한 정밀한 도구로 바꾸어 놓는 무료 업그레이드와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →