← 최신 논문
🤖 machine learning

Diverse Sampling in Diffusion Models with Marginal Preserving Particle Guidance

본 논문은 발산 없는 역학을 통해 샘플 다양성을 향상시키면서도 주변 분포를 엄격하게 보존하고 고품질 생성을 유지하는 확산 및 흐름 매칭 모델을 위한 학습 없는 안내 메커니즘인 EDDY 를 소개합니다.

원저자: Gal Vinograd, Idan Achituve, Ethan Fetaya

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gal Vinograd, Idan Achituve, Ethan Fetaya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특정 화풍을 마스터한 화가라고 상상해 보세요. 당신은 완벽한 사실주의로 아름다운 의자, 아늑한 방, 또는 일몰을 그릴 수 있습니다. 그러나 매번 '아늑한 방'을 그려보려고 하면, 조명만 약간 다를 뿐 정확히 같은 방을 그리게 됩니다. 당신은 '아늑한 방'이라는 느낌을 잃지 않으면서도 다양한 가구 배치, 다른 색상, 다른 각도를 원합니다.

이것이 AI 이미지 생성기를 위해 EDDY(Exact-marginal Diversification via Divergence-free dYnamics, 발산 없는 역학을 통한 정확-주변 다양화) 논문이 해결하려는 문제입니다.

다음은 간단한 비유를 사용하여 작동 방식을 설명한 내용입니다:

문제: '복제' 효과

현대 AI 이미지 생성기 (확산 모델 등) 는 무작위 정적 (노이즈) 더미에서 시작하여 천천히 정화하여 이미지를 드러내는 방식으로 작동합니다.

  • 문제점: AI 에게 '고양이' 10 장을 생성하라고 10 번 따로 요청하면 10 마리의 서로 다른 고양이를 얻게 됩니다. 하지만 시간을 절약하기 위해 10 마리의 고양이를 동시에 생성하라고 요청하면, 이들은 종종 의심스러울 정도로 비슷하게 보입니다. 그들은 '복제'된 것입니다.
  • 과거의 해결책: 이전 방법들은 AI 에게 "이웃이 그리는 것을 그리지 마!"라고 말하듯 '반발력'을 추가하여 AI 가 다르게 만들도록 강요했습니다.
  • 결함: 과거의 방법들은 파티의 서투른 문지기 같았습니다. 이미지들을 너무 강하게 밀어붙여 이미지를 왜곡시켰습니다. 고양이들이 다르게 보일 수는 있지만, AI 가 다른 것들을 피하기 위해 자신의 규칙을 깨도록 강요당했기 때문에 다리가 세 개이거나 기괴한 아티팩트가 생길 수도 있습니다.

해결책: '물고기 떼' (EDDY)

저자들은 AI 를 안내하는 새로운 방식을 제안하는데, 이는 물고기 떼와 같습니다.

  1. 목표: 물고기 (이미지) 들이 퍼져서 전체 바다 (다양성) 를 탐험하기를 원하지만, 동시에 바다의 특정 경계 내에서 머무르기를 원합니다 (고품질 유지 및 프롬프트 준수).
  2. 비결 (물리학적 트릭): 이 논문은 Fokker-Planck 방정식이라는 수학적 개념을 사용합니다. 이를 AI 의 그림 그리기 과정에 대한 '보존 법칙'으로 생각하세요. 이는 다음과 같이 말합니다: 입자 (이미지) 들을 매우 특정한 소용돌이 방식으로 이동시키면, 그들이 수영하는 바다의 전체 모양을 바꾸지 않고도 서로 상대적으로 어디에 도달할지 바꿀 수 있습니다.
  3. 작동 방식:
    • AI 가 10 장의 이미지를 동시에 그리고 있다고 상상해 보세요.
    • EDDY 는 모든 이미지 쌍을 살펴봅니다. 두 이미지가 너무 가까워지면 (너무 비슷해지면), EDDY 는 그들을 떼어내기 위해 부드럽고 소용돌이치는 밀어냄을 가합니다.
    • 마법: 이 밀어냄은 '발산 없는 (divergence-free)' 것입니다. 일상적인 용어로 말하면, 이는 강 속의 소용돌이와 같습니다. 물이 소용돌이치며 무언가를 밀어내지만, 특정 지점의 물의 총량은 정확히 그대로 유지됩니다.
    • 이러한 수학적 트릭 덕분에 이미지들은 다양해집니다 (서로 다른 '모드'나 변형을 탐험함) 하지만 각 개별 이미지의 품질은 완벽하게 유지됩니다. 왜곡되거나 깨지지 않습니다.

'지각적' 도전

이 논문은 텍스트-to-이미지와 같은 복잡한 작업의 경우 픽셀을 단순히 비교하는 것 (두 사진을 나란히 비교하는 것) 으로 유사성을 측정할 수 없다고 지적합니다. 우리는 그들이 느낌이 비슷한지 측정해야 합니다.

  • 비유: 두 그림이 비슷한지 판단하려고 한다고 상상해 보세요. 픽셀을 세는 것이 아니라 '분위기'나 '스타일'을 봅니다.
  • 해결책: EDDY 는 이 분위기를 측정하기 위해 '특징 공간 (feature space)' (DINO 나 CLIP 임베딩과 같은) 을 사용합니다. 그러나 이 '분위기'에 대한 정확한 계산을 수행하는 것은 컴퓨터에게 매우 느리고 비용이 많이 듭니다.
  • 단축키: 저자들은 (유한 차분과 Hutchinson trace 추정을 사용한) 교묘한 근사법을 만들었습니다. 이는 마치 숙련된 화가가 모든 픽셀을 계산하는 대신 몇 가지 빠른 대략적인 스케치를 통해 완벽한 붓놀림을 예측하는 것과 같습니다. 이는 빠르며, 100% 수학적으로 완벽하지는 않지만 거의 완벽하게 작동합니다.

결과

이 논문은 합성 데이터와 FLUX, Stable Diffusion 과 같은 실제 텍스트-to-이미지 모델에서 EDDY 를 테스트했습니다.

  • 다양성: 표준 방법들에 비해 더 다양한 이미지 (예: 방 안의 서로 다른 의자 배치) 를 성공적으로 생성했습니다.
  • 품질: 기괴한 아티팩트를 만들어낸 과거의 '서투른 문지기' 방법들과 달리, EDDY 는 이미지들이 프롬프트에 충실하고 사진처럼 사실적으로 보이도록 유지했습니다.
  • 효율성: 생성 과정에 약간의 추가 시간이 소요됩니다 (약 25% 느림) 하지만 AI 모델을 처음부터 다시 학습시킬 필요는 없습니다.

요약

EDDY는 AI 이미지 생성을 위한 새로운 '교통 경찰'입니다. 이미지를 깨뜨려서 다르게 만드는 대신, 교묘한 수학적 소용돌이를 사용하여 그들을 부드럽게 밀어냅니다. 이를 통해 AI 는 이전 방법에서 보였던 기괴한 왜곡 없이 프롬프트를 완벽하게 따르는 고품질의 다양한 이미지 세트를 생성할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →