← 최신 논문
📊 statistics

Variance-Tilted Diffusion Models for Diverse Sampling

이 논문은 사후 디노이징 평균(posterior denoised means)을 명시적으로 밀어내고 입자들을 더 높은 특징 분산(feature variance)을 가진 영역으로 유도함으로써 다양한 후보 집합을 생성하기 위해 Doob hh-변환을 활용하는 분산 기울기 디퓨전 샘플링(variance-tilted diffusion sampling) 방법을 소개한다.

원저자: Iskander Azangulov, Leo Zhang, Kianoosh Ashouritaklimi

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Iskander Azangulov, Leo Zhang, Kianoosh Ashouritaklimi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 "유리로 된 오리"와 같은 묘사를 바탕으로 그림을 그리는 데 매우 능숙한 마법 같은 예술가(확산 모델, Diffusion Model)가 있다고 상상해 보세요. 보통, 만약 당신이 이 예술가에게 오리 100마리를 그려달라고 요청한다면, 그는 단지 약간씩만 다른, 똑같이 완벽한 오리 100마리를 그려낼 것입니다. 그것들은 모두 매우 유사한 모습이며, 같은 자세를 취하고 있고, 같은 조명을 받고 있을 것입니다.

이것은 단 하나의 좋은 그림만을 원할 때는 아주 좋습니다. 하지만 만약 당신이 게임을 위해 다양한 오리 컬렉션이 필요하다면 어떨까요? 예를 들어 어떤 것은 수영하고 있고, 어떤 것은 날고 있으며, 어떤 것은 초록색 유리로 되어 있고, 또 다른 것은 파란색 유리로 되어 있어야 한다면 말이죠.

현재의 방식대로 예술가에게 요청하는 것은 대개 실패합니다. 그것은 마치 요리사에게 서로 다른 케이크 100개를 만들어 달라고 부탁했는데, 요리사가 자신이 가장 좋아하는 레시피인 초콜릿 케이크 100개를 똑같이 만들어 버리는 것과 같습니다.

문제점: "집단 사고"에 빠진 예술가

이 논문은 현재의 AI 모델들이 너무 "집단 사고(groupthink-y)"적이라고 주장합니다. 이 모델들은 가장 확률이 높고 안전한 답을 찾도록 훈련되었습니다. 그래서 당신이 한 묶음의 샘플을 요청하면, 그들은 똑같은 안전한 답을 반복해서 내놓습니다.

해결책: "분산 편향(Variance-Tilted)" 방식

저자들은 예술가에게 대화하는 새로운 방법을 제안합니다. 단순히 "오리를 그려줘"라고 말하는 대신, 특별한 규칙을 추가합니다: "오리 100마리를 그리되, 이들을 한데 모아 놓고 보았을 때 최대한 멀리 떨어져 있도록 해라."

이것을 **"분산 편향 확산(Variance-Tilted Diffusion)"**이라고 부릅니다.

작동 방식은 다음과 같습니다.

1. 특징 맵 (측정 테이프)

먼저, "차이"를 측정할 방법이 필요합니다. 저자들은 **선형 연산자(A)**라는 도구를 사용합니다. 이것을 특별한 측정 테이프라고 생각하세요.

  • 그것은 오리의 모양을 측정할 수도 있습니다.
  • 그것은 색상을 측정할 수도 있습니다.
  • 그것은 배경을 측정할 수도 있습니다.
  • 심지어 왼쪽 날개만을 측정할 수도 있습니다.

이 도구는 오리의 복잡한 이미지를 그 오리를 독특하게 만드는 것을 나타내는 단순한 숫자 리스트(특징)로 변환합니다.

2. 분산 목표 (퍼져 나가는 규칙)

목표는 **분산(Variance)**을 극대화하는 것입니다. 일상적인 용어로 분산은 단순히 "퍼짐"을 의미합니다.

  • 만약 100마리의 오리가 일직선으로 서 있다면, 분산은 낮습니다 (서로 뭉쳐 있습니다).
  • 만약 오리들이 방 전체에 흩어져 있다면, 분산은 높습니다.

논문은 수학적 규칙을 만듭니다: "우리는 우리의 측정 테이프를 기준으로 최종적인 오리 묶음이 가질 수 있는 가장 높은 퍼짐을 원한다."

3. Doob H-변환 (유령 가이드)

이 부분이 까다로운 수학적 부분이지만, 아주 간단하게 설명하자면 이렇습니다.
보통 AI는 이미지를 하나씩 독립적으로 생성합니다. 하지만 이 모델들은 다양성을 만들기 위해 게임의 규칙을 바꿉니다. 저자들은 AI가 단순히 오리 한 마리를 그리는 것이 아니라, 하나의 그룹 전체를 동시에 그리고 있으며, 그 그룹이 서로 "대화"하고 있다고 가정합니다.

그들은 Doob h-변환이라는 수학적 트릭을 사용합니다. 이것을 예술가의 귀에 속삭이는 유령 가이드라고 생각하세요.

  • 속삭임: "이봐, 방금 네가 그린 그 오리는 5초 전에 그린 것과 너무 닮았어. 좀 움직여 봐! 두 발 대신 외발로 서 있게 해!"
  • 반발력: 가이드는 새로운 오리들을 다른 오리들로부터 밀어냅니다 (마치 같은 극을 가진 자석처럼).
  • 곡률: 가이드는 또한 오리들을 "퍼짐"이 자연스럽게 더 높은 영역으로 유도하여, 그들이 이상한 구석에 뭉쳐 있지 않도록 합니다.

작용하는 두 가지 힘

논문은 이 "유령 가이드"를 두 가지 단순한 힘으로 나눕니다.

  1. "나를 따라 하지 마" 힘: 이 힘은 오리들을 서로 밀어냅니다. 만약 AI가 그룹의 평균과 너무 닮은 오리를 그리려 한다면, 이 힘은 그것을 밀어냅니다. 이는 오리들이 모두 똑같은 "평균적인" 오리가 되지 않도록 보장합니다.
  2. "가장자리 탐색" 힘: 이 힘은 오리들을 가능한 세계의 가장자리로 밀어냅 지향합니다. 이는 AI가 지루하고 안전한 중심부에 머무는 대신, 약간 특이하거나 드문 것들을 시도하도록 격려합니다.

결과

저자들이 이미지(예: "유리 오리" 또는 "공을 가지고 있는 코기")에 대해 테스트했을 때, 결과는 놀라웠습니다.

  • 표준 AI (CFG): 모두 매우 비슷해 보이는 오리 그룹을 만들어냈습니다.
  • 그들의 방식 (Variance-Tilted): 매우 다양한 포즈, 배경, 스타일을 가진 오리 그룹을 만들어냈습니다. 어떤 것은 수영하고 있고, 어떤 것은 날고 있으며, 어떤 것은 비 속에서, 어떤 것은 햇빛 아래에서 있습니다.

왜 이것이 중요한가 (논문에 따르면)

이 논문은 이 방식이 이전 방법들보다 더 낫다고 주장하는데, 그 이유는 다음과 같습니다:

  • 정확합니다: 그들은 단순히 다양성을 만드는 규칙을 추측한 것이 아닙니다. 그들은 목표(퍼짐 극대화)에서 시작하여, 그곳에 도달하기 위한 정확한 단계들을 수학적으로 도출했습니다.
  • 투명합니다: 당신은 "유령 가이드"가 무엇을 하고 있는지 정확히 볼 수 있습니다. 이것은 블랙박스가 아닙니다. 개별 오리와 그룹 사이의 명확한 밀고 당기기입니다.

요약하자면: 이 논문은 AI에게 모방자가 되기를 멈추고 창의적인 감독이 되도록 가르칩니다. 이를 통해 당신이 아이디어 한 묶음을 요청했을 때, 똑같은 것의 복사본 100개가 아니라 풍부하고 다양한 컬렉션을 얻을 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →