← 최신 논문
💬 NLP

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

이 튜토리얼은 미분 방정식으로부터 확산 모델의 순방향 및 역방향 동역학을 유도하고, 표준 훈련 목적 함수와 스코어 매칭 간의 동등성을 입증하며, DDPM, DDIM, 유도 생성과 같은 다양한 샘플링 방법 간의 이론적 연결 관계를 명확히 함으로써 확산 모델을 위한 통합 프레임워크를 제공합니다.

원저자: Jiayi Fu, Yuxia Wang

게시일 2026-05-22
📖 5 분 읽기🧠 심층 분석

원저자: Jiayi Fu, Yuxia Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고해상도의 아름다운 고양이 사진을 상상해 보세요. 이제 옛날 TV 의 정전기를 서서히 높여 그 그림이 완전히 하얀 잡음의 바다에 사라질 때까지 상상해 보세요. 이것이 바로 **전방 과정 (Forward Process)**입니다.

이제 그 잡음을 보고 "이 특정 부분에서 잡음을 아주 조금만 제거하면 고양이의 귀가 살짝 모습을 드러낼 거야"라고 말할 수 있는 초지능 탐정을 상상해 보세요. 만약 이 탐정이 이 단계를 반복적으로 수행한다면, 그 잡음을 다시 선명한 고양이 사진으로 되돌릴 수 있습니다. 이것이 바로 **역과정 (Reverse Process)**이며, 확산 모델 (Diffusion Models) 이 이미지를 생성하는 방식입니다.

지ayi 푸 (Jiayi Fu) 와 왕위샤 (Yuxia Wang) 의 이 논문은 본질적으로 미분 방정식 (시간에 따라 사물이 어떻게 변하는지를 설명하는 수학) 의 언어로 쓰인 '사용자 매뉴얼'입니다. 이 논문은 과학자들이 이 모델들을 바라보던 여러 가지 다른 방식을 하나의 크고 일관된 이야기로 통합합니다.

다음은 그들의 이야기를 단순한 비유를 통해 풀어낸 내용입니다:

1. 여정을 설명하는 두 가지 방법 (SDE 대 ODE)

이 논문은 선명한 이미지를 잡음으로 바꾸는 과정 (그리고 그 반대의 과정) 을 두 가지 다른 수학 언어로 설명할 수 있다고 말합니다:

  • 확률적 경로 (SDE): 안개 낀 숲을 걷는 등산객을 상상해 보세요. 그들은 지도 (가야 할 방향) 를 가지고 있지만, 바람 (무작위 잡음) 이 계속把他们 약간 방향에서 벗어나게 만듭니다. 모든 걸음은 계획된 방향과 무작위 돌풍의 혼합입니다. 이것이 **확률 미분 방정식 (Stochastic Differential Equation, SDE)**입니다.
  • 결정론적 경로 (ODE): 이제 같은 등산객을 상상하되, 이번에는 바람이 완벽하게 예측 가능하거나, 무작위성 없이 그들이 가야 할 곳으로 정확히 이동시키는 거대한 매끄러운 컨베이어 벨트 위를 걷는다고 가정해 보세요. 이것이 **상미분 방정식 (Ordinary Differential Equation, ODE)**입니다.

큰 통찰: 이 논문은 두 경로가 서로 다르게 보일지라도 (하나는 흔들리고 하나는 매끄러움), 둘 다 같은 장소 (선명한 이미지) 에서 시작하여 같은 장소 (순수한 잡음) 에서 끝난다는 것을 증명합니다. 더 중요한 것은, 어떤 순간에든 둘이 정확히 같은 '밀도 지도'를 따른다는 것입니다. 흔들리는 경로와 매끄러운 경로 사이를 전환해도 최종 결과는 변하지 않습니다.

2. "스코어 (Score)" (탐정의 직감)

탐정은 어떻게 가야 할 방향을 알까요? 그들은 **스코어 (Score)**라는 것을 사용합니다.

수학적으로 '스코어'는 확률의 기울기입니다. 쉬운 말로 생각하면 **기울기 (slope)**입니다.

  • 언덕 위에 서 있다면, 그 기울기는 '위쪽' (데이터가 있는 곳) 과 '아래쪽' (잡음이 있는 곳) 을 알려줍니다.
  • 모델의 역할은 이 기울기를 배우는 것입니다. 모델은 잡음이 섞인 이미지를 보고 "위쪽 방향 (실제 이미지 쪽) 은 이쪽이야"라고 말하도록 학습합니다.

이 논문은 이러한 모델들을 훈련시키는 표준적인 방법 (추가된 잡음을 추측하도록 요구하는 것) 이 바로 이 '기울기'나 스코어를 배우도록 요구하는 것과 수학적으로 동일하다는 것을 보여줍니다. 마치 학생에게 공식을 직접 가르치는 대신 문제를 풀게 하여 답을 찾도록 가르치는 것과 같습니다. 이 논문은 이 두 가지 교육 방법이 실제로는 같은 것임을 증명합니다.

3. 훈련: 잡음 제거 학습

이 논문은 모델에게 복잡한 '기울기' 수학을 직접 가르칠 필요가 없다고 설명합니다. 대신, 잡음이 섞인 이미지를 보여주고 "우리가 추가한 잡음이 무엇이었나요?"라고 묻기만 하면 됩니다.

  • 모델이 잡음을 완벽하게 예측하는 법을 배우면, 자동으로 기울기도 배우게 됩니다.
  • 일단 기울기를 알면, 역과정을 거꾸로 수행할 수 있습니다: 순수한 잡음에서 시작하여 '언덕 위'로 걸어 올라가 새로운 사실적인 이미지를 만들어냅니다.

4. 다양한 '보행자' (DDPM, DDIM, DPM-Solver)

이 논문은 사람들이 이미지를 생성하는 데 사용하는 여러 유명한 알고리즘을 통합합니다. 이 논문은 이 모든 것들이 그 '기울기'를 따라 걸을 때의 서로 다른 방식일 뿐이라고 설명합니다:

  • DDPM (신중한 등산객): 이 방법은 작고 신중한 걸음을 떼습니다. 각 단계마다 약간의 무작위성을 추가합니다 (SDE 와 유사). 정확하지만 느립니다.
  • DDIM (매끄러운 슬라이더): 이 방법은 무작위 바람을 무시하고 매끄러운 컨베이어 벨트 (ODE) 를 따라갑니다. 무작위 돌풍에 반응하는 시간을 낭비하지 않기 때문에 훨씬 빠르지만, 매우 좋은 지도 (잘 훈련된 모델) 가 필요합니다.
  • DPM-Solver (익스프레스 엘리베이터): 이는 수학적인 트릭을 사용하여 작은 걸음 대신 언덕을 거대하고 효율적으로 뛰어오르는 새로운 방법입니다. 기록적인 시간으로 정상 (최종 이미지) 에 도달합니다.

이 논문은 DDPM이 본질적으로 흔들리는 경로 (SDE) 의 이산적 버전이고, DDIM은 매끄러운 경로 (ODE) 의 이산적 버전임을 보여줍니다. 이 둘은 같은 동전의 양면입니다.

5. 과정 안내 (분류기 안내, Classifier Guidance)

때로는 단순히 '고양이'가 아니라 '검은' 고양이를 원할 수도 있습니다. 탐정을 어떻게 조종할까요?

  • 분류기 안내 (Classifier Guidance): 두 번째 전문가 (분류기) 를 데려와 "검은색을 더! 흰색을 덜!"이라고 외치게 합니다. 탐정은 이미지의 기울기와 전문가의 외침을 모두 듣고, 검은 고양이를 만들도록 경로를 조정합니다.
  • 분류기 없는 안내 (Classifier-Free Guidance): 두 번째 전문가를 고용하는 대신, 주 탐정을 "무엇을 원하는지 모른다" (조건 없음) 고 말할 수 있고 "검은 고양이를 원한다는 것을 안다" (조건 있음) 고 말할 수 있도록 훈련시킵니다. 생성 과정에서 이 두 가지 답변을 혼합하여 결과를 조종합니다. 이 논문은 이러한 '혼합'이 왜 그렇게 잘 작동하는지 그 수학적 배경을 설명합니다.

6. 대통합: 흐름 매칭 (Flow Matching)

마지막으로, 이 논문은 확산 모델을 **흐름 매칭 (Flow Matching)**이라는 더 새로운 분야와 연결합니다.

  • 흐름 매칭은 잡음 구름에서 데이터 구름으로 직선을 그리는 것과 같습니다.
  • 확산은 구불구불한 강 길과 같습니다.

이 논문은 비록 서로 다르게 보이지만, 같은 방식으로 훈련한다면 (잡음/스코어 예측), 결국 정확히 같은 여정을 설명한다는 것을 증명합니다. '잡음 예측' 손실 함수는 사실 위장된 '흐름 매칭' 손실 함수입니다. 차를 운전하든 자전거를 타든 같은 GPS 좌표를 따른다면 같은 목적지에 도착한다는 사실을 깨닫는 것과 같습니다.

요약

이 논문은 다리를 놓는 역할을 합니다. 서로 다른 확산 알고리즘 (DDPM, DDIM, 흐름 매칭) 의 복잡하고 messy 한 세계를 가져와서, 이 모든 것이 동일한 미분 방정식을 푸는 서로 다른 방식일 뿐임을 보여줍니다.

  • 전방: 데이터를 잡음으로 변환 (쉬움).
  • 역과정: 잡음을 데이터로 변환 (어려움).
  • 비밀: 잡음을 추측하여 '기울기 (스코어)'를 학습.
  • 결과: 흔들리는 지팡이 (SDE) 로 걷든 매끄러운 레일 (ODE) 위에서 미끄러지든, 기울기를 따르면 아름다운 이미지를 생성할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →