← 최신 논문
🤖 machine learning

The Effect of Stochasticity in Score-Based Diffusion Sampling: a KL Divergence Analysis

이 논문은 스코어 기반 확산 샘플링에서의 확률성(stochasticity)의 영향을 분석하기 위해 오차 수정과 증폭 사이의 트레이드오프를 드러내는 KL 발산 상한을 도출하며, 최적의 확률성 프로파일이 모델의 스코어 오차의 시간적 국소성(time-localization)에 의존함을 입증한다.

원저자: Bernardo P. Schaeffer, Ricardo M. S. Rosa, Glauco Valle

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bernardo P. Schaeffer, Ricardo M. S. Rosa, Glauco Valle

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 완벽한 고양이 그림을 그리도록 가르치려 한다고 상상해 보십시오. 단순히 사진 한 장을 건네며 "이걸 똑같이 베껴봐"라고 말하는 것이 아닙니다. 대신, 당신은 마치 채널이 맞지 않는 TV의 정지 화면처럼 순수하고 혼란스러운 정적 노이즈(static noise)로 가득 찬 캔버스에서 시작합니다. 로봇의 임무는 노이즈를 조금씩, 단계적으로 제거하여 그 아래 숨겨진 고양이를 드러내는 것입니다. 이것이 바로 현대의 이미지 생성 분야에서 스타가 된 인공지능의 일종인 **확산 모델(diffusion models)**의 마법입니다. 이 모델은 실사 사진부터 새로운 신약 설계에 이르기까지 모든 것을 만들어냅니다.

이를 위해 로봇은 "스코어 함수(score function)"라고 불리는 수학적 지도를 사용합니다. 이 스코어를 나침반이라고 생각하십시오. 이 나침반은 항상 노이즈로부터 멀어지고 고양이를 향하는 방향을 가리킵니다. 만약 로봇이 이 나침반을 완벽하게 따른다면, 결국 완벽한 고양이를 그려낼 것입니다. 하지만 여기서 까다로운 점은 로봇의 나침반이 완벽하지 않다는 것입니다. 그것은 수백만 장의 사진을 통해 학습된 하나의 '추측'이며, 때로는 약간 잘못된 방향을 가리키기도 합니다. 이러한 실수를 바로잡기 위해 로봇은 다음 움직임에 대해 두 가지 선택지를 가집니다. 직선적이고 결정론적인 경로로 이동하거나(마치 선로 위의 기차처럼), 자신의 움직임에 약간의 무작위적인 "지터(jitter)" 또는 흔들림을 추가할 수 있습니다(마치 안개 속을 헤매는 등산객이 가끔 지름길을 찾아내는 것처럼). 여기서 과학자들이 던지는 핵심 질문은 이것입니다: 이 무작위적인 지터를 추가하는 것이 로봇이 고양이를 더 빠르고 더 잘 찾도록 도와줄까요, 아니면 그저 로봇이 제 발에 걸려 넘어지게 만들까요?

베르나르도 셰퍼(Bernardo Schaeffer), 리카르도 로사(Ricardo Rosa), 글라우코 발레(Glauco Valle)라는 연구자들이 작성한 이 논문은 이 질문을 깊이 있게 파고듭니다. 그들은 단순히 추측하는 데 그치지 않고, 고급 수학을 사용하여 노이즈에서 이미지로 이동함에 따라 로봇의 "실수 수준"이 정확히 어떻게 변하는지 추적합니다. 그들은 이를 **KL 다이버전스(KL Divergence)**라는 개념으로 측정하는데, 이는 "로봇의 그림이 실제 고양이와 얼마나 다른가?"를 나타내는 세련된 방식입니다. 저자들은 답이 단순한 "예" 또는 "아니오"가 아니라는 것을 발견했습니다. 대신, 그것은 전적으로 로봇이 실수를 저지르는 시기에 달려 있습니다.

만약 로봇의 나침반이 완벽하다면(이는 이론적인 이상향입니다), 무작위 지터를 추가하는 것은 **수축 효과(contractive effect)**를 가집니다. 즉, 과정이 진행됨에 따라 로봇의 그림과 실제 고 사이의 차이를 수학적으로 줄여준다는 뜻입니다. 이는 마치 마법의 지우개처럼 작용하여 초기 오류를 매끄럽게 다듬고, 로봇이 완벽한 이미지로 더 빠르게 수렴하도록 돕습니다. 마치 퍼즐 조각이 담긴 상자를 흔드는 것과 같습니다. 흔드는 행위가 조각들이 올바른 위치에 자리 잡도록 도와주는 것입니다.

하지만 현실 세계에서 로봇의 나침반은 결코 완벽하지 않습니다. 오류가 존재합니다. 저자들은 무작위 지터를 추가하는 것이 고도의 긴장감이 흐르는 줄다리기와 같다는 것을 발견했습니다. 한쪽에는 지터가 로봇이 이전 단계에서 저질렀던 실수(누적된 오류)를 바로잡는 힘이 있고, 다른 한쪽에는 지터가 로봇의 현재 실수(지금 당장 나침반이 잘못된 방향을 가리키는 것)를 증폭시키는 힘이 있습니다.

논문은 결정적인 규칙을 밝혀냅니다: 확률성(Stochasticity, 무작가적인 지터)은 로봇의 현재 나침반 오차가 이미 저지른 실수들의 총합보다 작을 때만 도움이 됩니다. 만약 로봇이 지금 엄청난 오류를 범하고 있다면(예를 들어, 그림의 세부 사항을 완성해야 하는 과정의 아주 마지막 단계에 있을 때), 지터를 추가하는 것은 위험합니다. 이는 오류를 증폭시켜 그림을 망칠 것입니다. 하지만 과정의 초기에 있거나 현재의 오류가 작다면, 지터는 오래된 누적 오류를 쓸어버리고 상황을 구해낼 수 있습니다.

연구자들은 간단한 장난감 예시와 MNIST(손글씨 숫자), CIFAR-10(작은 컬러 이미지) 같은 실제 데이터셋을 통해 이를 테스트했습니다. 그들은 "최적의" 지터 양이 일정한 설정값이 아니라는 것을 발견했습니다. 대신, 최적의 전략은 종종 과정의 중간이나 끝부분에 지터를 폭발적으로 추가하는 것이며, 시작 부분은 주의해야 한다는 것입니다. 실험 결과, 특정 모델의 경우 샘플링 초기에만 확률성을 사용하는 것은 아직 바로잡을 만큼의 누적된 실수가 충분하지 않은 상태에서 초기 오류를 증폭시키기 때문에 해롭다는 것이 밝혀졌습니다. 반대로, 과정의 맨 마지막에 지터를 추가하는 것 역시 최종 오류가 너무 크다면 해로울 수 있습니다. 최적의 지점(sweet spot)은 보통 누적된 오류가 교정을 통해 이득을 얻을 만큼 충분히 크면서도, 현재의 오류가 증폭되지 않을 만큼 작은 특정 구간에 존재합니다. 이는 자동차 운전과 같습니다. 고속도로에 합류할 때 핸들을 흔들고 싶지는 않으며(너무 위험함), 좁은 곳에 주차할 때도 핸들을 흔들고 싶지는 않습니다(너무 정밀함이 필요함). 하지만 탁 트인 도로 중간에서 핸들을 약간 흔들어주는 것은 차선을 유지하는 데 도움이 될 수 있습니다.

또한, 이 논문은 모든 것을 완벽하게 계산할 수 있는 완전한 분석적 예시를 제공합니다. 이 통제된 환경에서, 그들은 최적의 전략이 종-종 "뱅뱅(bang-bang)" 접근법, 즉 부드럽고 지속적인 흔들림이 아니라 특정 순간에 "지터 없음"과 "최대 지터" 사이를 급격하게 전환하는 것이라는 점을 증명했습니다. 이는 더 나은 AI 예술의 비밀이 단지 더 좋은 나침반을 갖는 것이 아니라, 언제 혼돈을 받아들이고 언제 경로를 곧게 유지할지를 정확히 아는 데 있다는 것을 시사합니다.

요컨대, 이 논문은 AI 생성에서의 무작위성이 양날의 검임을 시사합니다. 그것은 과거의 실수를 바로잡는 강력한 도구가 될 수 있지만, 현재의 실수를 확대하지 않도록 주의할 때만 그렇습니다. 이러한 오류의 타이밍을 이해함으로써, 우리는 AI 모델을 더 정교하게 조정하여 더 나은 이미지를 만들고 더 신뢰할 수 있는 과학적 시뮬레이션을 구현할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →