← 최신 논문
📊 statistics

Improved denoising diffusion probabilistic models with efficient non-diagonal covariance modeling

이 논문은 크로네커 인수분해와 이산 코사인 변환을 활용하여 자연 이미지의 상관관계를 효율적으로 포착함으로써, 계산 오버헤드를 무시할 수 있는 수준으로 유지하면서도 적은 샘플링 단계만으로 확산 확률적 생성 모델(DDPM)의 품질과 가능도를 크게 향상시키는 새로운 비대각 공분산 근사 방식인 Kronecker-DCT(K-DCT) 모델을 소개한다.

원저자: Rui Xia, Ayan Das, Artem Artemev, Andi Zhang, Guillaume Hennequin, Alberto Bernacchia

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Rui Xia, Ayan Das, Artem Artemev, Andi Zhang, Guillaume Hennequin, Alberto Bernacchia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

백지 상태에서 그림을 그리는 것이 아니라, 정전기(노이즈)로 가득 찬 캔버스에서 시작하여 노이즈를 천천히, 정교하게 제거함으로써 선명한 그림이 나타나게 하는 법을 배우는 기계를 상상해 보십시오. 이것은 디노이징 확산 모델(denoising diffusion models)이라 불리는 인공지능 모델 제품군의 핵심 아이디어입니다. 이 모델들은 사실적인 얼굴부터 풍경에 이르기까지 고품질의 이미지를 생성하는 표준 도구가 되었는데, 그 결과물이 매우 선명하면서도 다양하기 때문입니다. 하지만 한 가지 문제가 있습니다. 노이즈를 제거하는 과정이 본질적으로 느리다는 점입니다. 좋은 그림을 얻으려면 컴퓨터는 정전기를 조금씩 한 겹씩 벗겨내며 수천 번의 작고 신중한 단계를 거쳐야 합니다. 만약 속도를 높이기 위해 더 큰 보폭을 취하려고 하면, 기계가 이미지의 각 부분이 서로 어떻게 연관되어 있는지에 대한 감각을 잃어버려 이미지가 흐릿해지거나 왜곡되곤 합니다.

오랫동안 연구자들은 이 속도 문제를 해결하기 위해 하나의 단순화된 가정을 사용해 왔습니다. 바로 이미지의 어느 순간에 발생하는 불확실성을 각 픽셀을 독립적으로 관찰함으로써 설명할 수 있다고 가정한 것입니다. 이는 마치 특정 지점의 기온만을 보고 그 지점의 바람이 옆 동네의 비에 어떤 영향을 미치는지 무시한 채 날씨를 설명하려는 것과 같습니다. 이러한 방식은 아주 작은 보폭으로 움직일 때는 충분히 잘 작동하지만, 실용적인 사용을 위해 더 크고 빠른 보폭을 시도할 때는 무너지고 맙니다. 자연스러운 이미지의 실체는 훨씬 더 복잡합니다. 한 픽셀의 색상은 이웃한 픽셀과 깊게 연결되어 있으며, 이미지의 빨강, 초록, 파랑 채널은 복잡한 방식으로 서로에게 영향을 미칩니다. 'Transactions on Machine Learning Research'에 발표된 새로운 연구는 이러한 복잡한 연결 관계를 인정함으로써, 품질을 희생하지 않고도 이미지 생성기를 현저히 빠르게 만들 수 있다고 제안합니다.

케임브리지 대학교와 킹스 칼리지 런던을 포함한 기관의 연구진으로 구성된 이 팀은 이러한 연결 관계를 더 잘 파악하기 위한 지도를 구축하는 데 집중했습니다. 그들은 '사후 공분산(posterior covariance)'이라는 기술적 용어, 즉 이미지의 한 부분이 불확실성에 의존하는 방식이 다른 부분의 불확실성에 어떻게 의존하는지를 설명하는 개념에 초점을 맞췄습니다. 기존의 더 단순한 모델들에서 이 지도는 오직 대각선 방향만이 중요한 격자로 그려졌으며, 이는 한 픽셀의 미래가 이웃 픽셀과는 독립적임을 암시했습니다. 새로운 팀은 이것이 자연스러운 이미지의 진정한 구조를 무시한 극단적인 단순화라고 주장했습니다. 실제 이미지는 픽셀과 색상 채널 사이에 강력하고 비대각적인 상관관계를 보이기 때문입니다. 또한 그들은 이러한 이미지들이 음악의 화음이 특정한 음의 구조를 갖는 것처럼, 세부 사항이 예측 가능한 방식으로 서서히 사라지는 특정한 주파수 패턴을 가지고 있다는 점에도 주목했습니다.

이러한 복잡성을 컴퓨터의 속도를 늦추지 않으면서 포착하기 위해, 연구진은 K-DCT라고 불리는 새로운 수학적 모델을 개발했습니다. 이름은 두 가지 핵심 아이디어의 결합에서 유래되었습니다. 첫째, 그들은 색상의 관계(빨강, 초록, 파랑 등)와 공간적 위치의 관계(왼쪽, 오른쪽, 위, 아래 등)가 대략적으로 서로 분리되어 있다는 점을 인식했습니다. 이를 통해 거대하고 복잡한 문제를 두 개의 작고 관리 가능한 조각으로 나눌 수 있었습니다. 둘째, 이미지의 공간적 관계는 픽셀을 직접 보는 것이 아니라, 이산 코사인 변환(Discrete Cosine Transform)이라는 기술을 사용하여 이미지를 파동의 집합으로 바라볼 때 가장 잘 이해된다는 것을 깨달았습니다. 이는 이산 코사인 변환이 이미지를 근본적인 주파수로 분해하는 방식인데, 마치 프리즘이 백색광을 무지개색으로 분해하는 것과 비슷합니다. 연구진은 이 주파수 영역에서 작업함으로써 픽셀 사이의 복잡한 연결망을 매우 압축된 숫자 세트로 설명할 수 있었습니다.

그 결과, 매우 표현력이 뛰어나면서도 믿을 수 없을 정도로 효율적인 모델이 탄생했습니다. 고해상도 이미지의 연결 관계를 온전히 설명하려면 막대한 양의 메모리와 컴퓨팅 파워가 필요하겠지만, K-DCT 모델은 이미지 자체의 크기와 거의 차이가 없는 아주 작은 데이터 크기로 동일한 작업을 수행해 냅니다. 연구진은 일상적인 사물을 담은 CIFAR-10과 유명인의 초상화가 담긴 CelebA를 포함한 여러 유명 이미지 데이터셋에서 이 접근 방식을 테스트했습니다. 또한 ImageNet이나 LSUN과 같이 더 크고 복잡한 데이터셋에서도 테스트를 진행했습니다. 모든 경우에서 그들은 단순한 대각선 가정을 기반으로 하는 기존의 최선책들과 새로운 방법을 비교했습니다.

결과는 명확하고 일관적이었습니다. 연구진이 모델이 더 적은 단계로 이미지를 생성하도록 강제했을 때(속도가 매우 중요한 시나리오를 시뮬레이션함), 새로운 K-DCT 모델은 훨씬 더 나은 결과를 만들어냈습니다. 이미지는 더 선명하고 상세했으며, 학습 데이터의 통계적 특성에 더 가까웠습니다. 기술적인 관점에서 보면, 모델은 더 낮은 오류율과 더 높은 가능도(likelihood) 점수를 달성했는데, 이는 컴퓨터가 자신의 창작물에 대해 더 높은 확신을 가졌음을 의미합니다. 무엇보다 중요한 점은, 이미지 생성 과정의 속도가 저하되지 않았다는 것입니다. 새 모델에 필요한 추가 계산은 매우 효율적이어서 고해상도 이미지에서도 처리 시간을 거의 늘리지 않았습니다. 이는 이미지를 빠르게 생성하는 병목 현상이 컴퓨터의 원시적인 연산 능력 때문이 아니라, 불확실성을 모델링하는 방식에 있었음을 시사합니다.

연구팀은 왜 이 방식이 잘 작동하는지에 대해서도 탐구했습니다. 그들은 디노이징 이미지 내의 픽셀 간 연결이 빠르게 사라지지 않고, 여러 자릿수에 걸쳐 느리고 예측 가능한 방식으로 감쇠한다는 것을 발견했습니다. 이러한 장거리 연결을 무시하거나 몇 가지 기본적인 패턴으로 근사하려는 단순한 모델들은 이러한 미묘한 차이를 포착하는 데 실패합니다. 반면, K-DCT 모델은 이러한 구조를 자연스럽게 수용합니다. 흥ًا, 이 모델은 수학적 이론이 가정하는 완벽한 대칭성이나 이동 불변성이 없는 인간의 얼굴 데이터셋인 CelebA에서도 매우 뛰어난 성능을 보였습니다. 이는 모델이 실제 세계의 불완전함을 다룰 수 있을 만큼 견고하며, 밑바탕이 되는 패턴이 완벽하게 규칙적이지 않더라도 데이터의 본질적인 '전체' 구조를 포착할 수 있음을 시사합니다.

이 연구가 인공지능의 모든 문제를 해결했다고 주장하는 것은 아니지만, 이미지 생성에서의 속도와 품질 사이의 트레이드오프(trade-off)라는 구체적이고 지속적인 난제에 대해 설득력 있는 해결책을 제시합니다. 픽셀이 홀로 행동한다는 가정을 버리고 픽셀이 깊게 상호 연결되어 있다는 현실을 받아들임으로써, 연구진은 기계의 창의적 과정을 가속화할 수 있음을 보여주었습니다. 이 연구는 효율적인 이미지 생성의 미래가 더 큰 컴퓨터를 만드는 데 있는 것이 아니라, 그들이 만들고자 하는 이미지의 진정하고 복잡한 본질을 이해하는 더 똑똑한 모델을 만드는 데 있음을 시사합니다. K-DCT 모델은 통계적 구조에 대한 더 정확한 이해가 성능의 실질적인 향상으로 이어질 수 있으며, 하드웨어 능력의 비약적인 도약 없이도 고품질 이미지 생성을 더 빠르고 접근 가능하게 만들 수 있다는 증거입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →