← 최신 논문
📊 statistics

Intrinsic-Hybrid Latent Diffusion Models for Generative Modeling on Unknown Manifolds

이 논문은 잠재 공간을 리만 다양체(Riemannian manifold)로 해석하고, 국소적 불확실성에 따라 유클리드 역학과 기하학적 인지 역학 사이를 동적으로 전환하는 하이브리드 확산 과정을 채택함으로써, 제한된 데이터 환경에서도 미지의 다양체 상에서 탁월한 생성 품질을 달성하여 표준 및 잠재 확산 모델의 한계를 극복하는 내재적 하이브리드 잠재 확산 모델(ILDM)을 소개한다.

원저자: Yizhu Wang, Mu Niu, Xiaochen Yang

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yizhu Wang, Mu Niu, Xiaochen Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 고양이 그림을 그리는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 수천 장의 사진을 보여주고, 결국 로봇은 솜털이 보송보송한 고양이를 스케치하는 법을 배웁니다. 하지만 만약 당신이 고작 몇 장의 사진만 보여준다면 어떻게 될까요? 로봇은 혼란에 빠져, 발 대신 바퀴가 달렸거나 머리가 세 개 달린 고양이를 그릴지도 모릅니다. 이것이 인공지능에서의 "생성 모델링(generative modeling)"이 직면한 과제입니다. 즉, 방대한 양의 예시 라이브러리를 공부할 수 없을 때, 컴퓨터가 어떻게 하면 새롭고 사실적인 데이터(이미지나 소리 같은)를 만들어내도록 가르칠 것인가의 문제입니다.

이를 해결하기 위해 과학자들은 종종 "디퓨전(diffusion, 확산)"이라 불리는 영리한 기술을 사용합니다. 이것은 마치 거꾸로 진행되는 "전화기 놀이(telephone game)"와 같습니다. 먼저, 선명한 사진에 정적 노이즈(static noise)를 서서히 추가하여 흐릿하고 회색빛이 도는 엉망인 상태로 만듭니다. 그런 다음, 컴퓨터가 이 게임을 역순으로 수행하도록 훈련합니다. 즉, 회색 노이즈로부터 시작하여 단계별로 정적을 제거함으로써 선명한 이미지가 나타나게 하는 법을 배우는 것입니다. 보통 이 컴퓨터들은 평평한 격자 형태의 세상(유클리드 공간이라고 불리는)에서 작동하며, 여기서는 위는 항상 위이고 왼쪽은 항상 왼쪽입니다. 하지만 인간의 얼굴 형태나 자동차의 곡선과 같은 실제 세계의 데이터는, 평평한 격자에 깔끔하게 들어맞지 않는 뒤틀리고 접힌 표면(매니폴드, manifold) 위에 존재합니다. 구겨진 종이 위를 평면 지도를 가지고 걸으려 한다면 길을 잃게 될 것입니다. 이 논문은 이러한 구겨진, 보이지 않는 표면을 항해하는 법을 이 AI 로봇들에게 어떻게 가르칠 것인가에 대한 문제를 다룹니다. 특히 사진을 아주 조금만 가지고 있을 때 말이죠.

이 연구의 저자인 왕이지(Yizhu Wang), 니우무(Mu Niu), 양샤오첸(Xiaochen Yang)은 **내재적 하이브리드 잠재 디퓨전 모델(Intrinsic Hybrid Latent Diffusion Model, ILD EM)**이라는 새로운 시스템을 소개합니다. 이들의 주요 발견은 AI가 사용하는 숨겨진 "지도"를 평평한 격자가 아닌 유연하고 굽어 있는 표면으로 취급함으로써, 로봇이 더 적은 사진으로도 훨씬 더 잘 학습할 수 있다는 것입니다. 그들은 AI의 지도가 모든 곳에서 완벽하지 않다는 것을 발견했습니다. 어떤 지점에서는 데이터의 위치를 매우 확신하지만, 다른 지점(학습 사진에서 멀리 떨어진 곳)에서는 불안정하고 불확실합니다.

이를 처리하기 위해 ILDM은 두 가지 서로 다른 이동 모드를 가진 등산가처럼 "하이브리드" 전략을 사용합니다. 등산가가 잘 알려진 안전한 길(불확실성이 낮은 영역)에 있을 때, 그들은 지형의 곡선을 존중하며 조심스럽게 따라 걷습니다. 이것이 모델의 리만(Riemannian) 부분으로, AI가 데이터의 자연스러운 기하학적 구조를 따르는 단계입니다. 하지만 만약 등산가가 안개가 자욱하고 미지의 숲(지도가 신뢰할 수 없는 불확실성이 높은 영역)으로 들어간다면, 그들은 길을 잃거나 절벽 아래로 떨어지는 것을 피하기 위해 더 단순한 직선 걷기 방식(유클리드 역학)으로 전환합니다. 모델은 끊임없이 자신의 확신도를 체크합니다. 확신이 없으면 안전한 직선 걷기 모드로 전환하고, 확신이 있으면 데이터의 곡선을 밀착하여 따라갑니다.

이 논문은 대부분의 현재 모델들이 사용하는 표준적인 접근 방식, 즉 숨겨진 지도가 항상 평평하다고 가정하고 이러한 곡선들을 무시하는 방식에 반론을 제기합니다. 저자들은 이러한 "평면 지도" 가정이 특히 데이터가 부족할 때 AI가 실수를 유발한다고 주장합니다. 또한 그들은 데이터의 정확한 표면 모양을 미리 알 필요가 없다는 점을 명시하며, 대신 그들의 모델이 확률적 디코더를 사용하여 형태와 불확실성을 실시간으로 학습한다고 설명합니다.

실험에서 연구팀은 세 가지 서로 다른 데이터 세트를 사용하여 이 새로운 시스템을 테스트했습니다: 회전하는 "럭키 캣(Lucky Cat)" 장난감(COIL-100 데이터셋), 손으로 쓴 숫자 모음(MNIST), 그리고 심장 스캔 이미지(cardiac MRI)입니다. 그들은 새로운 이미지를 생성하는 과정을 시뮬레이션하여, 하이브리드 모델이 표준 모델들보다 훨씬 더 나은 결과를 만들어낸다는 것을 발견했습니다. 구체적으로, 새 모델은 더 사실적인 이미지를 생성했으며 왜곡이 적었으며, FID 및 LPIPS라고 불리는 표준 품질 테스트에서 더 낮은 점수를 기록했습니다. 저자들은 컴퓨터 시뮬레이션과 비교 분석을 통해 이러한 성공을 측정하였으며, AI가 확신도에 따라 "곡선" 걷기와 "직선" 걷기를 전환하게 함으로써, 처음에 많은 예시를 보지 못했음에도 불구하고 고품질의 이미지를 생성할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →