← 최신 논문
📊 statistics

Missing Data Imputation under Manifold Hypothesis

이 논문은 혼합 변분 오토인코더와 잠재 공간 확산 모델을 활용하여 결측값의 조건부 분포로부터 샘플링함으로써, 데이터의 기저에 있는 매니폴드 기하학적 구조를 존중하는 동시에 불확실성 정량화와 효율적인 온더플라이(on-the-fly) 임퓨테이션을 제공하는 모델 기반 결측 데이터 임퓨테이션 방법을 제안한다.

원저자: Zelong Bi, Amuchechukwu Ibenegbu

게시일 2026-07-20
📖 5 분 읽기🧠 심층 분석

원저자: Zelong Bi, Amuchechukwu Ibenegbu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 정교한 모자이크를 완성하려 노력 중인데, 누군가 수백 개의 작은 타일들을 잘라냈다고 상상해 보십시오. 당신은 주변 조각들을 볼 수 있고, 원래 그림이 무작위적인 색상의 들쭉날쭉한 엉망진창이 아니라 매끄럽고 흐르는 듯한 풍경이어야 한다는 것을 알고 있습니다. 이것이 데이터 과학자들이 '결측치(missing data)'를 다룰 때 매일 겪는 고충입니다. 현실 세계에서는 센서가 고장 나고, 설문 조사가 누락되며, 기록이 유실되어 우리의 디지털 지도에 구멍이 생깁니다. 수십 년 동안 이 구멍을 채우는 표준적인 방법은 근처에 있는 것을 바탕으로 추측하는 것이었습니다. 마치 이웃이 마당에 남겨진 벽돌을 가지고 빈 벽을 채우는 것과 같습니다. 하지만 만약 그 벽이 평평하지 않다면 어떨까요? 만약 그림이 사실은 롤러코 coaster 트랙이나 뒤틀린 리본처럼 굽어 있고 뒤틀린 조각상이라면 어떨까요? 만약 굽은 트랙 위의 빈 공간을 평평하고 직선적인 추측으로 채우려 한다면, 가까이서 볼 때는 괜찮아 보일지 몰라도 한 걸음 물러나 보면 트랙에서 벗어나 버린 조각이 될 것입니다.

이 논문은 '매니폴드 가설(manifold hypothesis)'이라 불리는 수학의 특정 영역을 깊이 파고듭니다. 이것을 이렇게 생각해보십시오. 우리의 데이터가 거대한 고차원의 방(수백 개의 방향으로 움직일 수 있는 방을 상상해 보세요) 안에 흩어진 혼란스러운 점들의 구름처럼 보일지라도, 실제로는 그 방 안에 숨겨진 훨씬 작고 매끄러운 표면 위에 존재한다는 아이디어입니다. 이는 마치 혼란스러운 개미 더미 속의 모든 개미가 사실은 종이 한 장 위에서 구불구불하게 이어지는 하나의 선을 따라 행진하고 있다는 사실을 깨닫는 것과 같습니다. 이 논문은 '변분 오토인코더(Variational Autoencoders, VAEs)'를 사용하는데, VAE는 복잡한 3D 물체를 단순한 2D 그림으로 펼친 다음, 다시 그 그림으로부터 3D 물체를 완벽하게 재건할 수 있는 똑똑하고 유연한 카메라와 같습니다. 여기서 큰 질문은, 만약 우리가 3D 물체의 일부를 잃어버렸을 때, 단순히 근처의 값을 추측하는 대신 그 곡선을 존중하면서도 그 부분이 정확히 어떻게 생겼어야 하는지를 이 2D 그림을 통해 알아낼 수 있느냐는 것입니다.

저자인 젤롱 비(Zelong Bi)와 아무추쿠와 이베네구부(Amuchechukwu Ibenegbu)는 데이터를 평평한 시트가 아닌 굽은 표면으로 취급함으로써 이 부서진 모자이크를 고치는 새로운 방법을 제안합니다. 그들은 현재 가장 인기 있는 방법 중 하나인 미스포레스트(MissForest)가 패턴을 찾는 데는 뛰어나지만, 데이터의 '기하학적 구조'를 존중하는 데는 자주 실패한다고 주장합니다. 이를 시각화하기 위해, 미스포레스트가 원형의 빈 공간을 채우려고 빈틈 사이로 직선을 긋는 모습을 상상해 보십시오. 그 결과는 수학적으로 이웃들과는 가까울지 모르지만, 원의 형태를 깨뜨리게 됩니다. 저자들의 방법은 데이터가 곡선 위에 존재한다는 것을 이해하고 있으므로, 빈 공간을 채울 때 호(arc)를 따라가며 형태를 온전히 유지합니다.

이를 위해 그들은 두 단계의 마법 같은 기술을 사용합니다. 첫째, 그들은 '혼합 VAE(Mixture of VAEs)'를 사용하여 숨겨진 표면의 모양을 학습합니다. 이것을 곡선의 각기 다른 섹션을 담당하는 예술가 팀(예를 들어 언덕의 윗부분을 담당하는 예술가, 아랫부분을 담당하는 예술가)이 있는 것으로 상상해 보십시오. 그들은 무질서한 고차원 데이터를 곡선을 쉽게 볼 수 있는 단순하고 저차원적인 '잠재 공간(latent space)'으로 매핑합니다. 그다음, 데이터가 누락되었을 때 그들은 단순히 추측하는 것이 아니라, '샘플링 중요도 재표집(Sampling-Importance-Resampling, SIR)'이라는 통계적 절차를 사용합니다. SIR은 '뜨거운 감자' 게임과 같습니다. 누락된 부분에 대해 수천 개의 가능한 추측을 생성하지만, 곡선의 알려진 부분과 완벽하게 일치하는 것들만 남기고, 이상하거나 어색해 보이는 것들은 버립니다. 이를 통해 그들은 단 하나의 답을 주는 것이 아니라, 가능한 답의 범위를 보여줌으로써 채워진 값에 대한 불확실성을 효과적으로 수량화할 수 있습니다.

하지만 그들은 여기서 멈추지 않았습니다. 때때로 예술가들(VAEs)이 곡선의 모든 뒤틀림과 회전을 완벽하게 학습할 만큼 충분한 사례를 갖지 못할 수도 있다는 점을 깨달았습니다. 그래서 그들은 '결합 확산 과정(joint diffusion process)'을 추가했습니다. 이것을 서서히 걷히는 마법 같은 안개라고 상상해 보십시오. 당신은 누락된 부분과 곡선의 모양에 대한 완전히 흐릿하고 노이즈가 섞인 추측에서 시작하여, 단계별로 '노이즈를 제거(denoise)'하며, 로컬의 세부 사항과 글로벌한 형태를 모두 존중하는 날카롭고 완벽한 맞춤형 결과물로 정교화해 나갑니다. 이 과정은 저차원 공간에서 일어나기 때문에, 거대한 고차원의 방에서 노이즈를 제거하는 것보다 훨씬 빠르고 효율적입니다.

그들의 실험 결과는 매우 설득력이 있습니다. 원, 구, 도넛(토러스) 모양의 합성 데이터로 테스트했을 때, 그들의 방식은 기존의 주요 방법들보다 데이터의 실제 형태를 보존하는 데 훨씬 뛰어난 성능을 보였습니다. 표준적인 방법인 미스포레스트는 이웃과 가까운 숫자를 추측함으로써 때때로 더 낮은 '오차 점수(RMSE)'를 얻기도 했지만, 종종 기하학적 형태를 깨뜨렸습니다. 반면 저자들의 방법은 '와서스테인 거리(Wasserstein distance)'에서 가장 낮은 수치를 기록했습니다. 이는 채워진 데이터의 전체적인 모양과 분포가 원래의 끊어지지 않은 그림과 훨씬 더 유사하다는 것을 의미하는 고급 지표입니다.

초전도체(전기 저항이 없는 물질)와 에너지 소비량 같은 실제 데이터셋에서도 저자들의 방법은 강력한 경쟁력을 보여주었습니다. 데이터가 무작위로 누락되었을 때는 미스포레스트만큼 우수한 성능을 보였지만, 누락된 데이터가 까다롭거나 양이 많을 때 진가를 발휘했습니다. 이러한 어려운 시나리오에서 다른 방법들이 무너지는 동안, 그들의 방법은 견고함을 유지했습니다. 예를 들어, 초전도체 데이터셋에서 그들의 방법은 누락이 무작위가 아닐 때도 가장 낮은 오차율을 유지했는데, 이는 데이터의 기하학적 구조를 이해하는 것이 데이터가 비무작위적인 방식으로 '숨어' 있을 때도 올바르게 추측하는 데 도움이 된다는 것을 시사합니다.

그러나 이 논문은 이 방법이 모든 문제에 적용되는 마법 지팡이는 아니라는 점을 주의 깊게 명시합니다. 이 방법은 데이터가 실제로 매끄러운 저차원 곡선을 따른다는 '매니폴드 가설'에 크게 의존합니다. 만약 데이터가 그냥 무작위 노이즈이거나 명확한 형태가 없다면, 이 방법은 어려움을 겪을 수 있습니다. 또한 와인 품질과 같은 작은 데이터셋에서는 예술가들에게 곡선을 그리는 법을 가르칠 만큼 충분한 데이터가 없었기 때문에 성능이 그리 좋지 않았습니다. 그런 경우에는 단순히 가장 가까운 이웃을 찾는 더 간단한 방법들이 더 효과적이었습니다.

궁극적으로 이 논문은 매니폴드 학습의 기하학적 이해와 생성적 확산 모델의 힘을 결합함으로써, 데이터가 속한 우주의 형태에 '맞는' 방식으로 누락된 데이터를 채울 수 있음을 시사합니다. 이는 단순히 가장 가까운 벽돌로 구멍을 메우는 것에서 벗어나, 벽의 곡선에 딱 맞도록 누락된 조각을 조각하는 것으로의 전환입니다. 비록 더 많은 컴퓨 계산 능력과 특정한 유형의 데이터 구조를 요구하지만, 이는 특히 데이터의 숫자 자체만큼이나 데이터의 형태가 중요한 분야에서 더 정확하고 신뢰할 수 있는 데이터 복구를 향한 유망한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →