Clustering data with values missing at random using scale mixtures of multivariate skew-normal distributions
본 논문은 왜도(skewness), 두터운 꼬리(heavy tails), 그리고 불완전한 관측치를 동시에 처리하기 위해 다변량 왜정규 분포의 척도 혼합 유한 혼합 모델을 확장함으로써, 무작위 결측치가 있는 데이터의 모델 기반 클러스터링을 위한 증강 EM 유형 알고리즘을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 용의자들의 습관을 바탕으로 그룹을 묶어 미스터리를 풀려는 탐정이라고 상상해 보십시오. 데이터 과학의 세계에서 이것은 '클러스터링(군집화)'이라고 불립니다. 보통의 탐정들은 모든 용의자가 전체 정보가 담긴 완벽한 파일을 가지고 나타나는 완벽한 라인업을 갖추고 있습니다. 하지만 현실 세계의 파일은 페이지가 누락되거나, 잉크가 번져 있거나, 목격자가 세부 사항을 잊어버리는 경우가 많습니다. 이것이 바로 '결측 데이터(missing data)'입니다. 만약 당신이 누락된 파일들을 무시하고 미스터리를 해결하려 한다면, 가장 중요한 단서를 놓칠 수도 있습니다. 반대로 누락된 부분을 억지로 추측하려 한다면, 존재하지도 않는 용의자를 실수로 만들어낼 수도 있습니다.
이처럼 엉망이고 불완전한 정보를 이해하기 위해, 과학자들은 종종 '혼합 모델(mixture model)'이라는 도구를 사용합니다. 이것을 다양한 색깔의 구슬이 들어 있는 주머니라고 생각해 보십시오. 주머니에서 구슬 하나를 꺼냈을 때, 그것이 무슨 색인지 알 수는 없지만 주머니 안에 빨간색, 파란색, 초록색 구슬이 섞여 있다는 것은 알고 있습니다. 목표는 주머니에 몇 가지 색이 있는지 알아내고, '평균적인' 빨간색 구슬이 어떤 모습인지 파악하는 것입니다. 오랫동안 과학자들은 이 구슬들이 표준 주사위처럼 완벽하게 둥글고 대칭적이라고 가정했습니다. 하지만 현실 세계의 데이터는 비대칭적인 경우가 많습니다. 어떤 구슬은 길게 늘어져 있거나, 극단적인 값들이 모여 있는 무거운 꼬리 부분을 가지고 있기도 합니다. 이러한 문제를 다루기 위해, 과학자들은 '왜도 정규 분포(skew-normal distributions)'를 개발했습니다. 이는 마치 기묘한 모양에 맞춰 휘어질 수 있는, 늘어나고 비대칭적인 구슬과 같습니다.
그러나 문제가 있었습니다. 이 화려하고 잘 늘어나는 구슬들은 데이터가 완전할 때는 훌륭했지만, 파일에 누락된 페이지가 생기면 무너져 내렸습니다. 누락된 부분을 단순히 무시할 수도 없었고, 추측하는 것도 위험했습니다. 이 논문은 그 간극을 메우기 위해 등장했습니다. 이 논문은 강력하고 잘 늘어나는 '왜도 정규(skew-normal)' 구슬을 가져와서, 게임의 규칙을 어기지 않으면서도 누락된 정보를 처리하는 법을 가르칩니다.
남아프리카 공화국, 미국, 이탈리아 출신의 통계학자 팀인 저자들은 '유한 혼합 스케일 혼합 다변량 왜도 정규(Finite Mixture of Scale Mixtures of Multivariate Skew-Normal, FMSMSN)' 계열이라는 새로운 수학적 엔진을 구축했습니다. 이 계 family를 다양한 종류의 늘어나고 비대칭적인 구슬이 들어 있는 도구 상자라고 상상해 보십시오. 여기에는 표준 왜도 정규, 극단적인 이상치를 처리하는 왜도 t, 훨씬 더 거친 이상치를 처리하는 왜도 slash, 그리고 가장 유연한 왜도 분산-감마(skew-variance-gamma)까지 네 가지 유형의 구슬이 들어 있습니다.
이 논문의 큰 돌파구는 데이터가 불완전할 때도 이 전체 도구 상자를 사용하는 방법을 알아냈다는 점입니다. 그들은 누락된 데이터가 '무작위 결측(Missing At Random, MAR)'이라고 가정함으로써 이를 수행했습니다. 탐정의 용어로 말하자면, 이는 파일이 누락된 이유가 용의자가 자신에 대한 특정 사실을 숨기려 했기 때문이 아니라, 아마도 우편물 과정에서 분실되었거나 목격자가 바빴기 때문이라는 뜻입니다. 즉, 누락된 현상이 그 비밀스러운 값 자체에 의존하지 않는다는 것입니다. 이 가정을 바탕으로, 저자들은 컴퓨터가 데이터를 단순히 추측하거나 버리는 대신, 그룹을 찾아내는 동안 수학적으로 '빈칸을 채울 수 있도록' 하는 새로운 규칙(수정된 알고리즘)을 도출해 냈습니다.
그들의 새로운 엔진이 제대로 작동하는지 확인하기 위해, 팀은 일련의 컴퓨터 시뮬레이션을 실행했습니다. 그들은 두 개의 그룹이 포함된 가짜 데이터셋을 만들었으며, 일부는 서로 가깝게, 일부는 멀게 배치했습니다. 그런 다음 의도적으로 정보의 0%, 20%, 40%, 60%, 심지어 80%를 무작위로 삭제했습니다. 그들은 도구 상자에 있는 네 가지 유형의 구슬을 모두 테스트하여, 어떤 것이 그룹을 올바르게 찾고 구슬의 형태를 정확하게 추측할 수 있는지 확인했습니다.
결과는 다음과 같았습니다. 데이터가 더 많이 누락될수록 모든 모델이 그룹을 찾는 것이 어려워졌는데, 이는 예상된 결과였습니다. 그러나 더 복잡하고 유연한 모델(예: 왜도 분산-감마)은 데이터의 80%가 누락된 상황에서도 데이터의 실제 형태를 복원하는 데 일반적으로 더 뛰어난 성능을 보였습니다. 연구팀은 데이터가 누락되었을 때 어떤 모델도 완벽할 수는 없었지만, 그들의 새로운 방법이 불완전한 행을 단순히 삭제하는 것보다 훨씬 우수하다는 것을 발견했습니다. 삭제 방식을 썼다면 사용할 수 있는 데이터가 거의 남지 않았을 것이기 때문입니다.
마침내 연구진은 시뮬레이션 실험실에서 벗어나 그들의 새로운 방법을 실제 데이터인 전 세계 이산화탄소(CO2) 배출량에 적용했습니다. 그들은 전 세계 국가들의 7개 부문(전력, 제조업, 운송 등)의 배출량을 살펴보았습니다. 문제는 이 데이터셋의 행 중 84% 이상이 불완전했다는 점입니다. 만약 그들이 기존의 '누락된 데이터 삭제' 방식을 사용했다면, 데이터셋의 거의 전체를 버려야 했을 것입니다. 대신, 그들은 그들의 새로운 알고리즘을 사용했습니다.
알고리즘은 국가들을 두 개의 뚜렷한 클러스터로 성공적으로 분류했습니다. 한 그룹은 북아프리카 일부, 캐나다, 일본과 같이 일반적으로 배출량이 낮은 국가들을 포함했습니다. 다른 그룹은 미국, 중국, 인도, 그리고 많은 글로벌 사우스(Global South) 국가들을 포함하여 배출량이 높은 국가들을 포함했습니다. 분석 결과는 경제 성장(GDP)의 개선과 탄소 배출 증가 사이에 연관성이 있음을 시사했으며, 이는 개발도상국들이 성장과 환경 영향 사이에서 트레이드오프(상충 관계)에 직면해 있음을 강조했습니다. 이 연구는 이처럼 유연하고 결측치 처리에 강한 접근 방식을 사용함으로써, 과학자들이 가치 있는 정보를 버리지 않고도 이전에는 불가능했던 복잡한 현실 세계의 데이터 속에서 패턴을 밝혀낼 수 있게 되었다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.