← 최신 논문
📊 statistics

SSLfmm: An R Package for Semi-Supervised Learning with Mixed Missingness

SSLfmm R 패키지는 레이블 가용성 자체가 정보가 담긴 신호를 포함할 때 분류 성능을 향상시키기 위해 클래스 분포와 레이블 결측 메커니즘(MCAR, MAR 및 혼합 시나리오 포함)을 공동으로 모델링하는 준지도 학습을 위한 가능도 기반 가우시안 유한 혼합 프레임워크를 도입한다.

원저자: Geoffrey J. McLachlan, Jinran Wu

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Geoffrey J. McLachlan, Jinran Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

데이터 과학의 세계에서 연구자들은 종종 자신이 알고 있는 것과 측정할 수 있는 것 사이의 좌절스러운 간극에 직면합니다. 모든 환자의 증상은 기록되었지만, 일부 환자에 대해서만 최종 진단을 확정할 수 있었던 의료 연구를 상상해 보십시오. 나머지 사례들은 데이터가 유실된 것이 아니라, 확인 과정이 너무 비용이 많이 들거나, 너무 느리거나, 혹은 특정 사례에 대해 단순히 불가능했기 때문에 미지의 상태로 남아 있습니다. 이것이 바로 알려진 정답과 알려지지 않은 정답을 혼합하여 컴퓨터가 패턴을 인식하도록 가르치는 데 전념하는 분야인 준지도 학습(semi-supervised learning)의 영역입니다. 전통적으로 통계학자들은 이러한 누락된 답변들을 무작위적인 사고로 취급하며, 라벨이 누락된 이유가 데이터 자체와는 아무런 관련이 없다고 가정해 왔습니다. 그러나 많은 현실 세계의 상황에서 라벨이 누락된 이유는 사실 하나의 단서가 됩니다. 환자의 증상이 혼란스러워서 정확한 진단이 어려울 수도 있고, 설문 응답자가 대답하기 불편한 질문이라서 답변을 건너뛸 수도 있습니다. 만약 컴퓨터가 이 연결 고리를 무시한다면, 퍼즐의 중요한 조각을 놓치게 됩니다.

퀸즐랜드 대학교의 연구팀은 컴퓨터가 이 특정한 문제를 해결할 수 있도록 돕는 새로운 도구를 개발했습니다. 그들은 SSLfmm이라는 소프트웨어 패키지를 만들었는데, 이는 라벨이 두 가지 뚜렷한 방식, 즉 완전히 무작위로 누락되었거나 또는 데이터 자체가 라벨 획득을 어렵게 만든 경우의 방식으로 누락된 데이터로부터 기계가 학습할 수 있도록 해줍니다. 이 소프트웨어는 누락된 라벨을 단순히 빈 공간으로 취급하는 것이 아니라, 특정 과정의 결과물로 다루는 프레임워크를 기반으로 구축되었습니다. 이 과정을 데이터와 함께 모델링함으로써, 시스템은 우연히 발생한 누락된 라벨과 데이터 포인트가 모호하거나 분류하기 어려워 발생한 누락된 라벨을 구분할 수 있습니다. 이러한 접근 방식은 컴퓨터가 라벨이 누락되었다는 사실 자체를 사용하여 자신이 식별하려는 집단에 대한 이해를 높일 수 있게 합니다.

연구진은 라벨이 어떻게 누락되었는지 정확히 알고 있는 시뮬레이션된 데이터 세계를 만들어 이 새로운 소프트웨어를 테스트했습니다. 그들은 두 개의 중첩된 그룹을 나타내는 천 개의 데이터 포인트를 생성한 후, 의도적으로 약 32%의 라벨을 제거했습니다. 이 누락된 라벨들을 두 가지 범주로 나누었는데, 일부는 무작위로 제거되었고, 다른 일부는 데이터 포인트들이 서로를 구별하기 어렵다는 이유로 인해 특별히 제거되었습니다. 그런 다음 그들은 소프트웨어에 두 가지 전략을 사용하여 그룹을 파악하도록 요청했습니다. 첫 번째 전략에서 소프트웨어는 어떤 누락된 라벨이 무작위이고 어떤 것이 어려운 것인지 정확히 전달받았습니다. 두 번째 전략에서 소프트웨어는 누락된 이유를 알지 못한 채 단지 라벨이 누락되었다는 사실만 전달받았습니다. 결과는 누락된 라벨의 구체적인 이유를 알지 못하더라도 소프트웨어가 효과적으로 학습할 수 있음을 보여주었습니다. 숨겨진 라벨이 있는 데이터 포인트에 대해 테스트했을 때, 이유를 아는 버전은 약 81%의 정확도를 달성했고, 이유를 추측해야 했던 버전은 거의 동일한 약 81%의 정확도를 달성했습니다. 이는 누락된 정보의 출처가 숨겨져 있더라도 소프트웨어의 내부 논리가 견고하다는 것을 입증했습니다.

이것이 더 현실적인 환경에서 어떻게 작동하는지 보기 위해, 팀은 혈액 수혈에 관한 데이터셋에 소프트웨어를 적용했습니다. 그들은 748명의 기증자에 대한 완전한 기록을 가져와 일부에 대해 인위적으로 라벨을 제거했습니다. 분류하기 쉬운 기증자의 라벨은 유지했고, 무작위로 선택된 다른 기증자들의 라벨은 제거했으며, 분류하기 어렵다는 이유로 특별히 선택된 세 번째 그룹의 라벨은 제거했습니다. 이는 누락된 라벨이 무작위 사건과 어려운 사례의 혼합인 시나리오를 만들었습니다. 연구진은 세 가지 가정을 바탕으로 소프트웨어를 실행했습니다: 모든 누락된 라벨이 무작위라는 가정, 모두가 어려움 때문이라는 가정, 그리고 둘의 혼합이라는 가정입니다. 두 가지 원인이 혼합되어 있다고 가정한 소프트웨어가 가장 좋은 성능을 보였습니다. 이 모델은 어려운 사례들에 대해 약 61%의 정확도로 혈액 기증자 그룹을 올바르게 식별하여, 한 가지 유형의 누락만을 가정했던 모델들보다 뛰어난 성과를 냈습니다. 또한 소프트웨어는 누락된 라벨의 약 10%가 무작위라고 추정했는데, 이는 실제 실험 설정과 밀접하게 일치하는 수치였습니다.

단순히 정답을 얻는 것을 넘어, 이 소프트웨어는 자신의 작업을 점검할 수 있는 방법을 제공합니다. 이는 예측에 대한 불확실성 척도를 계산하는데, 본질적으로 컴퓨터에게 각 분류에 대해 얼마나 확신을 느끼는지 묻는 것입니다. 연구진이 이 신뢰도 점수를 살펴보았을 때, 원래 라벨링하기 어려웠던 데이터 포인트들이 쉽거나 무작위인 데이터 포인트들보다 훨씬 높은 불확실성 점수를 갖는다는 명확한 패턴을 발견했습니다. 이는 소프트웨어가 누락된 라벨을 데이터의 난이도와 성공적으로 연관 지어 학습했음을 확인시켜 주었습니다. 이 도구는 현재 통계 컴퓨팅의 표준 환경인 R 프로그래밍 언어용 무료 패키지로 제공됩니다. 이를 통해 연구자들은 복잡한 코드를 처음부터 작성할 필요 없이 모델을 적합시키고, 예측을 수행하며, 진단을 실행할 수 있습니다. 이 패키지에는 데이터를 시뮬레이션하고, 모델이 얼마나 잘 작동하는지 확인하며, 누락된 라벨과 분류 불확실성 사이의 관계를 시각화하는 기능이 포함되어 있습니다.

이 연구의 의의는 데이터 수집의 무질서한 현실을 다룰 수 있는 능력에 있습니다. 의학에서 사회 과학에 이르기까지 많은 분야에서 라벨을 얻는 과정은 결코 무작위적이지 않습니다. 누락된 현상 자체가 정보를 담고 있다는 점을 인정함으로써, SSLfmm 패키지는 불완전한 데이터로부터 더 정직하고 정확하게 학습할 수 있는 방법을 제시합니다. 이 도구는 모든 누락된 정보 문제를 해결한다고 주장하거나, 모든 누락된 데이터가 정보를 가지고 있다고 제안하는 것이 아닙니다. 대신, 연구자가 왜 데이터가 누락되었는지에 대한 다양한 가정을 테스트하고 어떤 가정이 최선의 결과를 이끌어내는지 확인할 수 있는 유연한 프레임워크를 제공합니다. 저자들은 소프트웨어가 테스트에서 좋은 성능을 보였지만, 구체적인 수치는 분석되는 데이터에 따라 달라진다는 점을 강조합니다. 이 도구의 진정한 가치는 과학자들에게 "내가 이 답을 모른다는 사실이 답 자체에 대해 무언가를 말해주고 있는가?"라고 질문하고, 데이터에 기반한 응답을 얻을 수 있는 방법을 제공한다는 데 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →