← 최신 논문
📊 statistics

Deep learning with missing data

이 논문은 임의의 결측 메커니즘 하에서 결측 공변량이 존재하는 다변량 비모수 회귀에 대해 미니맥스 최적 수렴 속도를 달성하기 위해 관측 지표를 신경망 구조에 통합하는 방법론인 패턴 임베디드 신경망(Pattern Embedded Neural Networks, PENNs)을 소개하며, 다양한 데이터셋에 걸쳐 표준 신경망보다 경험적으로 우수한 성능을 입증한다.

원저자: Tianyi Ma, Tengyao Wang, Richard J. Samworth

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianyi Ma, Tengyao Wang, Richard J. Samworth

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

논문의 핵심 문제: "빠진 조각" 퍼즐

당신이 로봇에게 날씨를 예측하는 법을 가르치고 있다고 상상해 보세요. 당신은 온도, 습도, 풍속 같은 데이터를 로봇에게 줍니다. 하지만 때때로 센서가 고장 납니다. 어떤 날에는 로봇이 온도 데이터만 받기도 하고, 어떤 날에는 온도 없이 습도와 풍속만 받기도 합니다.

딥러닝(현대 AI의 "두뇌")의 세계에서 이것은 악몽과 같습니다. 보통 데이터가 누락되면, 과학자들은 단순히 빈칸을 추측값(예: 평균 온도)으로 채워 넣습니다. 그런 다음 로봇을 이 "채워진" 데이터로 학습시킵니다.

이 논문은 이러한 접근 방식에 결함이 있다고 주장합니다.
왜일까요? 누락된 데이터의 패턴 자체가 하나의 이야기를 담고 있기 때문입니다.

  • 만약 온도 센서가 고장 났다면, 로봇은 그 사실을 알아야 합니다.
  • 만약 습도 센서가 고장 났다면, 그것은 또 다른 이야기입니다.

저자들은 누락된 데이터의 이러한 패턴을 **"계시 벡터(revelation vectors)"**라고 부릅니다. 이것은 정확히 어떤 퍼즐 조각이 빠져 있는지를 보여주는 지도와 같습니다.

해결책: 패턴 임베디드 신경망 (PENN)

저자들은 **패턴 임베디드 신경망(Pattern Embedded Neural Networks, PENNs)**이라 불리는 새로운 학습 방식을 제안합니다.

표준적인 AI를 수학 문제를 풀려는 학생이라고 생각해 보세요.

  • 기존 방식: 선생님이 학생에게 숫자가 몇 개 빠진 학습지를 줍니다. 학생은 빠진 숫자를 추측해서 채워 넣고 문제를 풀려고 시도합니다. 만약 학생이 숫자를 잘못 추측했다면, 전체 답도 틀리게 됩니다.
  • PENN 방식: 선생님이 학생에게 학습지와 함께 "참고: 3번째 열의 숫자들은 비어 있음"이라는 특별한 메모를 함께 줍니다.

PENN 구조는 함께 작동하는 세 가지 부분으로 구성됩니다:

  1. 채우기(The Filler): 누락된 부분이 있는 데이터를 가져와서 이를 채워 넣습니다 (어떤 표준적인 방법을 사용하든 상관없습니다).
  2. 패턴 탐정(The Pattern Detective): 이것이 마법 같은 부분입니다. 이 부분은 오직 "누락성 지도(missingness map, 계시 벡터)"만을 살펴봅니다. 이 지도를 단순하고 압축된 요약본으로 압축합니다. 이를 통해 "온도 누락"과 "습도 누락"이 수학적으로는 비슷해 보일지라도, 실제로는 매우 다른 상황임을 학습합니다.
  3. 보스(The Boss): 채워진 데이터와 패턴 탐정이 만든 요약본을 모두 가져와서 최종 예측을 수행합니다.

왜 이것이 중요한가: "노이즈" 문제

이 논문은 단순히 "누락성 지도"를 추가 데이터로 넣는 것만으로는 발생하는 까다로운 문제를 설명합니다.

당신에게 20개의 서로 다른 센서가 있다고 가정해 봅시다. 이 센서들이 고장 날 수 있는 조합은 2202^{20}개(백만 개 이상)입니다. 만약 AI에게 단순히 "여기에 무엇이 고장 났는지 보여주는 20개의 0과 1의 리스트가 있다"라고만 알려준다면, AI는 과부하가 걸립니다. AI는 문법을 배우는 대신 사전 전체를 통째로 외우려는 학생처럼, 모든 조합을 하나하나 다 외우려고 노력할 것입니다. 이를 **과적합(overfitting)**이라고 합니다.

PENN은 패턴 탐정을 사용하여 누락의 의미를 학습함으로써 이 문제를 해결합니다. PENN은 "센서 1이 고장 났다"는 것이 예측 관점에서 "센서 1과 2가 모두 고장 났다"는 것과 유사한 의미를 가질 수 있음을 깨닫습니다. 즉, 유사한 누락 패턴들을 그룹화함으로써, AI가 유사한 사례로부터 지식을 빌려와 희귀한 경우에서도 학습할 수 있게 해줍니다.

증명: 이론과 실험

저자들은 단순히 멋진 도구를 만든 것에 그치지 않고, 이것이 수학적으로 작동함을 증명했습니다.

  • 이론: 저자들은 누락된 데이터가 복잡하고 기묘한 이유(단순한 무작위 확률이 아닌 이유)로 발생하더라도, 그들의 방식이 거의 최선의 학습 방법임을 보여주었습니다. 그들은 PENN이 마치 AI가 처음부터 누락 패턴을 그룹화하는 방법을 정확히 알고 있는 것처럼 빠르게 학습할 수 있음을 증명했습니다.
  • 실험: 저자들은 다음 테스트를 통해 이를 검증했습니다:
    • 가공 데이터(Fake Data): 데이터를 무작위로 누락시킨 시나리오와 의도적으로 누락시킨 시나리오(예: 매우 더울 때 센서가 더 자주 고장 나는 경우)를 만들었습니다. 거의 모든 경우에서 PENN은 표준 AI보다 훨씬 더 높은 정확도를 보였습니다.
    • 실제 데이터(Real Data): 신용 점수 예측이나 필기 숫자 인식(이미지의 일부가 "누락"되거나 가려진 경우)과 같은 실제 데이터셋을 테스트했습니다. 결과적으로 PENN은 XGBoost와 같은 다른 인기 있는 도구 및 표준 방식들보다 뛰어난 성능을 보였습니다.

요약

데이터가 누락되었을 때, 데이터가 누락되었다는 사실 자체가 정보가 됩니다.

  • 기존 AI: 누락을 무시하거나, 단순히 수정해야 할 오류로 취급합니다.
  • PENN: 누락을 하나의 단서로 취급합니다. 특수한 "번역기"를 사용하여 누락된 데이터의 패턴을 이해하고, 그 이해를 의사 결정 과정에 직접 전달합니다.

그 결과, 센서가 제대로 작동하지 않을 때도 혼란에 빠지지 않는 더 똑똑하고 견고한 AI를 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →