← 최신 논문
📊 statistics

Order-Agnostic Autoregressive Modelling with Missing Data

본 논문은 일반적인 결측 메커니즘 하에서 강건한 대체를 가능하게 하고 능동적 정보 획득을 촉진하며, 실제 세계 벤치마크에서 기존 기준 방법들을 일관되게 능가하는 Missingness-Aware Order-Agnostic Autoregressive Models(MO-ARM)를 소개하며, 이는 결측 데이터의 관점에서 순서 무관 자기회귀 모델을 재해석한 프레임워크입니다.

원저자: Ignacio Peis, Pablo M. Olmos, Jes Frellsen

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ignacio Peis, Pablo M. Olmos, Jes Frellsen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 퍼즐을 맞추려는데 누군가 조각의 절반을 찢어 버렸다고 상상해 보세요. 현실 세계에서는 이런 일이 항상 일어납니다. 센서가 고장 나거나, 환자가 양식을 작성하는 것을 잊거나, 파일이 손상되는 경우입니다. 보통 컴퓨터는 이러한 '빠진 조각'을 처리하는 데 어려움을 겪습니다. 그들은 맹목적으로 추측하거나, 불완전한 데이터를 폐기하거나, 그림이 어떻게 보여야 하는지 혼란에 빠집니다.

이 논문은 MO-ARM이라는 방법을 사용하여 컴퓨터가 빠진 퍼즐 조각을 처리하는 새로운 방식을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 보겠습니다.

1. 구식 방식: '엄격한 순서' 문제

데이터를 이해하려는 기존 AI 모델은 오직 한 가지 특정 순서로만 샌드위치를 만들기를 고집하는 매우 융통성 없는 셰프와 같습니다. 빵, 그다음 치즈, 그다음 햄, 그리고 다시 빵 순서로요. 만약 셰프에게 햄과 두 번째 빵 조각만 담긴 접시를 주면, 셰프는 당황합니다. '빵을 먼저'라는 규칙이 깨졌기 때문에 샌드위치를 만들 수 없습니다.

기술적인 용어로 말하자면, 이러한 모델들은 **자기회귀 모델 (Autoregressive Models)**입니다. 이전 데이터 조각들을 기반으로 다음 데이터 조각을 예측하지만, 단일하고 고정된 순서에 갇혀 있습니다. 데이터가 중간에 누락되면 연결 고리가 끊어집니다.

2. 새로운 아이디어: '순서 무관' 셰프

저자들은 **순서 무관 자기회귀 모델 (Order-Agnostic Autoregressive Models, OA-ARM)**이라는 더 새로운 유형의 모델을 연구했습니다. 순서에 상관없는 셰프를 상상해 보세요. 그들은 햄으로 시작해 치즈를 넣고 빵을 넣을 수도 있고, 빵으로 시작해 햄을 넣고 치즈를 넣을 수도 있습니다. 그들은 원하는 대로 어떤 무작위 순서로든 샌드위치를 만들 수 있습니다.

이 논문은 놀라운 발견을 합니다: 완전한 샌드위치 (빠진 조각이 없는) 로 이 '순서 무관' 셰프를 훈련시키면, 실수로 빠진 조각을 완벽하게 채우는 법을 배우게 됩니다.

왜일까요? 훈련 과정에서 셰프는 현재 테이블에 있는 다른 조각들 (아마도 빵만 있을 수도 있음) 을 기반으로 무작위 조각 (예: 햄) 을 예측하라는 요청을 끊임없이 받기 때문입니다. 이는 빠진 퍼즐 조각을 채우는 것과 정확히 동일한 정신적 훈련입니다. 이 논문은 이 훈련 과정이 수학적으로 '완전 무작위 결손 (Missing Completely At Random)' 데이터를 가지고 연습하는 것과 동일함을 증명합니다. 따라서 완벽한 데이터로만 훈련하더라도, 모델은 빠진 부분을 추측하는 데 능숙한 전문가가 됩니다.

3. 업그레이드: MO-ARM ('결손 인식' 셰프)

저자들은 여기서 멈추지 않았습니다. 그들은 현실 세계에서는 결손된 데이터가 항상 무작위적인 것은 아니라는 점을 깨달았습니다. 때로는 데이터가 그 값 자체 때문에 결손되기도 합니다 (예: 온도가 너무 높을 때만 온도계가 고장 나는 경우). 이를 '무작위적이지 않은 결손 (Missing Not At Random, MNAR)'이라고 합니다.

그들은 MO-ARM을 구축하여 두 번째 지능 계층을 추가했습니다:

  • 셰프: 여전히 어떤 순서로든 샌드위치를 만듭니다.
  • 탐정: 이 모델의 새로운 부분으로, *"왜 이 조각이 빠졌을까?"*라고 묻습니다.

만약 모델이 조각들이 '너무 뜨거워서' 빠졌다는 것을 학습하면, 그에 맞춰 추측을 조정합니다. 이를 통해 MO-ARM은 이전 방법들보다 훨씬 더 까다로운 비무작위 결손 데이터를 처리할 수 있습니다.

4. 초능력: '호기심 많은 탐정'

MO-ARM 의 가장 멋진 기능 중 하나는 다음에 무엇을 물어볼지 결정하는 능력입니다.

환자를 진단하려는 의사가 되어 보십시오. 하지만 몇 가지 검사만 진행할 예산이 있습니다. 무작위 검사를 원하지 않고, 가장 많은 정보를 알려주는 검사를 원합니다.

  • MO-ARM 은 초호기심 많은 탐정처럼 행동합니다. 당신이 가지고 있는 데이터를 살펴보고 계산합니다: "만약 이 특정 빠진 변수의 값을 알았다면, 최종 답변에 대한 내 확신이 얼마나 향상될까?"
  • 그런 다음 다음에 '획득'할 특정 변수를 선택합니다.
  • 이는 단계별로 이루어지며, 맹목적으로 추측하는 대신 가장 가치 있는 정보를 효율적으로 수집하여 예측을 수행합니다.

5. 효과가 있을까요?

저자들은 두 가지 매우 다른 유형의 퍼즐로 이를 테스트했습니다:

  1. 표 형식 데이터 (Tabular Data): 숫자와 범주가 포함된 스프레드시트 (예: 신용카드 데이터, 의료 기록) 와 같습니다. MO-ARM 은 다른 최상위 AI 모델들보다 일관되게 빠진 숫자를 더 잘 채웠습니다.
  2. 이미지: 얼굴 사진의 절반 픽셀이 검게 가려진 것과 같습니다. MO-ARM 은 얼굴의 빠진 부분을 '인페인팅 (채우기)'하여 다른 방법들보다 사람의 정체성과 구조를 더 잘 보존했습니다. 심지어 이미지의 98% 가 누락된 경우에도 그랬습니다.

요약

간단히 말해, 이 논문은 어떤 순서로든 학습할 수 있는 유연한 AI 모델을 가져와, 이 유연성이 빠진 데이터를 추측하는 데 자연스러운 전문가가 만든다는 점을 깨닫고, 데이터가 왜 결손되었는지 이해하도록 업그레이드합니다. 그 결과 시스템은 다음과 같은 능력을 갖게 됩니다:

  1. 다른 누구보다도 지저분하고 불완전한 데이터셋의 빈칸을 채워 넣습니다.
  2. 최소한의 노력으로 가장 유용한 정보를 얻기 위해 다음에 어떤 질문을 할지 결정합니다.

이는 융통성 없고 순서에 의존하는 AI 를 불확실성 하에서 추론하는 유연하고 탐정 같은 도구로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →