← 최신 논문
📊 statistics

An integration of decision trees into latent class modeling with covariates

본 논문은 복잡한 상호작용과 오설정 문제로 어려움을 겪는 전통적인 로지스틱 모델에 대한 해석 가능한 대안으로서, 의사결정나무를 잠재 계층 분석에 통합하여 공변량이 계층 구성에 미치는 효과를 모델링하는 새로운 방법론을 제안한다.

원저자: Johan Lyrvall, Felix Clouth

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Johan Lyrvall, Felix Clouth

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

숨겨진 집단과 복잡한 지도

당신이 단 한 명의 범인을 찾는 대신, 비슷한 방식으로 행동하는 숨겨진 집단을 찾아내려는 탐정이라고 상상해 보십시오. 통계학의 세계에서 이것은 **잠재 계층 분석(Latent Class Analysis)**이라고 불립니다. 이것을 마치 데이터 더미(예를 들어 건강이나 습관에 대한 설문 답변)를 들여다보는 마법 돋보기라고 생각하십시오. 이 돋보기는 "아하! 이 사람들은 그냥 무작위가 아니야. 이들은 '고위험' 클럽에 속해 있고, 저 사람들은 '저위험' 클럽에 속해 있구나"라고 말해줍니다. 이러한 클럽들은 "잠재적"입니다. 즉, 직접 볼 수는 없으며, 오직 그들을 가리키는 단서(데이터)만을 볼 수 있다는 뜻입니다.

하지만 까다로운 점이 있습니다. 일단 이 숨겨진 클럽을 찾고 나면, 왜 어떤 사람이 다른 클럽이 아닌 특정 클로에 속하게 되었는지 알고 싶어질 것입니다. 나이가 많아서일까요? 흡연을 해서일까요? 아니면 운동을 해서일까요? 보통 과학자들은 이 질문에 답하기 위해 **로지스틱 모델(logistic model)**이라는 표준 도구를 사용합니다. 이 도구를 곧고 딱딱한 자라고 상상해 보십시오. 그것은 나이, 흡연, 운동의 효과를 더하여 직선으로 측정하려고 시도합니다. 세상이 단순하다면 이 방식은 훌륭하게 작동하겠지만, 실제 삶은 복잡합니다. 때로는 나이가 드는 것이 흡연을 할 때만 문제가 되기도 합니다. 때로는 활동적인 것이 젊을 때만 도움이 되기도 합니다. 이것들을 "상호작용(interactions)"이라고 부르는데, 이를 억지로 직선 형태의 자에 맞추려 하면 자가 부러지거나 수학적 계산이 너무 복잡해져 아무도 그 결과를 이해할 수 없게 됩니다. 이것이 바로 요한 리르발(Johan Lyrvall)과 펠릭스 클루스(Felix Clouth)가 해결하고자 했던 퍼즐입니다.

데이터 속에서 자라나는 나무

새로운 논문에서 리르발과 클루스는 영리한 변화를 제안합니다. 어떤 사람이 어떤 숨겨진 집단에 속할지 예측하기 위해 곧은 자를 사용하는 대신, **의사결정 나무(decision tree)**를 사용하자는 것입니다. 여러분은 아마도 "당신의 모험을 선택하세요" 식의 책이나 비디오 게임에서 이런 것을 본 적이 있을 것입니다. 당신은 맨 위에서 시작하여 질문을 던집니다: "캐릭터가 60세 이상인가?" 만약 그렇다면 오른쪽으로 가고, 아니라면 왼쪽으로 갑니다. 그다음에는 도착한 위치에 따라 다음 질문을 던집니다. 이것은 최종 답변으로 이어지는 단계별 경로입니다.

저자들은 잠재 계층 분석 내부에 직접 이런 종류의 나무를 구축할 것을 제안합니다. 나이, 성별, 습관의 복잡한 조합을 추측하는 대신, 컴퓨터는 데이터를 살펴보고 "어떤 단 하나의 질문이 그룹을 가장 잘 나누는가?"라고 묻습니다. 컴퓨터는 "나이"가 가장 중요한 첫 번째 질문임을 찾아낼 수도 있습니다. 그다음 "60세 미만" 그룹에 대해서는 "활동적인가?"를 물을 수 있습니다. "60세 이상" 그룹에 대해서는 "흡연을 하는가?"를 물을 수 있습니다. 이는 수천 개의 복잡한 수학 공식을 써 내려갈 필요 없이, 자연스럽게 그러한 복잡한 상호작용을 처리하는 지도를 만들어냅니다.

연구진은 4,546명의 미국 성인을 대상으로 한 실제 건강 데이터를 사용하여 이 아이디어를 테스트했습니다. 그들은 누가 "건강이 나쁜" 그룹에 속하고 누가 "건강이 좋은" 그룹에 속할지 예측할 수 있는지 확인하고 싶었습니다. 먼저, 그들은 8가지 서로 다른 건강 문제(천식, 심장병 또는 고혈압 등)를 바탕으로 두 가지 건강 그룹을 정의하기 위해 표준적인 방법을 사용했습니다. 그 결과 63%의 사람들이 "건강이 좋은" 그룹에, 37%가 "건강이 나쁜" 그룹에 속해 있음을 발견했습니다.

그다음, 새로운 의사결정 나무를 성장시켰습니다. 나무는 "그 사람이 60세 이상인가?"라는 질문으로 시작했습니다. 이것이 최선의 분기점이었습니다.

  • 60세 미만인 경우: 나무는 "활동적인가?"라고 물었습니다. 만약 활동적이라면, "건강이 나쁜" 그룹에 속할 확률은 10%에 불과했습니다. 만약 비활동적이라면, 그 확률은 17%로 뛰었습니다.
  • 60세 이상인 경우: 나무는 더 구체적이 되었습니다. 만약 활동적이라면, 건강이 나쁠 확률은 73%였습니다. 하지만 비활동적이라면, 성별과 흡연 습관에 달려 있었습니다. 비활동적인 고령 여성의 위험도가 85%로 가장 높았습니다. 비활동적인 고령 남성의 경우, 나무는 다시 갈라졌습니다. 만약 그들이 흡연을 한다면 위험도는 78%였고, 흡연을 하지 않는다면 63%였습니다.

저자들은 이 나무 구조가 전통적인 수학 공식보다 훨씬 읽기 쉽고 이해하기 쉽다는 것을 발견했습니다. 그것은 서로 다른 요인들이 어떻게 결합하여 확률을 변화시키는지 정확하게 보여주었습니다. 예를 들어, 이 나무는 고령 남성의 경우 흡연이 오히려 비흡연자에 비해 "건강이 나쁜" 그룹에 속할 위험을 낮추는 것과 관련이 있다는 것을 드러냈습니다. 저자들은 이것이 이상하게 들릴 수 있지만, "생존자 편향(survivor bias)"(아마도 건강한 흡연자들만이 노년까지 살아남았을 가능성) 때문이거나, 일부 사람들이 괜찮다고 느껴서 끊을 이유를 찾지 못하는 것일 수 있다고 언급했습니다.

이 논문은 이 접근 방식이 강력한 새로운 도구임을 시사합니다. 이 방식은 어떤 이상한 새로운 가정을 요구하지 않습니다. 통계학자들이 이미 신뢰하는 표준 수학 도구들을 사용하되, 그것들을 나무 모양으로 배열할 뿐입니다. 저자들은 현재 버전이 "예/아니오" 질문(이진 데이터)과 같은 단순한 데이터(예: "60세 이상인가?" 또는 "흡연을 하는가?")에 가장 잘 작동한다고 인정합니다. 그들은 향후 연구에서 "정확한 나이는?" 또는 "수입은 얼마인가?"와 같은 더 복잡한 질문들을 어떻게 다룰지 결정해야 할 것이라고 제안합니다.

또한 그들은 이 나무를 구축하는 것이 마치 산을 한 걸음씩 오르는 것과 같다고 경고합니다. 컴퓨터는 전체 여정에서 가장 좋은 경로를 찾는 것이 아니라, 현재 위치에서 가장 좋은 다음 단계를 선택합니다. 이것은 의사결정 나무의 일반적인 특징이지, 그들이 새로 만든 문제가 아닙니다. 나무가 단순히 데이터를 암기하는 것(과적합(overfitting)이라 불리는 문제)을 방지하기 위해, 그들은 두 가지 방식으로 나무를 다듬는 테스트를 했습니다. 하나는 분기가 통계적으로 유의미한지(단순히 운이 아닌지)에 기반한 것이었고, 다른 하나는 모델이 얼마나 잘 맞는지와 얼마나 단순한지를 균형 있게 조절하는 BIC라는 점수에 기반한 것이었습니다.

요약하자면, 이 논문은 우리가 어떤 숨겨진 집단에 속하게 되는지를 결정하는 요인들의 복잡한 그물망을 헤쳐 나가는 데 의사결정 나무가 안내하도록 하는 방법을 제안합니다. 이것은 혼란스러운 상호작용의 엉킴을 명확하고 단계적인 경로로 바꾸어 놓아, 연구자들이 데이터 속에 숨겨진 이야기를 더 쉽게 볼 수 있게 해줍니다. 비록 이것은 여전히 테스트와 확장이 필요한 새로운 아이디어이지만, 우리의 삶과 습관이 우리가 속하게 되는 집단을 어떻게 형성하는지를 바라보는 신선하고 직관적인 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →