← 최신 논문
📊 statistics

Unbiased mixed variables distance

본 논문은 변수 유형과 척도의 차이로 인해 발생하는 기존 혼합 변수 거리 측정법의 편향 문제를 다루기 위해, 이러한 편향을 정량화하기 위한 관련 개념들을 정의하고 개별 변수의 기여도가 측정 유형이나 단위에 독립적인 무편향 거리를 구축하기 위한 일반적인 공식을 제안한다.

원저자: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 두 사람의 차이가 얼마나 큰지 측정하려고 한다고 상상해 보십시오. 당신에게는 키(숫자), 좋아하는 색깔(범주), 나이(숫자), 직업명(범주)이라는 특성 목록이 있습니다.

데이터 과학의 세계에서 이것은 "혼합 변수(mixed variable)" 문제라고 불립니다. 당신은 이 '차이'라는 하나의 과일 샐러드를 만들기 위해 사과(숫자)와 오렌지(범주)를 섞으려 하고 있습니다.

Van de Velden과 동료들의 논문은 이러한 과일 샐러드를 만드는 기존의 레시피들이 편향되어 있다고 주장합니다. 이러한 방식은 단순히 측정 방식 때문에, 실제 그 특성이 얼마나 중요한지와 상관없이, 오렌지의 맛을 훨씬 강하게 만들거나 반대로 사과의 맛을 약하게 만듭니다.

다음은 그들의 주장과 해결책에 대한 간단한 요약입니다.

1. 문제점: "볼륨 조절기"가 고장 났다

우리가 두 사람 사이의 "거리"를 계산할 때, 보통 모든 특성의 차이를 모두 더합니다.

  • 문제점: 만약 키를 미터(m)로 측정하면 차이는 0.5가 될 수 있습니다. 하지만 밀리미터(mm)로 측정하면 차이는 500이 됩니다. 또한 직업명이 50가지 옵션이 있다면, 직업 간의 "거리"는 색상이 3가지 옵션만 있을 때보다 훨씬 클 수 있습니다.
  • 편향: 이 논문은 기존의 방식들(유명한 '거한의 거리(Gower's distance)' 등)이 범주형 변수(직업명이나 색상 등)의 볼륨을 높이고, 수치형 변수(키나 연봉 등)의 볼륨을 낮추는 실수를 저지른다는 것을 보여줍니다. 이는 마치 마이크 설정 때문에 속삭임을 외침과 비교하려는 것과 같습니다. 결과는 진정한 차이의 척도가 아니라, 데이터가 어떻게 포맷되었는지를 나타내는 척도가 되어 버립니다.

2. 공정한 혼합을 위한 두 가지 규칙

이를 해결하기 위해 저자들은 "공정한" 거리 계산기를 위한 두 가지 규칙을 제안합니다.

  • 규칙 #1: 가산성 (부분의 합)
    상상해 보십시오. 당신이 블록으로 탑을 쌓고 있습니다. 탑의 전체 높이는 개별 블록들의 높이를 단순히 합한 것이어야 합니다. 이 논문은 두 사람 사이의 총 "거리"가 각 특정 특성의 차이를 단순히 합한 것이어야 한다고 강조합니다. 각 블록이 차지하는 비중을 변화시키는 복잡한 제곱근이나 숨겨진 수학적 기교 없이 말입니다.

  • 규칙 #2: 공통 척도성 (사과와 사과를 비교하는 규칙)
    이것이 가장 중요한 부분입니다. "공통 척도성(Commensurability)"이란 "동일한 척도로 측정 가능하다"는 뜻입니다.

    • 비유: 당신이 고지서를 납부한다고 상상해 보십시오. 당신에게는 동전 더미와 달러 지폐 더미가 있습니다. 만약 당신이 동전과 지폐의 개수를 달러로 변환하지 않고 그냥 숫자만 센다면, 동전들이 달러보다 훨씬 더 중요하게 느껴질 것입니다.
    • 해결책: 모든 것을 표준 단위(예: "평균 차이")로 변환해야 합니다. 이 논문은 평균적으로 모든 변수(숫자든 범주든)가 전체 거리에 동일한 양을 기여해야 한다고 요구합니다. 만약 직업명이 50개의 옵션을 가지고 있다면, 단순히 "다름 = 1"이라고 세어서는 안 됩니다. 우리는 이 직업명의 "가중치"가 키의 차이와 일치하도록 수학적으로 조정해야 합니다.

3. 해결책: "공정성 가중치"

저자들은 이를 수정하기 위한 일반적인 공식을 제공합니다. 이것을 스마트한 저울이라고 생각하십시오.

  • 작동 방식: 차이를 모두 더하기 전에, 저울은 모든 변수를 살펴봅니다. 그리고 묻습니다: "평균적으로 이 변수는 보통 얼마나 변하는가?"
  • 조정: 만약 어떤 변수가 보통 많이 변한다면(예: 50개의 옵션이 있는 직업명), 저울은 그 변수에 아주 작은 가중치를 둡니다. 만약 어떤 변수가 보통 거의 변하지 않는다면(예: 3개의 옵션이 있는 색상), 저울은 그 변수에 무거운 가중치를 둡니다.
  • 결과: 마지막으로 이들을 모두 더할 때, 모든 변수는 동등한 발언권을 갖게 됩니다. 이제 거리는 "편향되지 않습니다." 데이터가 숫자이든 단어이든, 수학은 그것들이 최종 점수에 동등하게 기여하도록 보장합니다.

4. 이론 검증

저자들은 단순히 이론만 제시한 것이 아니라, 이를 테스트했습니다.

  • 시뮬레이션: 그들은 숨겨진 "진정한" 패턴(예: 비밀스러운 모양)을 가진 가짜 데이터를 만들었습니다. 그런 다음 다양한 거리 측정법을 사용하여 그 모양을 찾아내려고 시도했습니다.
    • 기존의 편향된 방법들은 범주형 변수(직업명)에 너무 정신이 팔려 모양을 잘못 찾아냈습니다.
    • 새로운 "편향되지 않은" 방법들은 모든 변수를 공정하게 다루었기 때문에 비밀스러운 모양을 훨씬 더 정확하게 찾아냈습니다.
  • 실제 세계 테스트: 그들은 2021년 FIFA 축구 선수 데이터를 사용했습니다. 그들은 키, 몸무ك, 포지션 등을 살펴보았습니다. 그들은 기존 방식들이 "포지션" 변수가 결과를 지배하게 만든 반면, 자신들의 새로운 방법은 포지션의 영향력을 키나 몸무게 같은 신체적 통계와 균형을 맞춘다는 것을 보여주었습니다.

결론

이 논문은 우리가 숫자와 범주를 섞을 때, 실제 데이터 자체가 아니라 데이터의 유형이 결과를 결정하도록 실수하는 경우가 많다고 결론짓습니다.

그들의 해결책은 수준을 맞추는 경기장(leveling field) 역할을 하는 새로운 거리 계산 방식입니다. 이는 당신이 사람의 연봉을 비교하든 좋아하는 스포츠를 비교하든, 측정 방식 때문에 어느 한쪽이 비교를 독점하는 "특혜"를 받지 않도록 보장합니다. 이를 통해 연구자들에게 데이터를 그룹화하거나 시각화할 때 훨씬 더 정직한 출발점을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →