← 최신 논문
🤖 machine learning

The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World

이 논문은 사회적 맥락에서 데이터 생성 확률 분포의 존재를 가정하는 것이 해롭고 오해의 소지가 있으므로, 이를 버리고 실제 관련 모집단에 초점을 맞추는 대안적 프레임워크를 채택할 것을 주장합니다.

원저자: Benedikt Höltgen, Robert C. Williamson

게시일 2026-04-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Benedikt Höltgen, Robert C. Williamson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎲 1. 주사위와 사람: 왜 같은 원리가 통하지 않을까?

우리는 머신러닝을 배울 때, **"데이터는 어떤 보이지 않는 '진짜 확률 분포'라는 큰 그릇에서 뽑아낸 샘플이다"**라고 배웁니다. 마치 주사위를 던질 때 '1 이 나올 확률은 1/6'이라는 진짜 규칙이 존재하는 것처럼 말이죠.

  • 주사위 (도박): 주사위는 기계적이고 변하지 않습니다. 공장에서 똑같이 만들어졌고, 던지는 방식만 같다면 결과는 항상 일정합니다. 여기서 '진짜 확률'이라는 개념은 유용합니다.
  • 사람 (사회): 하지만 사람은 주사위가 아닙니다. 사람은 매일 변하고, 상황에 따라 다르게 행동하며, 과거의 데이터가 미래에도 똑같이 반복된다는 보장이 없습니다.

저자들은 **"사람을 대상으로 할 때, 마치 주사위처럼 고정된 '진짜 확률'이 존재한다고 믿는 것은 착각"**이라고 말합니다. 우리는 그 '진짜 규칙'을 발견하는 것이 아니라, 우리가 만든 데이터와 모델을 통해 인위적으로 확률을 만들어내는 것입니다.

🧩 2. 퍼즐 조각을 어떻게 맞추느냐에 따라 그림이 달라진다 (추상화의 함정)

머신러닝 모델은 사람을 예측할 때, 사람을 몇 가지 특징 (나이, 성별, 소득 등) 으로 요약합니다. 이를 '추상화'라고 합니다.

  • 비유: 사람을 예측할 때, 우리는 마치 거대한 퍼즐을 맞추는 것과 같습니다.
    • "이 사람은 30 대 남성이고, 고소득자다"라고만 본다면, 이 사람은 '고소득 30 대 남성'이라는 퍼즐 조각 하나입니다.
    • 하지만 여기에 "이 사람은 흡연자다", "이 사람은 특정 지역에 산다"는 조각을 더 붙이면, 그 사람의 모습은 완전히 달라집니다.

논문은 **"어떤 특징 (조각) 을 선택하느냐에 따라 예측 결과가 완전히 달라진다"**고 지적합니다. 그런데 기존의 머신러닝 이론은 "어떤 특징을 쓰든, 그 뒤에 숨겨진 '진짜 확률'을 찾아내는 것"이라고 말합니다. 이는 마치 **"어떤 조각을 쓰든 최종 완성된 그림은 하나뿐이다"**라고 믿는 것과 같습니다. 하지만 실제로는 조각을 어떻게 고르느냐에 따라 완성된 그림 (예측 결과) 이 천차만별입니다.

🎭 3. "객관성"이라는 가면 (가장 위험한 부분)

가장 큰 문제는, 이 '진짜 확률'이라는 개념이 인공지능을 객관적이고 과학적인 것처럼 보이게 만든다는 점입니다.

  • 상황: 고용 기관이 "이 지원자는 구직 성공 확률이 80% 입니다"라고 말합니다.
  • 착각: 사람들은 "아, 이건 데이터가 말해주는 진짜 사실이구나"라고 생각합니다. 마치 주사위 확률처럼 변하지 않는 진리인 것처럼요.
  • 현실: 그 80% 는 연구자가 "어떤 데이터를 모았는지", "어떤 특징을 중요하게 봤는지", "어떤 모델을 선택했는지"에 따라 인위적으로 계산된 숫자일 뿐입니다.

저자들은 이 '객관성'이라는 가면이 책임 회피를 부추긴다고 말합니다. "우리는 그냥 데이터가 말하는 대로 했을 뿐, 진짜 확률을 찾아낸 것뿐"이라고 말하며, 모델이 만든 편견이나 실수에 대한 책임을 회피하는 것입니다.

🛠 4. 우리가 해야 할 일: '진짜 규칙 찾기'가 아닌 '좋은 도구 만들기'

이 논문은 머신러닝의 목표를 바꿔야 한다고 제안합니다.

  • 기존 생각: "우리는 세상에 숨겨진 **진짜 확률 분포 (진리)**를 찾아내야 한다."
  • 새로운 생각: "우리는 특정 목적에 맞춰 가장 잘 작동하는 도구를 만들어야 한다."

비유:

  • 기존: 우리는 바다에 숨겨진 보물 (진짜 확률) 을 찾아야 한다.
  • 새로운 생각: 우리는 배를 타고 가고 싶은 곳 (사회적 목표) 으로 안전하게 도달할 수 있는 최고의 항해 도구를 만들어야 한다.

이렇게 생각하면, "왜 이 모델을 선택했는가?", "어떤 데이터를 기준으로 했는가?"에 대한 명확한 설명과 책임이 따라오게 됩니다.

💡 요약: 이 논문이 우리에게 주는 메시지

  1. 사람은 주사위가 아니다: 사회 현상에는 고정된 '진짜 확률'이 없습니다.
  2. 모델은 발견이 아닌 창조입니다: 우리가 만든 데이터와 선택에 따라 확률이 만들어집니다.
  3. 객관성은 환상입니다: "데이터가 말해주니까"라고 말하며 책임을 회피하지 마세요.
  4. 목표를 다시 생각하세요: '진짜 답'을 찾는 게 아니라, '우리가 원하는 좋은 결과'를 내는 모델을 만드는 데 집중하세요.

결론적으로, 우리는 인공지능을 마법 같은 객관적 진리가 아니라, 우리가 만든 선택과 가치관이 담긴 도구로 바라보고, 그 선택에 대해 더 투명하게 논의해야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →