The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World
이 논문은 사회적 맥락에서 데이터 생성 확률 분포의 존재를 가정하는 것이 해롭고 오해의 소지가 있으므로, 이를 버리고 실제 관련 모집단에 초점을 맞추는 대안적 프레임워크를 채택할 것을 주장합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎲 1. 주사위와 사람: 왜 같은 원리가 통하지 않을까?
우리는 머신러닝을 배울 때, **"데이터는 어떤 보이지 않는 '진짜 확률 분포'라는 큰 그릇에서 뽑아낸 샘플이다"**라고 배웁니다. 마치 주사위를 던질 때 '1 이 나올 확률은 1/6'이라는 진짜 규칙이 존재하는 것처럼 말이죠.
- 주사위 (도박): 주사위는 기계적이고 변하지 않습니다. 공장에서 똑같이 만들어졌고, 던지는 방식만 같다면 결과는 항상 일정합니다. 여기서 '진짜 확률'이라는 개념은 유용합니다.
- 사람 (사회): 하지만 사람은 주사위가 아닙니다. 사람은 매일 변하고, 상황에 따라 다르게 행동하며, 과거의 데이터가 미래에도 똑같이 반복된다는 보장이 없습니다.
저자들은 **"사람을 대상으로 할 때, 마치 주사위처럼 고정된 '진짜 확률'이 존재한다고 믿는 것은 착각"**이라고 말합니다. 우리는 그 '진짜 규칙'을 발견하는 것이 아니라, 우리가 만든 데이터와 모델을 통해 인위적으로 확률을 만들어내는 것입니다.
🧩 2. 퍼즐 조각을 어떻게 맞추느냐에 따라 그림이 달라진다 (추상화의 함정)
머신러닝 모델은 사람을 예측할 때, 사람을 몇 가지 특징 (나이, 성별, 소득 등) 으로 요약합니다. 이를 '추상화'라고 합니다.
- 비유: 사람을 예측할 때, 우리는 마치 거대한 퍼즐을 맞추는 것과 같습니다.
- "이 사람은 30 대 남성이고, 고소득자다"라고만 본다면, 이 사람은 '고소득 30 대 남성'이라는 퍼즐 조각 하나입니다.
- 하지만 여기에 "이 사람은 흡연자다", "이 사람은 특정 지역에 산다"는 조각을 더 붙이면, 그 사람의 모습은 완전히 달라집니다.
논문은 **"어떤 특징 (조각) 을 선택하느냐에 따라 예측 결과가 완전히 달라진다"**고 지적합니다. 그런데 기존의 머신러닝 이론은 "어떤 특징을 쓰든, 그 뒤에 숨겨진 '진짜 확률'을 찾아내는 것"이라고 말합니다. 이는 마치 **"어떤 조각을 쓰든 최종 완성된 그림은 하나뿐이다"**라고 믿는 것과 같습니다. 하지만 실제로는 조각을 어떻게 고르느냐에 따라 완성된 그림 (예측 결과) 이 천차만별입니다.
🎭 3. "객관성"이라는 가면 (가장 위험한 부분)
가장 큰 문제는, 이 '진짜 확률'이라는 개념이 인공지능을 객관적이고 과학적인 것처럼 보이게 만든다는 점입니다.
- 상황: 고용 기관이 "이 지원자는 구직 성공 확률이 80% 입니다"라고 말합니다.
- 착각: 사람들은 "아, 이건 데이터가 말해주는 진짜 사실이구나"라고 생각합니다. 마치 주사위 확률처럼 변하지 않는 진리인 것처럼요.
- 현실: 그 80% 는 연구자가 "어떤 데이터를 모았는지", "어떤 특징을 중요하게 봤는지", "어떤 모델을 선택했는지"에 따라 인위적으로 계산된 숫자일 뿐입니다.
저자들은 이 '객관성'이라는 가면이 책임 회피를 부추긴다고 말합니다. "우리는 그냥 데이터가 말하는 대로 했을 뿐, 진짜 확률을 찾아낸 것뿐"이라고 말하며, 모델이 만든 편견이나 실수에 대한 책임을 회피하는 것입니다.
🛠 4. 우리가 해야 할 일: '진짜 규칙 찾기'가 아닌 '좋은 도구 만들기'
이 논문은 머신러닝의 목표를 바꿔야 한다고 제안합니다.
- 기존 생각: "우리는 세상에 숨겨진 **진짜 확률 분포 (진리)**를 찾아내야 한다."
- 새로운 생각: "우리는 특정 목적에 맞춰 가장 잘 작동하는 도구를 만들어야 한다."
비유:
- 기존: 우리는 바다에 숨겨진 보물 (진짜 확률) 을 찾아야 한다.
- 새로운 생각: 우리는 배를 타고 가고 싶은 곳 (사회적 목표) 으로 안전하게 도달할 수 있는 최고의 항해 도구를 만들어야 한다.
이렇게 생각하면, "왜 이 모델을 선택했는가?", "어떤 데이터를 기준으로 했는가?"에 대한 명확한 설명과 책임이 따라오게 됩니다.
💡 요약: 이 논문이 우리에게 주는 메시지
- 사람은 주사위가 아니다: 사회 현상에는 고정된 '진짜 확률'이 없습니다.
- 모델은 발견이 아닌 창조입니다: 우리가 만든 데이터와 선택에 따라 확률이 만들어집니다.
- 객관성은 환상입니다: "데이터가 말해주니까"라고 말하며 책임을 회피하지 마세요.
- 목표를 다시 생각하세요: '진짜 답'을 찾는 게 아니라, '우리가 원하는 좋은 결과'를 내는 모델을 만드는 데 집중하세요.
결론적으로, 우리는 인공지능을 마법 같은 객관적 진리가 아니라, 우리가 만든 선택과 가치관이 담긴 도구로 바라보고, 그 선택에 대해 더 투명하게 논의해야 한다고 말합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.