← 최신 논문
💻 computer science

How Class Imbalance Treatments Distort SHAP Attribution Fidelity: A Monte Carlo Investigation of Ranking and Magnitude Errors

포괄적인 몬테카를로 조사를 통해, 본 논문은 훈련 샘플 크기가 SHAP 기여도 충실도의 주요 동인인 반면, 일반적인 클래스 불균형 처리 방식은 흔히 특성 순위와 크기를 왜곡한다는 것을 입증하며, 이를 통해 저자들은 SHAP 해석 가능성이 우선순위인 경우 재샘플링 대신 클래스 가중치 부여 방식을 사용할 것을 권고한다.

원저자: Rıdvan Kara

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rıdvan Kara

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 범죄를 해결하려는 탐정이라고 상상해 보세요. 당신에게는 단서(데이터)를 살펴보고 누가 범인인지 알아내는 컴퓨터 조수(머신러닝 모델)가 있습니다. 컴퓨터를 신뢰하기 위해, 당신은 컴퓨터에게 왜 특정 용의자를 지목했는지 설명해 달라고 요청합니다. 컴퓨터는 "단서 A가 40%의 책임을 가졌고, 단서 B는 10%를 가졌습니다"와 같이 이유 목록을 제시합니다. 이 설명 도구를 SHAP이라고 부릅니다.

이제, 범죄가 매우 드문 경우를 상상해 보세요. 예를 들어, 100건 중 단 1건만이 범죄이고 나머지 99건은 무고한 사람들인 경우입니다. 이것을 **클래스 불균형(class imbalance)**이라고 합니다. "범죄" 사례가 너무 적기 때문에 컴퓨터는 혼란을 겪습니다. 이를 해결하기 위해, 데이터 과학자들은 컴퓨터에게 가르치기 전에 데이터를 "균형 있게" 만들려고 노력합니다. 그들은 다음과 같은 방법을 사용합니다:

  • 희귀한 범죄 사례를 복사해서 붙여넣기 (랜덤 오버샘플링, Random Oversampling).
  • 대부분의 무고한 사례를 버리기 (랜덤 언더샘플링, Random Undersampling).
  • 실제와 유사해 보이는 가짜 범죄 사례를 만들어내기 (SMOTE/ADASYN).
  • 데이터를 바꾸지 않고 컴퓨터에게 희귀한 범죄에 더 주의를 기울이라고 말하기 (클래스 가중치, Class Weighting).

이 논문이 던지는 핵심 질문은 이것입니다: 우리가 데이터를 균형 있게 맞출 때, 실수로 컴퓨터의 설명을 망가뜨리게 될까요? "가장 중요한 단서"의 목록이 그대로 유지될까요? 그 숫자들(예: "40%의 책임")은 여전히 정확할까요?

저자인 Rıdvan Kara는 (마치 실험 설정을 바꿔가며 실험을 14,000번 반복하는 것과 같은) 거대한 시뮬레이션을 실행하여 이를 알아냈습니다. 그는 다음의 쉬운 비유들을 사용하여 발견한 내용을 설명합니다.

1. 클래스의 크기가 해결책보다 더 중요하다

가장 중요한 발견은 데이터의 양이 어떤 균형 잡기 기술을 사용하는가보다 훨씬 더 중요하다는 점입니다.

  • 비유: 국물 맛을 맞추려고 노력한다고 상상해 보세요. 만약 당신에게 아주 작은 한 숟가락의 국물(작은 표본 크기)만 있다면, 그 한 숟가락에 소금을 넣든 설탕을 넣든 당신의 추측은 불안정할 것입니다. 하지만 거대한 솥에 담긴 국물(큰 표본 크기)이 있다면, 재료에 무엇을 했든 당신의 추측은 정확할 것입니다.
  • 결과: 컴퓨터에 입력하는 데이터의 양을 늘리는 것이 신뢰할 수 있는 설명을 얻는 가장 좋은 방법입니다. 균형 잡기 방법의 선택은 단순히 더 많은 데이터를 확보하는 것보다 약 3~5배 덜 중요합니다.

2. "순위" vs "크기"의 함정

논문은 두 가지 유형의 설명을 명확히 구분합니다:

  • 순위(Ranking): "누가 1순위 용의자인가?" (단서 A가 단서 B보다 더 중요한가?)
  • 크기(Magnitude): "단서 A가 얼마나 기여했는가?" (단서 A가 10% 기여했는가, 아니면 50% 기여했는가?)

연구 결과, 어떤 균형 잡기 기술은 순위를 맞추는 데는 뛰어나지만, **숫자(크기)**를 맞추는 데는 형편없다는 것을 발견했습니다.

  • 비유: 경주를 상상해 보세요.
    • 랜덤 오버샘플링(희귀 사례 복사 붙여넣기)은 우승해야 할 선수가 1등으로 들어오도록 확실히 만드는 코치와 같습니다(순위는 좋습니다). 하지만 그 코치는 우승자가 실제보다 두 배 더 빨리 달렸다고 모두에게 말합니다(크기가 부풀려지거나 틀립니다).
    • 랜덤 언더샘플링(데이터 버리기)은 팀원의 절반을 해고하는 코치와 같습니다. 이제 그들은 누가 최고의 러너인지조차 말할 수 없으며, 속도 숫자들도 완전히 망가집니다. 이 방식은 순위와 크기 모두에서 실패합니다.

3. 최선의 "아무것도 하지 않기"와 "부드러운" 해결책

가장 정직한 설명을 찾을 때, 논문은 데이터를 강제로 균형 있게 만들려 하지 않은 두 가지 승자를 찾아냈습니다:

  1. 재균형을 하지 않음 (No Rebalancing): 불균형한 데이터 그대로를 사용합니다.
  2. 클래스 가중치 (Class Weighting): 컴퓨터에게 "이봐, 희귀한 범죄는 중요하니까 여기에 더 주의를 기울여줘"라고 말하되, 데이터를 삭제하거나 복사하지는 않습니다.

이 두 방법은 "파레토 프런티어(Pareto frontier)"에 위치했습니다. 즉, 순위를 맞추는 것과 숫자를 정확하게 유지하는 것 둘 다에서 가장 뛰어났습니다. 이들은 "최소 침습적"인 처방입니다.

4. 합성 "가짜" 데이터의 문제

가짜 데이터를 만들어내는 방식(SMOTE 및 ADASYN)은 용의자의 순서를 맞추는 데는 괜찮았지만, 숫자는 망가뜨렸습니다.

  • 비유: 이는 사진의 빈 공간을 채우기 위해 가짜 얼굴을 그리는 예술가와 같습니다. 그 얼굴은 사람처럼 보이지만(순위는 괜찮음), 눈 사이의 거리를 측정하려고 하면 그 얼굴이 진짜가 아니기 때문에 측정값이 틀리게 됩니다.

5. "극도의 희귀성" 위험 지대

논문은 이러한 문제들이 범죄가 극도로 드물고(5% 미만) 데이터가 매우 적을 때 훨씬 더 심각해진다는 것을 발견했습니다.

  • 비유: 건초더미에서 바늘을 찾으려고 하는데, 당신에게 볼 수 있는 건초가 아주 조금뿐이라면, 그 건초를 균형 있게 만들기 위해 어떤 기술을 써도 바늘을 놓치거나 바늘의 크기를 잘못 짐작할 가능성이 높습니다. 하지만 건초더미 전체가 있다면, 당신은 바늘을 쉽게 찾을 수 있고, 기술들이 크게 중요해지지 않습니다.

권장 사항 요약

만약 당신이 (의학적 진단이나 신용 점수 산정처럼) 결정을 설명하는 AI를 사용하고 있고 데이터가 불균형하다면:

  1. 먼저 더 많은 데이터를 확보하세요. 이것이 가장 강력한 도구입니다.
  2. 정확한 숫자가 필요하다면 데이터를 복사해서 붙여넣거나 버리지 마세요. 이러한 방법들은 설명의 "얼마나(how much)" 부분을 왜곡합니다.
  3. 만약 반드시 균형을 맞춰야 한다면, 클래스 가중치(모델이 더 신경 쓰도록 함)를 사용하거나, 그냥 데이터를 있는 그대로 두세요. 이 방법들이 설명을 정직하게 유지합니다.
  4. 순위와 숫자를 모두 확인하세요. 어떤 특징이 1위인지만 보지 말고, 기여 퍼센트가 타당한지 확인하세요. 어떤 방법들은 숫자에 자신의 실수를 숨기기도 하기 때문입니다.

논문은 데이터의 균형을 맞추는 것이 컴퓨터의 예측을 돕기는 하지만, 종종 컴퓨터가 스스로를 설명하는 능력을 망가뜨린다고 결론짓습니다. 신뢰할 수 있는 설명이 필요하다면, 가장 완만한 접근법(클래스 가중치)이나 아예 아무것도 하지 않는 것이 대개 가장 좋은 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →