← 최신 논문
🤖 AI

Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

이 논문은 사회과학 텍스트 분류에서 나타나는 소규모 표본 크기 및 중첩 데이터와 같은 조건 하에서 분류기 성능 지표에 대한 신뢰 구간 방법론을 평가하며, 표준적인 접근 방식들이 종종 부정확한 커버리지를 산출함을 입증하는 동시에 머신러닝 응용 분야의 투명성과 검증을 개선하기 위해 Agresti-Coull, Wilson, 그리고 계층적 부트스트래핑과 같은 우수한 대안들을 권고한다.

원저자: Kylie Anglin

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kylie Anglin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 '완벽한 초콜릿 케이크' 레시피를 발명한 요리사라고 상상해 보세요. 당신은 이 케이크가 얼마나 맛있는지 세상에 알리고 싶습니다. 단순히 "이것은 90% 맛있습니다"라고 말하는 것이 아니라, 그것을 증명해야 합니다. 그래서 당신은 20명을 초대해 맛을 보게 합니다. 그중 18명이 "네, 정말 맛있어요!"라고 말합니다.

컴퓨터 과학과 거대 언어 모델(LLM)의 세계에서, 연구자들이 하는 일이 바로 이것입니다. 그들은 컴퓨터가 텍스트를 읽고 이를 카테고리(예: "화남", "행복함", 또는 "스팸")로 분류하도록 훈련합니다. 자신의 컴퓨터가 똑똑하다는 것을 증명하기 위해, 그들은 이미 인간이 등급을 매긴 텍스트 샘플을 보여주고, "재현율(Recall)"(예: "화남"이라는 텍스트를 컴퓨터가 얼마나 많이 찾아냈는가?)과 같은 점수를 계산합니다.

문제점: 신뢰도의 "추측 게임"
이 논문은 연구자들이 현재 위험한 "추측 게임"을 하고 있다고 주장합니다. 그들은 점수(예: "정확도 90%!")를 보고하지만, 그 숫자에 대해 얼마나 확신하는지는 거의 보고하지 않습니다.

이것은 일기 예보와 같습니다. 기상 캐스터가 "비가 올 확률이 90%입니다"라고 말한다면 유용할 것입니다. 하지만 만약 그들이 위성 이미지에 근거한 것인지 아니면 단순한 추측인지 알려주지 않은 채 그냥 "비가 올 것입니다"라고만 말한다면, 당신은 그들을 믿을 수 없습니다.

이 논문에서 저자 카일리 앵글린(Kylie Anglin)은 연구자들이 컴퓨터를 테스트하기 위해 소규모 집단을 사용하거나, 찾고자 하는 "비"(특정 텍스트)가 매우 희귀할 때, 기존의 방식들(이를 **신뢰 구간(Confidence Intervals)**이라고 부릅니다)이 자주 무너진다고 말합니다. 이 방식들은 마치 예측 불가능하게 줄어들거나 늘어나는 자와 같습니다.

"망가진 자" (기존 방법들)
논문은 확실성을 측정하는 여러 방법을 테스트합니다. 논문은 오늘날 가장 흔히 사용되는 두 가지 방법이 마치 고무로 만든 자와 같다는 것을 발견했습니다.

  1. 월드 구간(Wald Interval): 이것은 "교과서적인" 방법입니다. 아주 큰 군중과 평균적인 결과가 있다면 잘 작동합니다. 하지만 소규모 집단이거나 매우 높은 점수(예: 95%)를 가질 경우, 이 자는 너무 많이 줄어듭니다. 실제 점수는 80%에서 100% 사이 어디에나 있을 수 있는데도, 이 방법은 "우리는 점수가 94%에서 96% 사이일 것이라고 95% 확신합니다"라고 말하며 과도한 정밀함을 제공합니다. 이는 잘못된 정밀감을 줍니다.
  2. 기본 부트스트랩(Basic Bootstrap): 이것은 컴퓨터를 통해 실험을 수천 번 시뮬레이션하여 어떤 일이 일어나는지 살펴보는 방법입니다. 논문은 표준 버전이 또한 "흔들리기" 쉬우며, 특히 작은 집단에서는 위험을 과소평가하는 경우가 많다는 것을 발견했습니다.

"더 나은 자" (새로운 권장 사항)
논문은 그 고무 자들을 덜 늘어나는 더 튼튼한 자로 교체할 것을 제_안합니다.

  • 독립적인 텍스트의 경우 ( "솔로" 테스트): 모든 텍스트가 서로 다른 사람으로부터 온 완전히 고유한 것이라면, 저자는 애그레스티-쿨(Agresti-Coull) 방법을 사용할 것을 권장합니다. 이것은 계산에 약간의 "안전 패딩"을 추가하는 것과 같습니다. 계산하기 쉽고 간단하며, 자가 너무 많이 줄어드는 것을 막아줍니다.
  • 까다로운 지표의 경우 (예: F1 점수): F1 점수와 같이 다양한 요소들의 복잡한 조합인 점수들이 있습니다. 이런 경우에는 단순한 공식을 사용할 수 없습니다. 저자는 **의사-계수 정규화(Pseudo-Count Regularization)**라는 새로운 기술을 제안합니다. 당신이 케이크를 굽고 있는데 재료가 부족할까 봐 걱정된다고 상상해 보세요. 시작하기 전에 혼합물에 "유령 재료"(가짜 달걀 하나와 가짜 밀가루 한 컵)를 추가합니다. 이 방법은 최종 결과가 실제 재료가 몇 개 없을 때 무너지지 않도록 레시피를 안정화합니다. 이 방법은 컴퓨터 시뮬레이션을 훨씬 더 신뢰할 수 있게 만듭니다.

"에코 체임버" 문제 (중첩된 데이터)
여기서 상황이 까다로워집니다. 현실 세계에서 사람들은 단 하나의 문장만 쓰는 것이 아닙니다. 상담사는 30개의 노트를 작성할 수 있고, 학생은 20개의 에세이를 쓸 수 있습니다. 이러한 텍스트들은 사람 안에 "중첩(nested)"되어 있습니다. 이들은 독립적이지 않습니다. 그들은 동일한 목소리, 스타일, 그리고 특성을 공유합니다.

만약 당신이 한 사람의 노트 30개를 서로 다른 30명의 사람으로부터 온 30개의 텍스트인 것처럼 취급한다면, 그것은 속임수입니다. 당신은 실제 가진 데이터보다 더 많은 데이터를 가진 것처럼 스스로를 속이는 것입니다. 그것은 마치 한 친구에게 케이크를 30번 맛보게 하고, 그것을 30개의 서로 다른 의견으로 계산하는 것과 같습니다. 당신은 30개의 의견을 얻은 것이 아니라, 하나의 의견이 30번 반복된 것을 얻은 것입니다.

이 "에코 체임버" 효과를 무시하면 다음과 같은 일이 발생합니다.

  • 신뢰 구간이 너무 좁아집니다. 당신은 95% 확신한다고 생각하지만, 실제로는 65%만 확신하고 있을 수 있습니다.
  • 해결책: 논문은 이를 해결하기 위한 두 가지 주요 방법을 제 제안합니다.
    1. 수식 조정: 텍스트들이 서로 연관되어 있다는 점을 고려하여 "유효 표본 크기"를 줄이는 공식을 사용합니다. 이것은 "우리는 30개의 노트를 가지고 있지만, 모두 동일한 사람으로부터 온 것이기 때문에 독립적인 의견은 10개로 간야 한다"라고 말하는 것과 같습니다.
    2. 계층적 부트스트랩(Hierarchical Bootstrap): 컴퓨터 시뮬레이션에서 개별 노트를 단순히 섞는 대신, 먼저 사람을 섞은 다음 그 안의 노드들을 섞습니다. 이는 노트가 특정 사람에게 속해 있다는 사실을 존중하는 방식입니다.

핵심 요약
이 논문의 핵심 메시지는 보고의 정직함에 대한 촉구입니다.

  • 점수만 보고하지 마십시오. 만약 당신의 컴퓨터가 90% 정확하다고 말한다면, 반드시 "우리는 실제 수치가 X와 Y 사이에 있을 것이라고 95% 확신합니다"라고 함께 말해야 합니다.
  • 올바른 도구를 사용하십시오. 작은 데이터셋이나 높은 성능을 보이는 데이터셋에 대해 오래된 고무 자(Wald 또는 기본 Bootstrap)를 사용하지 마십시오. 더 튼튼한 것(Agresti-Coull 또는 새로운 의사-계수 방법)을 사용하십시오.
  • 클러스터를 주의하십시오. 데이터가 여러 번 글을 쓰는 동일한 사람들로부터 나온다면, 과도한 확신을 피하기 위해 수학적 조정을 해야 합니다.

이러한 더 나은 방법들을 사용함으로써, 연구자들은 자신이 아는 것보다 더 많이 알고 있는 척하는 것을 멈출 수 있습니다. 이는 그들이 단순히 적은 표본 크기로 충분하기를 바랄 것이 아니라, 진정으로 신뢰할 수 있는 결과를 얻기 위해 언제 더 많은 데이터(더 많은 사람, 더 많은 텍스트)를 수집해야 하는지를 깨닫도록 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →