← 최신 논문
💬 NLP

Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models

이 논문은 대규모 언어 모델의 다양한 추론 시점 불확실성 측정 지표들을 평가하며, 몇몇 지표들이 인간의 답변 선호도와는 상관관계가 없을 때조차 인간의 불확실성과 강한 정렬을 보이고 모델의 보정 성능과는 중간에서 강한 수준의 정렬을 보여준다는 점을 발견하였다.

원저자: Kyle Moore, Jesse Roberts, Daryl Watson

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kyle Moore, Jesse Roberts, Daryl Watson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 박학다식한 로봇에게 질문을 던지고 있다고 상상해 보세요. 당신은 두 가지를 알고 싶습니다.

  1. 로봇이 실제로 맞는가? (이를 *교정(calibration)*이라고 합니다).
  2. 로봇이 느끼는 '불확실함'이 인간이 느끼는 방식과 같은가? (이를 *정렬(alignment)*이라고 합니다).

오랫동안 연구자들은 로봇이 자신이 맞는지 틀린지 알 수 있도록 만드는 데(교정) 뛰어난 성과를 보여왔습니다. 하지만 로봇의 '직감적인 느낌'이 인간 집단이 느끼는 방식과 일치하는지는 제대로 확인하지 않았습니다. 이 논문은 로봇과 인간이 불확서함에 대해 동일한 감정적 파동을 공유하고 있는지 알아내려는 탐정 이야기와 같습니다.

탐정 작업: 어떻게 테스트했는가

연구자들은 로봇을 객관식 시험을 치르는 학생처럼 취급했습니다. 그들은 단순히 로봇에게 정답을 묻는 것에 그치지 않고, 모든 가능한 선택지에 대해 로봇이 얼마나 확신하고 있는지를 드러냄으로써 그 "풀이 과정"을 보여달라고 요청했습니다.

그들은 이 두 가지 "교실"(데이터셋)을 사용하여 테스트했습니다:

  • 작은 교실: 유명한 여론 조사 기관(Pew Research)에서 가져온 38개의 아주 작은 문제 그룹.
  • 큰 교실: 공공 의견 조사(Roper Center)에서 가져온 약 3,000개의 방대한 문제 그룹.

이 교실들에서, 그들은 로봇의 답변과 확신 수준을 실제 인간 집단의 답변과 비교했습니다.

거대한 반전: "느끼는 것" vs "생각하는 것"

여기서 이 논문이 발견한 반전이 등장합니다. 이는 마치 학생과 선생님이 서로 다른 시험을 보고 있지만도 같은 "분위기"를 공유하는 것을 발견한 것과 같습니다:

  • 그들은 정답에는 동의하지 않습니다: 인간 집단과 로봇에게 같은 질문을 던지면, 그들은 종종 서로 다른 답을 선택합니다. 로봇의 "선호 순위"(어떤 답을 가장 좋아하고, 그다음으로 무엇을 좋아하는지 등)는 대개 인간의 순위와 완전히 다릅니다.
  • 하지만 그들은 '느낌'에는 동의합니다: 비록 선택하는 답은 다르더라도, 로봇의 불확실성 측정기는 인간의 불확실성이 변하는 것과 정확히 동시에 오르내립니다.

비유: 당신과 친구가 스포츠 경기 점치를 하고 있다고 상상해 보세요. 당신과 친구의 예측 점수는 다를 수 있습니다(예를 들어 당신은 24-20이라고 하고, 친구는 21-19라고 할 수 있죠). 하지만 두 사람 모두 자신의 예측에 대해 똑같이 초조함을 느낍니다. 둘 다 "잘 모르겠어, 어느 쪽으로든 갈 수 있어"라고 생각하는 것이죠. 이 논문은 LLM이 바로 그 친구와 같다는 것을 발견했습니다. 그들은 틀린 점수를 맞출 수는 있어도, 그들의 "초조함"은 인간의 초조함과 완벽하게 일치합니다.

사용된 도구들 ("불확실성 측정기")

연구자들은 이 "초조함"을 측정하기 위해 여러 가지 방법을 테스트했습니다. 이것들을 로봇의 불안감을 측정하는 다양한 종류의 온도계라고 생각하면 됩니다:

  1. Top-1 확률: "내가 내놓은 첫 번째 추측이 맞다는 것에 얼마나 확신하는가?" (이것은 인간과 정렬되는 측정기로서는 잘 작동하지 않았습니다).
  2. 엔트로피 (The "Chaos" Meter): 이것은 로봇의 추측이 얼마나 넓게 퍼져 있는지를 측정합니다. 만약 로봇이 하나의 답에 90% 확신한다면 평온한 상태(낮은 엔트로피)입니다. 만약 네 개의 답에 각각 25%씩 나누어져 있다면 혼란스러운 상태(높은 엔트로피)입니다.
    • 승자: 연구자들은 특히 정답인 선택지들 사이의 "혼란"(이를 Choice Entropy라고 부름)을 측정하거나, 상위 10개의 가장 유력한 추측들을 살펴보는 것(이를 Top-10 Entropy라고 부름)이 인간의 느낌과 가장 잘 일치한다는 것을 발견했습니다.
  3. Top-P 샘플링: 이것은 로봇이 "나는 내 확신의 90%를 차지하는 상위 구간의 답변들을 가져오겠다"라고 말하는 것과 같습니다. 그 구간의 크기가 로봇이 얼마나 불확실한지를 알려줍니다.

로봇은 실제로 자신이 틀렸을 때를 알았는가? (교정)

로봇이 인간처럼 불확실함을 느낀다고 해서, 확신을 가질 때 실제로 맞다는 뜻은 아닙니다. 연구자들은 MMLU(어려운 객관식 문제들의 거대한 모음)라는 표준 테스트를 사용하여 이를 확인했습니다.

  • 결과: 인간의 느낌과 일치했던 "불확실성 측정기"(Choice Entropy 등)는 로봇이 실제로 틀렸을 때를 예측하는 데에도 꽤 괜찮은 성능을 보였습니다.
  • 주의점: 로봇이 완벽하게 교정된 것은 아니었습니다. "적당히" 잘하는 수준이었습니다. 이는 "비가 올 확률 50%"라고 예보했을 때 실제로 비가 절반 정도 오는 날씨 예보와 같습니다. 유용하긴 하지만 결정적인 예언은 아닙니다.

"아하!" 모먼트 (깨달음)

이 논문은 아무도 주목하지 않았던 영리한 연결 고리를 만들어냅니다:

  • Top-P 샘플링(로봇이 텍스트를 생성하는 흔한 방식)은 통계학의 "베이지안 신뢰 구간(Bayesian Credible Set)"이라는 개념과 수학적으로 매우 유사합니다. 저자들은 이 연결 고리를 통해 왜 Top-P 그룹의 "크기"를 보는 것이 불확실성을 측정하는 좋은 방법인지 설명할 수 있음을 깨달았습니다.

결론

이 논문은 대규모 언어 모델(LLM)이 인간과 유사한 불확실성 감각을 가지고 있음을 알려줍니다. 비록 최종적인 답에서는 인간과 항상 일치하지 않더라도 말이죠.

  • 가장 효과적인 방법: 정답인 선택지들 사이에서 로봇의 확신이 얼마나 "넓게 퍼져 있는지"(Choice Entropy) 또는 상위 10개 추측을 측정하는 것입니다.
  • 중요한 이유: 이러한 특정 "측정기"를 사용할 수 있다면, 사용자에게 직관적인 신호를 줄 수 있습니다. 혼란스러운 숫자 대신, 로봇은 "제가 이 부분에 대해 매우 확신이 없습니다"라고 인간이 느끼는 방식과 유사하게 말할 수 있습니다. 이는 로봇이 100% 옳지는 않더라도 신뢰를 쌓는 데 도움이 됩니다.

이 논문이 하지 않은 것:

  • 이 연구는 열린 결말의 대화(예: 시 쓰기)가 아닌, 오직 객관식 질문만을 대상으로 했습니다.
  • 가장 크고 비싼 슈퍼컴퓨터 모델이 아닌, 80억 개(8B) 이하의 파라미터를 가진 모델만을 테스트했습니다.
  • 임상 시험이나 사용자 조사를 수행하여 이것이 실제로 사람들을 더 행복하게 만드는지 확인하지 않았습니다. 오직 수학적 측정과 정렬 여부만을 측정했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →