← 최신 논문
💬 NLP

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

이 논문은 기존의 신뢰도 교정 방법들이 질문에 여러 개의 정답이 존재하는 경우 체계적인 과소평가로 인해 대규모 언어 모델에 대해 실패한다는 점을 식별하고, 단일 정답 및 다중 정답 시나리오 모두에서 견고한 교정을 달성하기 위한 새로운 벤치마크(MACE)와 의미론적 신뢰도 집계(SCA) 방법을 제안한다.

원저자: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 문제: "정답을 맞히는 것"이 "혼란스러워하는 것"처럼 보일 때

당신이 상식 퀴즈를 풀고 있다고 상상해 보세요.

  • 시나리오 A: 질문이 "셰익스피어는 누구인가?"입니다. 정답은 단 하나입니다: 셰익스피어. 당신이 "셰익스피어"라고 답한다면, 당신은 정답을 맞혔고 매우 확신에 차 있습니다.
  • 시나리오 B: 질문이 "빨간색 과일을 대시오"입니다. 정답은 여러 개가 있습니다: 사과, 딸기, 체리, 라즈베리.

이 논문은 현재의 거대 언어 모델(LLM)들이 시나리오 B에서 혼란을 겪는다고 주장합니다.

모델이 여러 개의 정답(사과, 딸기, 체리 등)이 있다는 것을 알게 되면, 모델은 자신의 "표를 나누는" 경향이 있습니다. 예를 들어 20번의 시도 중 "사과" 6번, "딸기" 6번, "체리" 6번을 말할 수 있습니다. 모델이 매번 딱 하나의 정답만을 고르지 않았기 때문에, 모델 내부의 "확신 측정기"는 수치가 떨어집니다. 모델은 "오 이런, 어떤 것을 골라야 할지 모르겠어. 그러니 나는 불확실한 상태구나"라고 생각하게 됩니다.

아이러로니: 사실 모델은 시나리오 B에서 정답을 맞힐 확률이 더 높지만(정답의 가짓수가 더 많기 때문에), 모델의 확신도는 오히려 낮게 나타납니다. 이는 마치 가게에 가는 길을 세 가지나 알고 있음에도 불구하고, 단 하나의 경로를 결정하지 못해 스스로 길을 잃었다고 믿어버리는 사람과 같습니다.

새로운 도구: MACE ("다중 정답" 테스트)

연구진은 이 문제가 존재한다는 것을 증명하기 위해 MACE라는 새로운 테스트를 구축했습니다. MACE를 정답이 여러 개인 질문을 얼마나 잘 처리하는지 테스트하기 위한 특수 체육관이라고 생각하면 됩니다.

  • 설정: 연구진은 6가지 주제(수상 내역, 정치적 직위, 강 이름 등)에 걸쳐 12,000개의 질문을 만들었습니다.
  • 반전: 모든 주제에 대해 정답이 정확히 1개, 2개, 4개, 또는 6개인 질문들을 만들었습니다.
  • 목표: 정답의 개수가 변할 때 모델의 확신도 점수가 여전히 정확하게 유지되는지 확인하는 것입니다.

발견한 사실: "거대 지능"의 역설

연구진은 네 가지 서로 다른 규모의 AI 모델 제품군을 대상으로 15가지의 확신도 측정 방식을 테스트했습니다. 결과는 다음과 같았습니다.

  1. 정확도는 올라가고, 확신도는 내려간다: 정답의 개수가 늘어날수록(1개에서 6개로), 모델은 질문을 더 자주 맞혔습니다. 하지만 모델이 추정한 확신도는 크게 떨어졌습니다.
  2. 큰 모델일수록 더 고통받는다: 가장 크고 똑똑한 모델들(700억 개의 파라미터를 가진 모델 등)이 가장 혼란스러워했습니다. 모델이 더 많이 알기 때문에 더 다양한 정답을 생성할 수 있기 때문입니다. 이러한 다양성은 확신도 측정기에게 모델이 "우유부단하다"는 인상을 주어, 확신도 점수를 폭락하게 만듭니다.
  3. "신뢰의 위기": 정답이 하나인 질문과 여섯 개인 질문이 섞여 있는 실제 환경의 혼합 질문에서, 기존의 가장 좋은 방법들도 실패했습니다. 기존 방식들은 모델이 몇 가지 다른 정답 변형을 제시했다는 이유만으로 정답을 "신뢰할 수 없음"으로 분류해 버렸습니다.

해결책: SCA ("팀 투표" 방식)

연구진은 **SCA (Semantic Confidence Aggregation, 의미론적 확신도 집계)**라는 새로운 방법을 제안했습니다.

기존 방식 ( "독재자" 방식):
대부분의 방법은 모델이 제시한 답변 중 가장 인기 있는 단 하나의 답변만을 봅니다. 만약 모델이 20개의 답변을 냈는데 10개가 "사과"이고 10개가 "딸기"라면, 기존 방식은 이렇게 말합니다. "너는 50%의 확률로만 일치했어. 너는 확신이 없어."

새로운 방식 (SCA - "팀 투표" 방식):
SCA는 모델이 제시한 모든 정답의 전체 확률을 살펴봅니다.

  • 의미 단위로 답변을 그룹화합니다 (예: 모든 "사과" 관련 답변은 하나의 그룹, "딸기" 관련 답변은 다른 그룹).
  • 모든 정답 그룹의 확신도 점수를 합산합니다.
  • 결과: 모델이 표를 사과와 딸기로 나누었더라도, SCA는 "빨간 과일"에 대한 전체 투표가 100%임을 인지합니다. 즉, "아, 모델은 확신하고 있구나. 다만 유효한 선택지가 몇 가지 있을 뿐이야"라고 이해하는 것입니다.

요점 정리

  • 문제점: 현재의 AI 확신도 도구들은 여러 개의 정답이 있다는 것이 AI가 불확실하다는 뜻이라고 오해합니다.
  • 해결책: 새로운 SCA 방식은 가장 인기 있는 답변 하나만이 아니라 모든 유효한 답변의 확신도를 합산함으로써 이 문제를 해결합니다.
  • 결과: SCA는 정답이 많은 질문에서도 아주 잘 작동하며, 정답이 하나뿐인 질문에서도 오류를 범하지 않습니다. 이는 AI가 여러 가지 방식으로 정답을 맞힐 때도, 실제로 확신하고 있다면 그 확신을 제대로 표현할 수 있도록 도와줍니다.

요약하자면, 이 논문은 AI에게 있어 여러 방식으로 정답을 맞히는 것이 왜 불확실함으로 비쳐서는 안 되는지를 가르쳐 줍니다. 우리는 그저 투표를 세는 더 나은 방법이 필요할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →