← 최신 논문
🤖 AI

Confidence Calibration in Large Language Models

본 논문은 대규모 언어 모델이 전반적으로 과신 경향을 보이며, 이는 어려운 과제에서는 과신이 정점에 달하고 쉬운 과제에서는 과신 부족이 발생하는 하드-이펙트 효과에 의해 조절됨을 보여주는 사전 등록 연구를 제시하며, 이로 인해 난이도 수준별 보정 평가를 위한 LifeEval 벤치마크가 개발되었음을 서술한다.

원저자: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"대형 언어 모델의 확률 보정" 논문에 대한 설명을 쉽고 일상적인 언어와 창의적인 비유로 번역한 것입니다.

핵심 문제: 지나치게 자신 있는 학생

연속된 퀴즈를 치르는 한 학생을 상상해 보세요. 때로는 이 학생이 문제를 맞히고 "100% 확신해요!"라고 말합니다 (이는 좋습니다). 하지만 종종 문제를 틀리면서도 여전히 "100% 확신해요!"라고 말합니다 (이는 나쁩니다).

이 논문은 AI 채팅봇의 두뇌 역할을 하는 대형 언어 모델 (LLM) 들이 바로 그런 지나치게 자신 있는 학생처럼 행동하는지 조사합니다. 연구자들은 평균적으로 AI 모델들은 자신이 옳다는 것을 지나치게 확신한다는 사실을 발견했습니다. 그들은 실제로 맞는 것보다 더 자주 자신이 옳다고 주장합니다. 이는 위험합니다. 왜냐하면 자신 있게 틀린 모델을 신뢰하면 나쁜 결정을 내릴 수 있기 때문입니다.

"쉬운 것-어려운 것" 반전

이 논문에서 가장 흥미로운 발견은"쉬운 것-어려운 것 효과"라는 현상입니다. 이를 자신감의 시소라고 생각하세요:

  • 쉬운 과제에서: 질문이 간단할 때 (예: "2+2 는 무엇인가?"), 모델들은 실제로 자신감이 부족합니다. 정답을 맞히면서도 "60% 만 확신해요"라고 말합니다. 100% 확신해야 하는데 너무 겸손한 것입니다.
  • 어려운 과제에서: 질문이 매우 어려워질 때 (예: 복잡한 논리 퍼즐), 모델들은 반대 방향으로 움직입니다. 정답을 틀리지만 "95% 확신해요!"라고 말합니다. 이는 과도한 자신감입니다.

이 논문은 과제가 어려워질수록 모델들의 자신감이 정확도 하락에 맞춰 충분히 떨어지지 않는다고 보여줍니다. 그들은 어려움을 겪고 있을지라도 여전히 "이거 알아요!"라고 외칩니다.

새로운 테스트: "LifeEval"

이를 연구하기 위해 연구자들은"LifeEval"이라는 새로운 테스트를 고안했습니다.

비유: 사람의 수명을 추측하려고 한다고 상상해 보세요.

  • 쉬운 버전: "이 사람은 80 세입니다"라고 알려줍니다. 당신은 그들이 85 세까지 살 것이라고 추측합니다. 최소 5 년 이상 살 가능성은 매우 높습니다. 모델은 여기서 자신감을 느낍니다.
  • 어려운 버전: "이 사람은 25 세입니다"라고 알려줍니다. 당신은 그들이 80 세까지 살 것이라고 추측합니다. 하지만 1 년 이내로 그들이 정확히 몇 세까지 살지 추측해야 합니다. 이는 매우 어렵습니다.

연구자들은 실제 정부 데이터 (사회보장 수명표) 를 사용하여 특정 나이까지 살 확률의 진짜 확률을 알았습니다. 그런 다음 AI 에게 나이를 추측하고 얼마나 확신하는지 말하도록 요청했습니다.

결과: AI 는 위에서 설명한 "쉬운 것-어려운 것" 패턴과 똑같이 행동했습니다.

  • 추측이 쉬울 때 (80 세 노인의 장수 예측), AI 는 자신감이 부족했습니다.
  • 추측이 어려울 때 (25 세의 특정 나이 예측), AI 는 과도한 자신감을 보였습니다.

"추론" 모델 vs "채팅" 모델

이 논문은 두 가지 유형의 AI 모델을 테스트했습니다.

  1. "채팅" 모델: 표준적인 빠른 응답 모델입니다.
  2. "추론" 모델: 답변하기 전에 단계별로 "생각"하도록 설계된 새로운 모델들입니다 (수학 문제를 풀기 위해 시간을 끄는 학생처럼).

발견: "추론" 모델들이 이 부분에서 훨씬 더 뛰어났습니다. 그들은 단순히 추측하는 것이 아니라, 과제의 난이도에 따라 자신감 수준을 더 정확하게 조정했습니다. 표준 "채팅" 모델에 비해 어려운 질문에서 터무니없이 자신감을 과시할 가능성이 적었습니다.

왜 숫자를 반올림할까요?

연구자들은 모델들이 자신감을 보고하는 방식에 대해 재미있는 점을 발견했습니다.

  • 사람들은 종종 "80%"나 "90%"처럼 깔끔한 반올림된 숫자로 자신감을 표현합니다.
  • AI도 똑같이 했습니다! 표준 "채팅" 모델들은 거의 100% 의 확률로 자신감을 5% 단위 nearest 로 반올림했습니다.

이는 AI 가 불확실성을 정확하게 표현하는 것을 피하는 인간의 습관을 포함한 인간 행동을 모방하고 있음을 시사합니다. 마치 학생이 구체적인 숫자를 주는 것보다 "꽤 확신해요"라고 말하는 것처럼, 정확한 표현은 위험하게 느껴지기 때문입니다.

"오염" 확인

연구자들은 AI 가 새로운 "LifeEval" 테스트의 답을 단순히 외웠을까 봐 걱정했습니다. 데이터 (수명표) 가 공개되어 있고 AI 의 학습 데이터에 포함되어 있을 가능성이 있기 때문입니다.

그들은 AI 의 답변에 대해 "속임수 탐지기" 테스트를 수행했습니다. 그 결과 일부 고급 모델 (DeepSeek-R1 과 Gemini 2.5 Pro 등) 은 데이터를 외운 것으로 보아 "강력한 증거"로 나타났습니다. 그러나 외운 것으로 보이는 모델들을 제거했을지라도 과도한 자신감 문제는 여전히 남았습니다. 모델들은 여전히 어려운 과제에서 자신에 대해 지나치게 확신했습니다.

요약

  • 주요 문제: AI 모델들은 일반적으로, 특히 과제가 어려울 때 답변에 대해 지나치게 자신감을 가집니다.
  • 패턴: 그들은 쉬운 과제에서는 너무 겸손하고, 어려운 과제에서는 너무 오만합니다.
  • 해결책 (부분적): "추론" 모델 (말하기 전에 생각하는 모델) 은 표준 채팅 모델보다 자신감 보정에 더 뛰어납니다.
  • 교훈: AI 가 확신 있는 것처럼 들린다고 해서 맹목적으로 신뢰해서는 안 됩니다. 과제가 어렵다면 AI 는 자신 있게 틀릴 수 있으며, 우리는 신중해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →