← 최신 논문
🤖 AI

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

본 논문은 LLM 의 신뢰도 보정이 측정 프로토콜, 특히 조건부 맥락, 토큰 확률 판독, 그리고 답변 선택에 매우 민감함을 입증하여, 서술된 신뢰도가 종종 정답성보다는 답변의 타당성을 반영함을 밝히고 신뢰할 수 있는 평가를 위해 표준화된 보고 체크리스트의 채택을 촉구한다.

원저자: Hankyeol Kim, Pilsung Kang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hankyeol Kim, Pilsung Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 이 자신의 답변에 대해 얼마나 확신하는지 파악하려 한다고 상상해 보세요. 질문하는 방법은 두 가지가 있습니다:

  1. "속삭임": 모델에게 "저는 85% 확신합니다"와 같이 숫자를 말하게 합니다. (이를 구두화 된 확신이라고 합니다).
  2. "내면의 독백": 모델의 뇌 내부 수학을 살펴보고, 각 단어가 나타날 확률을 어떻게 계산했는지 확인합니다. (이를 토큰 확률이라고 합니다).

오랫동안 연구자들은 이 두 가지 방법이 약간 다른 각도에서 같은 물체를 바라보는 것과 같다고 생각했습니다. 만약 이 둘을 비교한다면 모델의 "자기 인식"에 대해 안정적이고 신뢰할 수 있는 그림을 얻을 수 있을 것이라고 가정했습니다.

이 논문은 말합니다: 멈추십시오. 카메라를 어떻게 들고 있느냐에 따라 그림이 완전히 달라집니다.

저자들은 이 두 신호를 비교하는 것이 산을 사진으로 찍는 것보다는, 트램펄린 위에 서서 건물의 높이를 재려는 것과 더 비슷하다고 주장합니다. 결과는 당신이 어디에 서 있는지, 무엇 위에 서 있는지, 그리고 어떤 자를 사용하는지에 전적으로 달려 있습니다.

다음은 간단한 비유를 사용한 그들의 발견 사항에 대한 요약입니다:

1. "어디에 서 있느냐" 문제 (조건부 문맥)

이것이 가장 큰 놀라움입니다. 학생에게 "프랑스의 수도가 파리라는 것에 얼마나 확신합니까?"라고 질문한다고 상상해 보세요.

  • 시나리오 A: 학생이 책상에 앉아 있을 때 이 질문을 합니다.
  • 시나리오 B: 학생이 이미 파리에 대해 긴 에세이를 쓴 에 이 질문을 합니다.

이 논문은 모델이 말을 시작하기 (시나리오 A) 에 모델의 내부 수학 (토큰 확률) 을 측정하는 것과, 확신 점수를 주도록 요청받은 (시나리오 B) 에 측정하는 경우 결과가 뒤집힌다고 발견했습니다.

  • 한 설정에서는 모델이 완벽하게 보정된 것처럼 보입니다 (말한 확신이 내부 수학 일치).
  • 다른 설정에서는 모델이 지나치게 확신하거나 확신이 부족한 것처럼 보입니다.

핵심: "문맥"(모델이 방금 읽거나 하도록 요청받은 것) 은 결론을 뒤집을 정도로 수학을 너무 많이 변화시킵니다. 그림자를 재는 것과 같습니다. 그림자의 길이는 물체 자체뿐만 아니라 태양의 위치에 전적으로 달려 있습니다.

2. "우리가 어떤 답변에 대해 이야기하고 있는가?" 문제 (답변 출처)

때로는 모델이 스스로 답변을 생성하고, 때로는 당신이 답변을 제공하고 "이것이 맞다고 확신합니까?"라고 질문합니다.

  • 자가 생성: 모델이 스스로 답변을 생각합니다.
  • 제공됨: 당신이 모델에게 올바른 답변을 제공하고 확신 점수를 요청합니다.

이 논문은 모델에게 설득력 있지만 틀린 답변 (지적으로 들리지만 사실은 틀린 것) 을 제공할 때, 모델은 그것이 올바른 답변일 때와 거의 동일한 높은 확신 점수를 준다고 발견했습니다.

  • 비유: 기상 예보가를 상상해 보세요. 매우 사실적으로 보이는 가짜 날씨 지도를 보여준다면, 그들은 "이것이 정확할 확률이 90% 입니다"라고 말할지도 모릅니다. 비록 그것이 틀렸더라도요. 그들은 이야기가 얼마나 설득력 있는지를 판단할 뿐, 그것이 진실 인지는 판단하지 않습니다.

3. "어떤 자를 사용하는가" 문제 (토큰 판독)

내부 수학을 계산할 때, 답변의 첫 번째 단어의 확률을 보나요, 아니면 전체 문장의 평균 확률을 보나요?

  • 이 논문은 이 작은 세부 사항을 변경하는 것 (인치 자에서 센티미터 자로 바꾸는 것과 같이) 이 많은 경우 결론의 부호를 뒤집을 정도로 결과를 변화시킨다고 발견했습니다. 이는 작은 기술적 조정이지만 매우 중요합니다.

4. "어떤 계산기를 사용하는가" 문제 (추정자 선택)

연구자들은 "보정 오차"를 계산하기 위해 서로 다른 수학 공식 (추정자) 을 사용합니다.

  • 좋은 소식: 계산기 (공식) 를 변경해도 결과는 크게 변하지 않았습니다.
  • 나쁜 소식: "어디에 서 있는지"(문맥) 나 "무엇을 측정하는지"(답변 출처) 를 변경하면 결과가 엄청나게 변했습니다.

큰 결론

이 논문은 말한 확신( "90% 확신합니다") 이나 내부 수학 중 어느 것도 모델의 마음에 대한 직접적이고 변하지 않는 진리가 아니라고 결론 내립니다.

대신, 그것들은 행동 측정치입니다. 특정 상황에서 특정 질문에 대한 사람의 반응과 같습니다. 상황을 변경하면 (프롬프트, 문맥, 답변 출처) 반응도 변합니다.

"체크리스트" 비유:
저자들은 AI 의 확신을 보고하려 할 때, 단순히 "우리 모델은 90% 보정되었습니다"라고 말할 수 없다고 제안합니다. 이는 지하실에서 재었는지 옥상에서 재었는지 말하지 않고 "건물은 100 피트 높이입니다"라고 말하는 것과 같습니다.

"프로토콜"을 보고해야 합니다:

  1. 누가 답변을 작성했습니까? (모델이 작성했나요, 아니면 당신이 제공했나요?)
  2. 어디에 서 있었습니까? (모델이 말을 시작하기 전이나 후에 수학을 측정했나요?)
  3. 수학을 어떻게 읽었습니까? (첫 번째 단어를 보았나요, 아니면 전체 문장을 보았나요?)

요약:
AI 가 얼마나 "확신"하는지 보여주는 단일 숫자를 신뢰하지 마십시오. 그 숫자는 취약합니다. 당신이 플레이하는 게임의 특정 규칙에 전적으로 달려 있습니다. 규칙을 바꾸면 점수도 변합니다. 따라서, 특히 이러한 숫자를 중요한 의사결정에 사용하고자 한다면, 이러한 숫자를 측정하고 보고하는 방법에 대해 매우 신중해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →