← 최신 논문
📊 statistics

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

이 논문은 언어 모델의 단어 수준 확률과 의미 있는 상태 수준의 불확실성 사이의 간극을 메우는 "시맨틱 맵(semantic map)" 프레임워크를 소개하며, 이를 통해 준모수적 교정(semiparametric calibration)을 거쳐 전문적인 의사결정을 위한 감사 가능하고 바꾸어 말하기에 안정적인 사후 추정치를 도출할 수 있게 한다.

원저자: Matthew F. Dixon

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Matthew F. Dixon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 날씨를 추측하려고 노력하고 있다고 상상해 보세요. 구름, 바람, 기압계를 보고 앞으로 일어날 일을 정확하게 말해줄 수 있는 아주 똑똑한 친구가 있습니다. 하지만 여기 함정이 있습니다. 그 친구는 "비가 올 것이다"와 같이 명확한 문장으로 말하지 않습니다. 대신 자신이 다음에 말할 수도 있는 몇 개의 단어 목록과 각 단어가 나올 확률을 알려줍니다. 만약 친구가 "비(rain)"가 40%, "소나기(shower)"가 10%라고 말한다면, 당신은 젖을 확률의 총합을 알 수 있을까요? 아마도 모를 것입니다. 하지만 당신이 질문을 약간 다르게 해서 다시 물어보면, 친구는 이제 "소나기"가 40%, "비"가 10%라고 말할 수도 있습니다. 젖을 전체 확률은 여전히 50%이지만, 특정 단어에 대한 친구의 확신은 뒤바뀌었습니다!

이것이 바로 언어 모델(똑똑한 친구들)의 세계입니다. 이들은 문장에서 다음 단어를 예측하는 데는 뛰어나지만, 의료 진단이나 주식 시장 폭락과 같은 실제 사건의 진정한 확률을 알려주는 데는 서툽니다. 과학과 통계학에서 이 "진정한 확률"을 **사후 확률(posterior)**이라고 부릅니다. 이는 모든 증거를 바탕으로 한 수학적으로 올바른 답입니다. 문제는 언어 모델이 "말이 많고 흔들린다(wordy and wobbly)"는 점입니다. 질문의 순서를 바꾸거나 유의어를 사용한다는 이유만으로 모델은 마음을 바꿀 수 있습니다. 이 논문은 이 흔들림을 고치기 위한 다리를 놓는 것에 관한 것입니다. 질문은 이것입니다: 컴퓨터의 무질서하고 단어 중심적인 추측을 어떻게 하면 신뢰할 수 있는 과학적 측정값으로 바꿀 수 있을까?

문제점: "말이 많은" 예언자

언어 모델을 매우 재능 있지만 약간 혼란스러워하는 예언자라고 생각해보세요. 당신이 "환자가 아픈가요?"라고 물으면, 모델은 "긴급 검토(Urgent review)"가 45%, "즉각적 조치(Immediate escalation)"가 15%라고 답할 수 있습니다. 인간에게 두 문구는 모두 같은 의미입니다: 환자의 도움이 지금 당장 필요하다. 따라서 환자의 도움이 필요한 실제 확률은 60%(45 + 15)입니다.

하지만 여기에 함정이 있습니다. 질문을 약간만 바꿔도 예언자는 갑자기 "긴급 검토"는 20%이고 "즉각적 조치"는 40%라고 말할 수 있습니다. 총합은 여전히 60%이지만, 특정 단어에 대한 예언자의 확신은 크게 요동쳤습니다. 만약 당신이 예언자에게 "60%"와 같은 "숫자를 출력하라"고 요청한다면, 그것은 실제로 계산하는 것이 아니라 그냥 추측하거나 어떤 규칙을 따르는 것일 뿐일 수 있습니다. 이 논문은 모델이 출력하는 숫자도 믿을 수 없고, 모델이 선택한 특정 단어도 믿을 수 없다고 주장합니다. 우리는 단어 그 자체가 아니라, 단어 뒤에 숨겨진 의미를 측정하는 방법이 필요합니다.

해결책: "의미론적 지도(Semantic Map)"

저자인 매슈 딕슨(Matthew Dixon)과 그의 팀은 **의미론적 지도(Semantic Map)**라는 영리한 도구를 제안합니다. 거대하고 무질서한 레고 블록 더미(모델이 말할 수 있는 다양한 단어들)가 있다고 상상해 보세요. 어떤 블록은 빨간색이고, 어떤 것은 파란색이며, 어떤 것은 초록색입니다. 하지만 당신의 게임에서 "빨간색"과 "진한 빨간색"은 둘 다 "위험"을 의미하고, "파란색"은 "안전"을 의미합니다.

의미론적 지도는 게임을 시작하기 전에 작성하는 규칙서입니다. 이 규칙서는 다음과 같이 말합니다: "만약 모델이 '긴급 검토' 또는 '즉각적 조치'라고 말한다면, 둘 다 '위험'으로 계산하라." 이 방식은 비슷하게 들리는 모든 단어를 그들의 진정한 의미로 그룹화합니다.

하지만 그룹화만으로는 충분하지 않습니다. 모델은 여전히 수학에 서툴 수 있습니다. 그래서 저자들은 **보정(Calibration)**이라는 두 번째 단계를 사용합니다. 그들은 이미 정답을 알고 있는 여러 테스트 케이스(선생님의 정답지 같은 것)를 가져옵니다. 모델에게 추측하도록 하고, 의미론적 지도를 사용하여 단어들을 그룹화한 다음, 모델의 그룹화된 추측치를 선생님의 정답지와 비교합니다. 만약 모델이 "위험"이라고 60%의 확률로 말했는데 정답지가 "위험"이 실제로는 50%뿐이라고 한다면, 보정 단계는 모델의 점수를 진실에 맞게 조정합니다.

결과: 다리는 작동한다 (단, 제대로 만든 경우에만)

팀은 이 아이디어를 두 가지 방식으로 테스트했습니다. 첫째, 실제 금융 뉴스를 살펴보고 모델에게 시장이 오를지 내릴지 추측하게 했습니다. 그들은 모델의 "단어 기반" 추측(지도로 그룹화된 것)을 모델 자신의 "숫자 기반" 추측(모델이 단순히 퍼센트를 출력하려고 시도한 것)과 비교했습니다.

결과: 단어 기반 방식이 훨씬 더 좋았습니다. 이 방식은 더 정확했고 불확실성을 더 정직하게 보여주었습니다. 모델이 출력한 숫자는 종종 단순한 추측이었지만, 모델이 선택한 단어의 패턴이 오히려 진실의 비밀을 담고 있었습니다.

둘째, 그들은 정확한 정답이 존재하는 가상의 세계를 만들어 매우 통제된 실험을 수행했습니다. 이 가상의 세계를 두 가지 다른 언어 모델(GPT-4.1-mini 및 GPT-4o-mini)에 입력했습니다.

결과:

  • 작동한다: 의미론적 지도와 보정을 사용한 후, 모델은 높은 신뢰도로 정확한 진실을 회복했습니다. 구체적으로, 이 방법은 **90-94%의 컨포멀 커버리지(conformal coverage)**를 달しまいました. 즉, 테스트 케이스의 90-94%에서 실제 정답이 모델이 계산한 불확실성 범위 안에 들어왔습니다.
  • 안정적이다 (대체로): 질문의 어구(예: '고열' 대신 '높은 체온')를 약간 바꾸더라도 결과는 거의 동일하게 유지되었습니다.
  • 민감하다: 중요한 정보(예: 체온 수치를 제거함)를 삭제하면 모델의 답변이 올바르게 변했습니다. 이는 모델이 단순히 추측하는 것이 아니라 실제로 증거를 사용하고 있음을 입증했습니다.
  • 마법은 아니다: 만약 정보의 순서를 뒤섞으면(예: 온도를 질문 전이 아닌 질문 후에 배치), 결과가 현저히 나빠졌습니다. 논문은 정보의 재배치가 "결정적(consequential)"이며, 안정성을 떨어뜨린다는 것을 발견했습니다. 이는 단순히 단어를 던져주는 것만으로는 안 되며, 순서가 매우 중요하다는 것을 보여줍니다.

주의사항: "유창함"을 믿지 마라

이 논문이 우리에게 주는 가장 중요한 교훈은 무엇을 하지 말아야 하는가입니다. 모델이 자신감 있게 들리거나 유창하게 말한다고 해서 그것이 반드시 옳다는 뜻은 아닙니다.

  • 출력된 숫자를 믿지 마세요: 모델이 "90% 확신합니다"라고 말하더라도, 그것은 거짓말이거나 단순히 패턴을 따르는 것일 수 있습니다.
  • 단일 단어를 믿지 마세요: 모델이 "일상적" 대신 "긴급"을 선택했다고 해서 "긴급" 경로가 유일한 진실이라는 뜻은 아닙니다. 유사한 단어 전체 그룹을 살펴봐야 합니다.
  • 보편적이라고 가정하지 마세요: 이 다리는 특정 작업에 맞춰 정교하게 구축되었을 때만 작동합니다. 의료 진단을 위해 만든 지도를 사용하여 날씨를 예측할 수는 없습니다.

결론

이 논문은 언어 모델이 갑자기 완벽해졌다고 말하는 것이 아닙니다. 언어 모델은 마치 노이즈가 섞인 라디오와 같다고 말합니다. 신호(진실)는 존재하지만, 잡음(이상한 단어 선택과 포맷팅) 아래에 묻혀 있습니다. 의미론적 지도(노이즈를 그룹화하기 위해)를 만들고 보정(라디오 주파수를 맞추기 위해)을 사용함으로써, 우리는 마침내 신호를 명확하게 들을 수 있습니다.

저자들은 이 과정을 주의 깊게 수행한다면, 수다스러운 컴퓨터를 신뢰할 수 있는 과학적 도구로 바꿀 수 있다는 것을 발견했습니다. 하지만 이 단계를 건너뛰고 컴퓨터에게 단순히 "숫자를 달라"고 요청한다면, 당신은 자신감 넘치는 거짓말을 듣게 될 가능성이 높습니다. 다리는 존재하지만, 건너기 전에 당신이 직접 그 다리를 놓아야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →