← 최신 논문
💻 computer science

On Verbalized Confidence Scores for LLMs

본 논문은 신뢰도 점수를 통해 대규모 언어 모델이 자신의 불확실성을 언어화하는 신뢰성을 조사하며, 효과성이 프롬프트 전략에 따라 달라지지만 특정 방법은 낮은 오버헤드로 잘 보정된 모델 독립적 불확실성 정량화를 제공할 수 있음을 입증한다.

원저자: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 독서량이 많은 친구에게 조언을 구한다고 상상해 보세요. 때로는 그 친구가 답변에 대해 절대적으로 확신하지만, 때로는 단순히 추측할 뿐입니다. 오늘날의 대규모 언어 모델 (LLM) 의 문제는 종종 틀렸을 때도 확신에 찬 어조로 말한다는 점입니다. 그들은 자신이 무슨 말을 하는지 전혀 모를 때도 "잘 모르겠다"고 말하지 않는 친구와 같습니다.

이 논문인 "On Verbalized Confidence Scores for LLMs(대규모 언어 모델을 위한 구두화 신뢰도 점수)" 는 다음과 같은 간단한 아이디어를 탐구합니다: AI 에게 얼마나 확신하는지 직접 말하게 하면 어떨까요?

연구자들은 AI 의 내부 코드를 살펴보거나 같은 답변을 반복해서 얻기 위해 AI 를 백 번 실행하는 대신, AI 에게 답변에 "신뢰도 점수"를 추가하도록 요청했습니다. 예를 들어, "정답은 X 이며, 저는 85% 확신합니다"라고 말하는 식입니다.

다음은 일상적인 비유를 사용하여 그들의 발견 사항을 요약한 것입니다:

1. 목표: "신뢰도 게이지"

연구자들은 이 "신뢰도 게이지"(신뢰도 점수) 가 실제로 작동하는지 확인하고자 했습니다. 그들은 다음과 같은 시스템을 원했습니다:

  • 정직함: AI 가 90% 확신한다고 말한다면, 실제로 90% 의 확률로 맞아야 합니다.
  • 유연성: 어떤 질문을 하든, 어떤 AI 모델을 사용하든 작동해야 합니다.
  • 빠름: 점수를 얻는 데 추가 시간이나 컴퓨팅 파워가 소요되어서는 안 됩니다.

2. 실험: 다양한 "질문 방식" 테스트

팀은 질문하는 방식이 매우 중요하다는 점을 깨달았습니다. 마치 아이에게 추측을 요구하는 것과 같습니다.

  • "프랑스의 수도는 어디인가요? 추측해 보세요!"라고 물으면, 그들은 단순히 "파리"라고 말하며 확신에 찬 표정을 할 수 있습니다.
  • "프랑스의 수도는 어디인가요? 추측해 보세요. 그리고 0 에서 100 사이의 척도로 얼마나 확신하는지 말해 주세요"라고 물으면, 그들은 더 깊이 생각할 수 있습니다.

연구자들은 11 개의 서로 다른 AI 모델10 가지 다른 유형의 질문(과학 상식, 논리 퍼즐, 상식 등) 에 걸쳐 17 가지의 다른 질문 문구 (프롬프트) 를 테스트했습니다.

3. 주요 발견: AI 의 "두뇌 크기"에 따라 다름

가장 흥미로운 발견은 정직한 답변을 얻는 최선의 방법이 AI 모델이 얼마나 "똑똑한지"(또는 큰지) 에 달려 있다는 것입니다.

  • "작은" AI 모델 (초보자):
    이들을 여전히 배우고 있는 학생이라고 생각하세요. 복잡한 고급 프롬프트와 많은 예시 및 지시를 주면, 그들은 혼란을 겪고 허위 사실을 만들어내기 시작합니다.

    • 논문의 발견: 간단한 프롬프트가 가장 잘 작동합니다. 긴 규칙 목록을 주는 것보다 단순히 "얼마나 확신하나요?"라고 묻는 것이 더 효과적입니다.
  • "큰" AI 모델 (전문가):
    이들을 박사 학위 소지자로 생각하세요. 그들은 방대한 지식을 가지고 있지만, 과도하게 확신할 수 있습니다. 단순히 질문하면 틀렸을 때도 100% 확신으로 추측할 수 있습니다.

    • 논문의 발견: 그들은 더 복잡한 "부드러운 자극"이 필요합니다. 연구자들은 몇 가지 답변 예시를 제공하고, 추론 과정을 설명하도록 요청하며, 작업의 난이도를 고려하도록 명시적으로 지시하는 등 여러 기법을 결합했을 때 훨씬 더 정직해졌음을 발견했습니다.
    • 결과: 올바른 복잡한 프롬프트를 사용하면, 이러한 대형 모델들은 실제 성공률과 약 7% 이내의 오차 범위로 신뢰도 점수를 산출할 수 있었습니다. 이는 단순 추측에 비해 엄청난 개선입니다.

4. "콤보" 프롬프트

연구자들은 대형 모델을 위해 "슈퍼 프롬프트"(콤보라고 명명됨) 를 만들었습니다. 이는 AI 에게 체크리스트를 주는 것과 같았습니다:

  1. 질문에 대해 생각하세요.
  2. 난이도를 고려하세요.
  3. 자신의 지식을 살펴보세요.
  4. 최선의 추측을 제시하세요.
  5. 확률 점수 (0.0 에서 1.0) 를 제시하세요.

이 "콤보" 프롬프트를 사용했을 때, 대형 모델들은 자신이 확신하지 못할 때 인정하는 능력이 훨씬 향상되었습니다.

5. 의미 (논문에 따르면)

이 논문은 AI 에게 "자신의 확신을 말하게 하는 것"이 매우 유망한 도구라고 결론 내립니다. 이는 다음과 같습니다:

  • 간단함: AI 의 두뇌 내부를 볼 필요가 없습니다.
  • 빠름: 몇 단어를 추가로 생성하는 데만 소요됩니다.
  • 효과적: 올바른 질문을 하는 방법을 안다면, AI 가 추측 중인지 아니면 정답을 알고 있는지 알려줄 수 있습니다.

하지만 함정이 있습니다: 어떤 AI 에게나 임의로 질문할 수는 없습니다. 질문을 맞춤화해야 합니다. 작은 AI 에게 복잡한 질문을 하면 실패합니다. 큰 AI 에게 간단한 질문을 하면 확신에 찬 척 거짓말할 수 있습니다. 하지만 프롬프트에 대한 올바른 "레시피"를 사용하면 이러한 모델들을 훨씬 더 신뢰할 수 있게 만들 수 있습니다.

요약하자면: AI 는 자신이 얼마나 확신하는지 알려줄 수 있지만, 진실된 답변을 얻으려면 올바른 방식으로 질문하는 방법을 알아야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →