← 최신 논문
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

이 논문은 거대 언어 모델의 언어적 확신 보고가 실제 응답의 정답성보다는 응답 결정을 유도하는 내부적인 '확정 준비(commit-readiness)' 상태를 주로 반영하며, 이를 통해 정답의 근거를 추적하는 로그 확률과는 근본적으로 구별됨을 입증한다.

원저자: Dharshan Kumaran

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dharshan Kumaran

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 약간은 신비로운 로봇 비서에게 수수께록을 풀라고 요청한다고 상상해 보세요. 당신이 "프랑스의 수도는 어디인가요?"라고 묻습니다. 로봇은 잠시 생각하더니 "파리입니다"라고 말합니다. 그다음 당신이 "얼마나 확신하나요?"라고 묻습니다.

로봇은 "100% 확신합니다"라고 대답합니다.

인공지능(AI)의 세계에서, 우리는 보통 로봇이 "100% 확신한다"라고 말할 때, 그것이 "내 내부 데이터베이스를 확인해 본 결과, 통계적으로 이 답이 정답이라는 것을 확신한다"라는 의미라고 가정합니다.

하지만 구글 딥마인드(Google DeepMind)의 새로운 연구는 우리가 로봇의 자신감을 오해하고 있을지도 모른다는 점을 시사합니다. 연구진은 AI가 "자신 있다"라고 말할 때, 그것이 반드시 "내 답이 맞다"라는 뜻은 아니라는 사실을 발견했습니다. 대신, 그것은 "내 답이 틀릴 수도 있지만, 나는 이 답을 고수할 준비가 되었다"라는 의미에 가깝습니다.

다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

두 가지 유형의 "자신감"

연구진은 로봇이 자신의 확실성을 측정하는 두 가지 서로 다른 방식을 비교했습니다.

  1. "수학적 자신감" (로그 확률, Log-Probability): 이것은 계산기와 같습니다. 선택지들의 가공되지 않은 숫자와 확률을 살펴봅니다. 만약 수학적 계산이 "파리"가 정답일 확률을 99%라고 말한다면, 계산기는 자신감이 있습니다.

    • 연구 결과: 이 유형의 자신감은 진실을 판단하는 좋은 척도입니다. 수학이 자신 있다고 말하면 답은 대개 맞습니다. 수학이 불확실하다고 말하면 답은 대개 틀립니다.
  2. "언어적 자신감" (로봇의 말): 이것은 당신이 로봇에게 직접 "얼마나 자신 있나요?"라고 물었을 때, 로봇이 단어나 수치 척도(예: "매우 확신함")로 대답하는 경우입니다.

    • 연구 결과: 이 유형의 자신감은 진실을 판단하기에는 좋지 않지만, **전념(Commitment)**을 판단하기에는 아주 훌륭합니다. 로봇이 "매우 확신합니다"라고 말할 때, 그것은 답이 확실히 맞다는 뜻이 아닙니다. 그것은 로봇이 마음을 굳혔으며, 사용자 앞에서 그 답을 고수할 준비가 되었다는 뜻입니다.

"전념할 것인가, 포기할 것인가" 게임

연구진은 동물의 의사결정을 연구하는 방식에서 영감을 얻어, 두 단계로 구성된 게임을 설정했습니다.

  • 1단계: 로봇이 질문에 답하고 자신감 수치를 제시합니다 (예: "90% 확신합니다").
  • 2단계: 로봇에게 자신의 답을 보여주며 묻습니다: "이 답을 전념(Commit) 하겠습니까(인간에게 이 답을 보여줄 것인가), 아니면 포기(Abstain) 하겠습니까(모른다고 말할 것인가)?"

놀라운 결과:
1단계에서 로봇의 언어적 자신감은 2단계에서 실제 정답 여부를 예측하는 것보다, 로봇이 무엇을 할지를 예측하는 데 훨씬 더 뛰어난 지표였습니다.

  • 만약 로봇이 "매우 확신합니다"라고 말했다면, 설령 그 답이 틀렸더라도 2단계에서 거의 항상 전념을 선택했습니다.
  • 만약 로봇이 "잘 모르겠습니다"라고 말했다면, 거의 항상 포기를 선택했습니다.

비유:
카지노에 있는 도박꾼을 상상해 보세요.

  • 수학적 자신감은 도박꾼이 종이에 적힌 승률을 확인하는 것과 같습니다. 승률이 높다면 도박꾼은 자신이 이길 가능성이 높다는 것을 압니다.
  • 언어적 자신감은 도박꾼이 "전부 다 걸겠어!"라고 외치는 것과 같습니다. 연구 결과, 도박꾼이 "전부 다 걸겠어!"라고 외치는 것은 종종 그들이 베팅할 준비가 되었다는 신호일 뿐, 승리할 패를 쥐고 있다는 보장은 아니라는 것입니다. 그들은 블러핑을 하고 있거나 그저 대담해진 상태일 수도 있습니다. 실제로 그들이 이길 것인지를 알려주는 것은 오직 "수학적 자신감"(승률)뿐입니다.

"전념 준비" 스위치

연구진은 로봇의 "뇌"(내부 코드)를 더 깊이 파고들어 어떤 일이 일어나고 있는지 조사했습니다. 그들은 로봇이 답을 내놓은 직후, 하지만 전념 여부를 결정하기 전의 특정 순간을 발견했습니다.

이 정확한 순간에, 로봇의 내부 상태는 한 가지 질문을 중심으로 조직됩니다: "나는 이 답을 고수할 준비가 되었는가?"

  • 로봇에게는 "전념/포기" 스위치가 있으며, 이 스파크는 매우 크고 명확합니다.
  • 로봇에게는 "맞음/틀림" 스위치가 있으며, 이는 훨씬 조용하고 모호합니다.

로봇이 언어적 자신감 보고를 생성할 때, 그것은 본질적으로 조용한 "맞음/틀림" 스위치가 아니라, 시끄럽고 명확한 "전념" 스위치를 읽고 있는 것입니다. 이것은 마치 무언가 말하고 싶은 강한 충동을 느끼는 사람과 같습니다. 그들은 자신이 하는 말이 사실적으로 틀렸을지라도, 말할 준비가 되어 있다고 느낄 수 있습니다.

이것이 중요한 이유

오랫동안 사람들은 AI의 언어적 자신감("95% 확신합니다")을 정확도의 직접적인 척도로 취급해 왔습니다. 우리는 AI가 확신한다고 말하면 그 답을 믿을 수 있다고 가정했습니다.

이 논문은 이것이 실수라고 주장합니다.

  • 언어적 자신감행동 신호입니다. 그것은 당신에게 이렇게 말하는 것입니다: "나는 이 답을 인간에게 보여줄 준비가 되었습니다."
  • 수학적 자신감진실 신호입니다. 그것은 당신에게 이렇게 말하는 것입니다: "이 답은 정답일 가능성이 높습니다."

만약 당신이 로봇의 말을 보고 답이 참인지 결정하려 한다면, 속을 수 있습니다. 로봇의 "진실 스위치"는 깜빡거리고 있음에도 불구하고, "전념 스위치"가 켜져 있기 때문에 틀린 답에 대해 매우 열정적으로 전념할 수 있기 때문입니다.

결론

연구의 결론은 우리가 AI의 언어적 자신감을 단순한 "진실 측정기"로 취급하는 것을 멈춰야 한다는 것입니다. 대신, 그것을 "전념 측정기"로 이해해야 합니다. 그것은 AI가 입장을 취할 준비가 되었음을 알려주지만, 그 입장이 견고한 지반 위에 있다는 것을 반드시 보장하지는 않습니다. 그 답이 실제로 맞는지 알고 싶다면, 단순히 로봇의 열정적인 말이 아니라 기저에 깔린 수학(로그 확률)을 살펴봐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →