← 최신 논문
📊 statistics

When are likely answers right? On Sequence Probability and Correctness in LLMs

이 논문은 거대 언어 모델에서 시퀀스 확률과 정답성 사이의 관계를 조사하며, 높은 확률이 고정된 데이터셋 내에서는 정답성을 예측하는 경우가 많지만, 디코딩 방식의 변경을 통해 정확도를 향상시키거나 동일한 프롬프트에 대한 정답 여부를 구별하는 데에는 신뢰할 수 있는 지표가 아님을 밝혀냈다.

원저자: Johannes Zenn, Jonas Geiping

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Johannes Zenn, Jonas Geiping

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 거의 모든 책이 있는 도서관의 책을 거의 다 읽은 초강력 상상력을 가진 스토리텔러라고 상상해 보세요. 당신이 이 스토리텔러에게 프롬프트(이야기 시작점)를 주면, 그들은 단순히 하나의 결말만을 내놓는 것이 아니라 수천 가지의 서로 다른 가능한 결말을 만들어낼 수 있습니다.

이 논문이 던지는 핵심 질문은 이것입니다: "만약 어떤 이야기의 결말이 스토리텔러에게 매우 '그럴듯하거나(likely)' '자연스럽게(natural)' 느껴진다면, 그것이 실제로 '정답'이라는 뜻일까요?"

저자들은 모델의 "확률"(모델이 특정 문장이 얼마나 발생 가능성이 높다고 생각하는지)을 신뢰도 측정기로 취급했습니다. 그들은 이 신뢰도의 볼륨을 높이는 것이 실제로 더 나은 답변으로 이어지는지를 알고 싶었습니다.

다음은 이를 쉬운 비유로 나누어 설명한 결과입니다.

1. "도서관" 비유 (데이터셋 내부)

연구 결과: 특정 유형의 질문(예: 수학 시험)에 대해 생성된 답변 뭉치를 살펴보면, 모델이 가장 "그럴듯하다"고 생각하는 답변들이 대개 정답인 경우가 많습니다.

  • 비유: 책들을 정리해 둔 사서가 있다고 상상해 보세요. 만약 당신이 "이 중에서 자동차 수리에 대한 올바른 가이드가 담긴 책은 무엇인가요?"라고 묻는다면, 사서는 자신이 가장 확신하는 책을 가리킵니다. 여러 가지 서로 다른 질문들을 모아 놓고 볼 때, 사서는 대개 옳습니다.
  • 함정: 이것은 서로 다른 질문들을 서로 비교할 때만 유효합니다. 이것이 특정 한 가지 질문에 대해 사서가 확신을 가진다고 해서, 그 사서가 반드시 정답을 고르는 데 완벽하다는 뜻은 아닙니다.

2. "조절 노브" 비규 (설정 변경)

연구 결과: 설정을 변경하여(예: 무작위성을 줄이기 위해 다이얼을 돌려) 모델을 "더 확신하게" 만들려고 시도하더라도, 반드시 더 나은 답변을 얻게 되는 것은 아닙니다. 사실, 여러분은 종종 더 똑똑해지는 대신 단지 더 자신감 있게 들리는 답변을 얻게 될 뿐입니다.

  • 비유: 라디오를 상상해 보세요. 음악이 더 크고 명확하게 들리도록 "신호 강도" 노브를 돌릴 수 있습니다. 하지만 너무 높게 돌리면, 실제 노래와는 상관없이 아주 크고 명확하게 들리는 잡음(static)을 듣게 될 수도 있습니다.
  • 실제: 이 논문은 "가장 확률 높은" 시퀀스를 선택하도록 모델의 설정을 조정하는 것이 모델을 더 확신에 차 보이게 만들 수는 있지만, 모델을 더 똑똑하게 만들지는 못한다는 것을 발견했습니다. 때로는 "가장 그럴듯한" 경로가 사실은 함정일 수 있습니다.

3. "군중 투표" 비유 (동일 질문, 서로 다른 답변)

연구 결과: 만약 모델에게 똑같은 질문을 32번 던진다면, "가장 그럴듯한" 답변이 항상 정답은 아닙니다. 모델은 32개의 서로 다른 답변을 내놓을 수 있으며, 모델이 가장 확률이 높다고 생각하는 답변이 틀릴 수도 있습니다.

  • 비유: 32명의 사람에게 똑같은 수수께끼를 낸다고 상상해 보세요. 당신이 "여기서 누가 가장 똑똑한가요?"라고 묻습니다. 손을 가장 크게 흔드는 사람(높은 확률)이 반드시 정답을 알고 있는 사람은 아닙니다. 때로는 의견이 갈릴 수 있고, "목소리가 큰" 답변은 그저 인기 있는 추측일 뿐 진실이 아닐 수도 있습니다.
  • 예외: 논문은 특정 유형의 퍼즐(수학 문제)에서는 "가장 큰 목소리"가 대개 가장 똑똑하다는 것을 발견했습니다. 하지만 다른 유형의 질문(지시 사항 이행이나 의료 조언 등)의 경우, "큰 목소리"는 조용한 답변들만큼이나 틀릴 가능성이 높았습니다.

4. "자기 개선"의 함정

연구 결과: 어떤 이들은 AI가 자신의 "최선의" 답변을 골라 학습하게 함으로써 AI를 더 똑똑하게 만들려고 시도합니다. 이 논문은 이것이 위험하다고 경고합니다.

  • 비유: 수학 실력을 키우려는 학생이 자신이 맞다고 생각하는 답들만 공부하며 공부한다고 상상해 보세요. 만약 학생이 이미 수학을 꽤 잘하는 상태가 아니라면, 학생은 "오, 이 틀린 답이 매우 익숙하게 느껴지니, 이게 맞음에 틀림없어!"라고 생각하며 자신의 실수를 계속 강화하게 될 것입니다.
  • 교훈: 당신이 "확신"을 사용하여 AI를 개선할 수 있는 경우는 AI가 이미 그 과업에 능숙할 때뿐입니다. 만약 AI가 어려움을 겪고 있다면, 자신의 확신을 믿는 것은 그저 더 자신감 있게 틀리는 결과를 초래할 뿐입니다.

"경험칙(Rules of Thumb)" 요약

이 논문은 모델을 사용하는 것에 대해 세 가지 주요 시사점을 줍니다.

  1. "볼륨"을 믿지 마세요: 모델이 어떤 답변이 "매우 높은 확률"이라고 말한다고 해서 그것이 반드시 옳은 것은 아닙니다.
  2. 맥락이 중요합니다: "확신을 느끼는 것"과 "옳은 것" 사이의 관계는 질문의 유형(수학은 코드와 다르며, 코드는 지시 사항 이행과 또 다릅니다)에 따라 달라집니다.
  3. 과도하게 최적화하지 마세요: 설정을 변경하여 모델을 더 "확률 높게" 만들려고 강제하는 것은 대개 도움이 되지 않으며 오히려 성능을 해칠 수 있습니다.

요약하자면: 모델의 "직감"(확률)은 큰 그림을 볼 때는 유용한 단서가 되지만, 단 하나의 구체적인 문제를 해결하는 데 있어서는 형편없는 나침반입니다. 단순히 "확신 다이얼"을 높인다고 해서 답변이 더 좋아질 것이라고 기대할 수는 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →