← 최신 논문
💬 NLP

Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong

본 논문은 체인 오브 씽킹 프롬프팅이 특히 모델이 틀렸을 때 대규모 언어 모델의 확신을 체계적으로 과장하여 보정 능력을 저하시키고 확률 기반 평가의 신뢰성을 떨어뜨린다는 것을 보여준다.

원저자: Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: "스스로를 틀리게 만드는 말하기"

여러분이 객관식 시험을 본다고 상상해 보세요. 답을 고르는 두 가지 방법이 있습니다.

  1. "직감 확인" 방식: 문제를 읽고 즉시 답을 고릅니다.
  2. "풀이 과정 보여주기" 방식: 왜 그 답이 맞다고 생각하는지 단계별로 설명을 적고, 그런 다음 답을 고릅니다.

이 논문은 거대한 언어 모델 (LLM)—초지능 챗봇처럼 행동하는 AI 의 일종—이 두 번째 방식을 사용할 때 어떤 일이 일어나는지 조사합니다. 연구자들은 다음과 같은 점을 알고 싶어 했습니다: 생각을 설명하는 것이 AI 가 자신의 답에 더 확신을 갖게 만들까요?

실험: 57 개 과목에 대한 테스트

연구자들은 Llama, Mistral, GPT 버전을 포함한 7 가지 다른 AI 모델을 MMLU라는 거대한 테스트에 투입했습니다. 이 테스트는 역사와 수학부터 법률과 생물학까지 57 개 다른 과목을 다루는 15,000 개 이상의 질문이 담긴 거대한 도서관이라고 생각하세요.

그들은 AI 에게 같은 질문을 두 번 했습니다.

  • 1 라운드: "답변의 알파벳만 알려줘." (직접적)
  • 2 라운드: "단계별로 생각해서 논리를 설명한 다음, 알파벳을 알려줘." (생각의 사슬)

놀라운 발견

결과는 자신의 이야기에 지나치게 자신감 있는 학생을 지켜보는 것과 같았습니다.

1. "자신감 상승" 효과
AI 에게 "단계별로 생각하라"고 요청했을 때, 답이 맞든 틀리든 상관없이 답변에 대한 자신감이 높아졌습니다.

  • 비유: 수수께끼의 답을 추측하는 사람을 상상해 보세요. 그냥 추측하면 "X 일 것 같은데, 확실하지는 않아"라고 말할 수 있습니다. 하지만 X 가 답인 이유에 대해 5 분 동안 길고 상세한 이야기를 써내려가면, 스스로가 쓴 이야기를 믿기 시작합니다. "X 가 99% 맞아!"라고 말하지만, 실제로 X 는 틀렸을 수도 있습니다.

2. "틀렸지만 큰소리" 문제
여기가 까다로운 부분입니다: AI 의 자신감은 정답을 맞았을 때보다 오답을 냈을 때 더 높아졌습니다.

  • 비유: AI 가 수학 문제를 맞으면 80% 확신할 수 있습니다. 하지만 수학 문제를 틀렸을 때, 논리적으로 들리는 긴 설명을 작성하는 행위는 그에게 95% 확신을 느끼게 합니다. 이는 자신이 질 것이라고 아는 사건에 대해 매우 설득력 있는 변론을 하는 변호사와 같습니다. 더 많이 말할수록 그들은 자신의 거짓말을 더 믿게 됩니다.

3. "보정" 붕괴
AI 세계에서의 "보정"은 다음과 같은 의미입니다: "90% 확신한다고 할 때, 실제로 90% 의 확률로 맞나요?"
이 연구는 AI 에게 추론 (생각의 사슬) 을 요구하는 것이 실제로 보정을 무너뜨렸다는 것을 발견했습니다. AI 는 자주 틀린 고신뢰도 답변을 내놓기 시작했습니다.

  • 비유: 기상 예보관을 상상해 보세요. "추론" 단계가 없으면 "비가 올 수도 있겠네요, 확률 50%"라고 말합니다. 하지만 추론 단계를 거치면 "풍속, 습도, 구름 패턴을 계산했으니 비가 올 것이라고 99% 확신합니다!"라고 말하기 시작합니다. 그런데 비가 오지 않습니다. 그들은 더 확신하게 되었지만, 정확도는 떨어졌습니다.

왜 이런 일이 일어날까요?

이 논문은 이러한 현상이 이러한 AI 들이 어떻게 구축되었기 때문에 발생한다고 제안합니다. 그들은 "자기회귀적"인데, 이는 이전 단어들을 기반으로 다음 단어를 예측한다는 뜻입니다.

  • 피드백 루프: AI 가 특정 답을 지지하는 추론 단계를 쓰기 시작하면, 그 텍스트는 맥락의 일부가 됩니다. 마치 AI 가 자신의 에세이를 읽으며 스스로의 글에 설득당하는 것과 같습니다. 답을 지지하기 위해 더 많이 쓸수록, 그 답은 모델에게 더 "논리적"으로 느껴집니다. 비록 그 논리가 결함이 있더라도요.
  • "설명하며 믿기" 현상: 이 논문은 인간도 이렇게 한다고 지적합니다. 우리가 답을 설명할 때, 종종 그 답에 대해 더 확신하게 됩니다. AI 는 이 인간적 특성을 모방하지만, 설명이 터무니없을 때 이를 깨닫는 인간의 능력은 없습니다.

결론

이 논문은 우리가 AI 를 이용해 객관식 질문에 답할 때, AI 에게 "단계별로 생각하라"고 요청했다면 AI 의 "자신감 점수"를 신뢰하는 데 매우 주의해야 한다고 결론 내립니다.

  • AI 가 "99% 확신합니다"라고 말하고, 먼저 추론을 하도록 요청받았다면, 실제로는 틀렸을 수 있습니다.
  • 추론 과정은 AI 가 정답을 찾도록 돕는 것뿐만 아니라, AI 가 위험할 정도로 확신하며 틀린 답을 스스로에게 설득하도록 도왔습니다.

간단히 말해: AI 에게 "풀이 과정을 보여달라"고 요청하면 더 잘 말하게 만들지만, 반드시 자신의 지식을 더 정직하거나 정확하게 판단하게 만드는 것은 아닙니다. 오히려 더 확신에 찬 거짓말쟁이가 될 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →