← 최신 논문
💬 NLP

Closing the Confidence-Faithfulness Gap in Large Language Models

이 논문은 대형 언어 모델에서 신뢰도와 정확도가 선형적으로 인코딩되지만 서로 직교하며 추론 과정이 신뢰도 표현을 왜곡한다는 '추론 오염 효과'를 규명하고, 이를 기반으로 내부 정확도 추정을 반영하는 2 단계 적응형 조향 파이프라인을 제안하여 캘리브레이션 오차를 획기적으로 개선합니다.

원저자: Miranda Muqing Miao, Lyle Ungar

게시일 2026-03-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Miranda Muqing Miao, Lyle Ungar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 1. 문제: "거짓말쟁이"가 된 AI

우리가 AI 에게 질문하면, AI 는 종종 **"저는 95% 확신합니다!"**라고 말합니다. 하지만 실제로는 그 답변이 40% 만 맞을 때도 있습니다.
이는 마치 실력 없는 학생이 시험을 치르고 "저는 100% 맞췄어요!"라고 큰소리치는 것과 같습니다.
기존 연구들은 "학생에게 더 많이 공부시켜라 (재학습)"거나 "시험지 지시사항을 바꿔라 (프롬프트 수정)"는 식으로 접근했지만, 이 논문은 **"학생은 사실 정답을 알고 있는데, 그걸 입으로 말하는 법을 잊어버린 것"**이라고 보았습니다.

🔍 2. 발견: 뇌속의 '두 개의 다른 신호'

연구진은 AI 의 두뇌 (내부 데이터) 를 들여다보니 놀라운 사실을 발견했습니다.

  • 신호 A (진짜 실력): AI 는 문제를 풀 때, "이건 내가 틀릴 수도 있겠다"는 진짜 확률을 뇌의 한 구석에 정확히 저장하고 있었습니다.
  • 신호 B (입으로 말하는 것): 하지만 AI 가 "저는 95% 확신해요"라고 말할 때는, 그 진짜 신호를 무시하고 별도의, 전혀 다른 길을 따라 말을 꺼냈습니다.

비유하자면:
AI 의 뇌속에는 **'진짜 점수'**를 알려주는 A 라는 나침반과, **'입으로 말하는 자신감'**을 조절하는 B 라는 나침반이 있습니다. 문제는 이 두 나침반이 서로 90 도 각도로 완전히 다른 방향을 가리키고 있다는 것입니다. 그래서 AI 는 "내가 틀릴 수도 있어 (A)"라고 느끼면서도, 입으로는 "나는 완벽해 (B)"라고 말하게 된 것입니다.

⚠️ 3. 새로운 발견: "생각하는 과정이 말을 망친다"

더 재미있는 발견이 있습니다. AI 에게 **"문제를 풀면서 동시에 자신감도 말해봐"**라고 하면 상황이 더 나빠집니다.
이것을 논문에서는 **'추론 오염 (Reasoning Contamination)'**이라고 부릅니다.

  • 비유: AI 가 어려운 문제를 풀려고 애쓰는 동안, 뇌속의 '고민하는 에너지'가 '자신감 신호'를 방해합니다. 마치 운전하면서 동시에 노래를 부르려다 운전 실수가 늘어나는 것처럼, 문제를 풀려고 애쓸수록 AI 는 오히려 "내가 틀렸는데도" 더 자신 있게 말하게 됩니다.
  • 결과: 문제를 풀고 자신감을 말하는 두 가지 작업을 동시에 하면, AI 는 정반대의 신호를 보내게 되어 더 큰 착각에 빠집니다.

🛠️ 4. 해결책: "내부 신호를 읽어와서 말을 고쳐주기"

저자들은 AI 를 다시 가르치지 않고, AI 가 이미 알고 있는 '진짜 점수'를 읽어와서 말투만 고쳐주는 방법을 개발했습니다.

  1. 1 단계 (진짜 점수 읽기): AI 가 문제를 풀기 전, 뇌속의 '진짜 점수 (실력)'를 미리 읽어옵니다. (예: "아, 이 문제는 60% 만 맞출 수 있겠구나.")
  2. 2 단계 (말투 조정): AI 가 입을 열기 직전, 그 '진짜 점수'에 맞춰 말투를 살짝 조정해 줍니다.
    • "내가 95% 확신해!"라고 말하려던 AI 를, "아니, 60% 정도만 확신해"라고 조정해 주는 것입니다.

비유하자면:
AI 가 "나는 100 점 맞췄어!"라고 외치려 할 때, 옆에서 내부 점수표를 보고 "아니야, 너는 60 점 맞았어. 그러니까 '60 점 확신해'라고 말해"라고 중재자가 개입하는 것과 같습니다.

📈 5. 결과: 놀라운 변화

이 방법을 적용하자 AI 의 말과 실력이 거의 완벽하게 일치하게 되었습니다.

  • 기존에 35% 정도였던 오차 (잘못된 자신감) 가 3% 수준으로 줄었습니다.
  • 이 기술은 수학 문제, 일반 상식, 사실 확인 등 다양한 분야에서, 그리고 다른 AI 모델들에서도 잘 작동했습니다.

💡 결론: "지식이 부족해서가 아니라, 말하는 법을 몰라서"

이 논문의 핵심 메시지는 **"AI 는 이미 정답을 알고 있다. 다만 그걸 어떻게 말해야 할지 (읽어내는 법) 를 모를 뿐이다"**입니다.

우리는 AI 를 다시 가르치거나 (재학습) 억지로 말을 바꾸게 (프롬프트) 할 필요 없이, AI 가 이미 뇌속에 가지고 있는 '진짜 신호'를 찾아내서 말로 연결해 주기만 하면, 훨씬 더 신뢰할 수 있는 AI 가 될 수 있다는 것을 증명했습니다.

이제 AI 는 "내가 틀릴 수도 있어"라고 솔직하게 말할 수 있게 된 것입니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →