← 최신 논문
💬 NLP

Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning

이 논문은 감독 미세조정 (SFT) 이 언어 모델의 출력 품질과 신뢰도 점수 간의 상관관계를 약화시켜 신뢰도 기반의 불확실성 정량화 기법의 실용성을 저해할 수 있음을 규명하고, 미세조정 후에도 견고한 새로운 지표 개발의 필요성을 강조합니다.

원저자: Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Jackie Chi Kit Cheung

게시일 2026-04-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Jackie Chi Kit Cheung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎓 핵심 이야기: "자신감은 항상 정답을 의미하지 않는다"

1. 배경: AI 의 '자신감'이란 무엇인가?

AI 가 글을 쓰거나 답을 할 때, "내가 이걸 90% 확신해!"라고 말해주는 숫자가 있습니다. 이를 **자신감 점수 (Confidence Score)**라고 합니다.

  • 좋은 점: 이 점수가 높으면 AI 가 정답일 가능성이 높고, 낮으면 "아, 내가 헷갈리는구나"라고 생각해서 인간이 다시 한번 확인해 볼 수 있습니다. (예: "이 답은 20% 만 확신하니까, 인간이 다시 확인해 주세요.")

2. 문제: 훈련 (SFT) 을 시키니 '자신감'이 망가졌다!

연구자들은 AI 를 특정 작업 (예: 번역, 수학 문제 풀이) 에 맞춰 더 잘하도록 훈련시켰습니다. 이를 **SFT(지도 미세 조정)**라고 합니다.

  • 예상: 훈련을 잘 시키면 AI 가 더 똑똑해지고, 자신의 자신감 점수도 정답과 잘 맞을 거라고 생각했습니다.
  • 현실 (충격): 아니요! 훈련을 시키자 자신감 점수와 정답 사이의 관계가 뒤틀리기 시작했습니다.

3. 발견된 두 가지 이상한 현상

① "아무것도 모르는데 자신만만해!" (과신, Overconfidence)

  • 비유: 시험을 보는데 정답을 모르고 엉뚱한 답을 적었는데, AI 는 "내가 100% 확신해! 이거 맞을 거야!"라고 큰소리를 칩니다.
  • 원인: AI 가 훈련 데이터와 비슷한 패턴을 보일 때, 정답이든 오답이든 무조건 "내 데이터에 익숙하니까 확신해!"라고 반응합니다. 마치 숙제 답안을 외운 학생이, 비슷한 문제가 나오면 정답을 모른 채도 "내가 다 알지!"라고 외치는 것과 같습니다.

② "정답인데 왜 이렇게 망설여?" (과소신, Underconfidence)

  • 비유: 정답을 딱 맞췄는데 AI 는 "음... 내가 이거 맞췄을까? 확신이 안 서는데..."라며 자신감 점수를 낮게 줍니다.
  • 원인: 훈련을 받으면서 AI 가 "아니, 이 답이 너무 완벽할 리가 없어"라고 의심하기 시작하는 경우입니다.

4. 왜 이런 일이 일어날까? (핵심 통찰)

논문은 이 현상의 원인을 아주 흥미롭게 설명합니다.

  • 질문: "AI 가 확신하는 이유는 '정답' 때문일까?"
  • 답변: "아닙니다. '내 훈련 데이터와 얼마나 비슷한가' 때문일 가능성이 큽니다."
  • 비유: AI 는 정답을 맞추는 게 아니라, **"내가 배운 책 (훈련 데이터) 에 나온 내용과 비슷한가?"**를 기준으로 자신감을 조절합니다. 그래서 훈련 데이터와 비슷한 엉뚱한 답을 내놓아도 "이거 내 책에 있잖아! 확신해!"라고 말합니다.

5. 실제 피해: "이게 왜 중요해?"

이 연구는 단순히 이론적인 문제가 아니라, 실제 사용 시 큰 위험이 될 수 있음을 보여줍니다.

  • 상황: AI 가 "이 답은 90% 확신합니다"라고 말하면, 우리는 그 답을 믿고 넘어갑니다.
  • 재앙: 하지만 훈련을 시킨 후 AI 가 틀린 답을 90% 확신으로 내놓으면? 우리는 그 틀린 답을 믿고 실수를 저지르게 됩니다.
  • 결과: 연구 결과, 훈련을 시킨 후 AI 가 틀린 답을 찾아내서 경고해 주는 능력 (정답을 골라내는 능력) 이 약 47% 나 떨어졌습니다.

💡 결론 및 교훈

이 논문의 결론은 매우 명확합니다.

  1. AI 의 '자신감 점수'는 그냥 믿으면 안 됩니다.

    • AI 를 새로 훈련 (Fine-tuning) 시켰다면, 그 AI 의 자신감 점수는 **새로고침 (재평가)**이 필요합니다. "오프더셸프 (Off-the-shelf, 그냥 가져다 쓰는)" 방식으로는 안 된다는 뜻입니다.
  2. 새로운 기준이 필요합니다.

    • AI 가 "내 훈련 데이터와 비슷해서 확신하는 것"과 "실제로 정답이라서 확신하는 것"을 구분할 수 있는 더 똑똑한 측정 방법이 필요합니다.
  3. 사용자 주의사항:

    • AI 모델을 특정 업무에 적용할 때, "이 모델이 틀린 답을 내놓을 때 얼마나 자신감 있게 틀린다고 할까?"를 반드시 테스트해봐야 합니다. 그렇지 않으면 AI 가 자신감 넘치게 엉뚱한 소리를 할 때, 우리가 속아 넘어갈 수 있습니다.

한 줄 요약:

"AI 가 훈련을 받으면, 정답이든 오답이든 '내 데이터와 비슷하다'는 이유로 자신감 점수를 높게 줍니다. 그래서 훈련된 AI 의 '자신감'은 믿을 수 없으며, 반드시 다시 검증해야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →