← 최신 논문
💬 NLP

Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models

본 연구는 300 개의 위장관학 문제 평가를 통해 최신 대규모 언어 모델들이 높은 성능을 보임에도 불구하고 일관되게 과신하는 경향을 보이며, 의료 현장에서의 안전한 활용을 위해 불확실성 정량화가 중요한 과제임을 밝혔습니다.

원저자: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🩺 1. 연구의 배경: "잘 아는 척하는 AI 들"

최근 의료 분야에서 AI(거대 언어 모델) 가 많이 쓰이고 있습니다. 하지만 AI 는 가끔 완전히 엉뚱한 말을 하면서도, 마치 100% 확신하는 것처럼 말하는 '환각 (Hallucination)' 현상이 있습니다.

  • 비유: 마치 시험을 전혀 공부하지 않은 학생이, 정답을 모르면도 "이건 내가 100% 알고 있어!"라고 큰소리로 외치는 것과 같습니다.
  • 문제점: 의사는 환자의 생명을 다루는데, AI 가 틀린 답을 확신 있게 말하면 큰 사고가 날 수 있습니다. 그래서 **"AI 가 틀렸을 때, '나는 모른다'라고 솔직하게 말할 수 있을까?"**가 핵심 질문입니다.

📝 2. 실험 방법: "내과 전문의 시험지"

연구진은 미국 소화기내과 협회의 **전문가용 시험지 (300 문항)**를 준비했습니다. 이 시험지는 AI 들이 훈련 데이터로 보지 못했을 가능성이 높은 최신 문제들입니다.

  • 참가자: GPT, Claude, Llama 등 48 가지 다양한 AI 모델들.
  • 과제: 문제를 풀고, 정답을 고른 후 **"이 답에 대해 0~10 점 중 몇 점만큼 확신하나요?"**라고 스스로 점수를 매기게 했습니다.
  • 목표: AI 가 맞았을 때는 확신 점수가 높고, 틀렸을 때는 확신 점수가 낮아지는지 (즉, 자신의 실력을 정확히 아는가) 확인하는 것이었습니다.

🔍 3. 연구 결과: "과신 (Overconfidence) 의 덫"

결과는 다소 충격적이었습니다.

  1. 모두가 너무 자신합니다:
    • AI 들은 평균적으로 정답률보다 훨씬 높은 점수로 자신감을 표시했습니다.
    • 비유: 시험에서 60 점만 맞았는데, "내가 90 점짜리 실력자야!"라고 말하는 것과 같습니다. 특히 틀린 답을 고른 경우에도 "정답이야!"라고 8~9 점의 높은 확신을 보였습니다.
  2. 최신 모델도 마찬가지:
    • GPT-4o 나 Claude 3.5 같은 최신 모델이 정답률은 높았지만, 틀렸을 때 "틀렸을지도 모른다"라고 인정하는 능력은 여전히 부족했습니다.
    • 비유: 최신형 스포츠카 (최신 AI) 는 속도가 빠르고 정답을 맞히는 능력은 뛰어나지만, "이 길은 막혔을지도 몰라"라고 운전자가 경고하는 능력은 여전히 초보 수준입니다.
  3. 확신 점수와 난이도의 관계:
    • 문제가 어려워질수록 AI 의 정답률은 떨어졌지만, 자신감 점수는 그대로 높게 유지되었습니다.
    • 비유: 산이 험해져서 걸을 수 없게 되었는데도, "나는 여전히 정상까지 갈 수 있어!"라고 외치는 것과 같습니다.

📊 4. 주요 통계 (쉬운 해석)

  • Brier Score (오차율): 점수가 낮을수록 좋습니다. 가장 좋은 모델도 0.15~0.2 정도였는데, 이는 아직 의료 현장에서 안전하게 쓰기엔 오차가 너무 크다는 뜻입니다.
  • AUROC (구분 능력): 0.5 는 동전 던지기, 0.7 이상이어야 유용합니다. 모든 모델이 0.6 대에 머물러 있어, AI 가 "내가 맞았는지 틀렸는지"를 스스로 구분하는 능력은 여전히 무작위 수준에 가깝다는 결론입니다.

💡 5. 결론 및 시사점: "AI 는 아직 의사가 될 준비가 안 됐다"

이 연구는 **"AI 가 스스로의 불확실성을 솔직하게 말해주는 기술은 아직 의료 현장에 적용하기엔 너무 위험하다"**고 경고합니다.

  • 현재 상황: AI 는 지식이 풍부해졌지만, "내가 모르는 게 있다"는 사실을 인정하는 **지혜 (Self-awareness)**는 부족합니다.
  • 미래 전망: AI 가 더 똑똑해지면 이 능력도 따라올지 모릅니다. 하지만 지금은 AI 가 "100% 확신"한다고 해서 무조건 믿으면 안 됩니다.
  • 해결책: AI 가 스스로 점수를 매기는 방식만 믿지 말고, 사람 (의사) 이 최종 확인을 하거나, AI 가 "모른다"고 말할 때 이를 신뢰할 수 있는 새로운 훈련 방법이 필요합니다.

🎯 한 줄 요약

"최신 AI 들은 의학 문제를 잘 풀지만, 틀렸을 때 '나는 모른다'라고 솔직하게 인정하는 능력은 여전히 부족해서, 의료 현장에서 맹신하면 위험할 수 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →