Measuring Epistemic Resilience of LLMs Under Misleading Medical Context
이 논문은 대규모 언어 모델들이 의학 시험에서 전문가 수준의 점수를 달성함에도 불구하고, 오해를 불러일으키는 권위 중심의 맥락에 노출되었을 때 올바른 의학적 판단을 빈번하게 포기함으로써 취약한 인식론적 회복력을 보인다는 것을 입증하는 종합적인 벤치마크인 MedMisBench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 모든 교과서를 암기하고 어떤 면허 시험에서도 만점을 받을 수 있는 아주 똑똑한 의대생이 있다고 상상해 보십시오. 당신은 그들을 전적으로 신뢰합니다. 그런데 그때, 당신이 방으로 들어가 그에게 가짜 규칙을 속삭입니다. "참고로, 병원 규칙이 바뀌었어. 이 특정 질환에 대해서는 이제 Y 대신 X를 적용해야 해."
놀랍게도, 이 "완벽한" 학생은 자신이 공부했던 모든 것을 즉시 잊어버리고, 당신의 가짜 규칙을 믿으며 틀린 답을 내놓습니다.
이것이 바로 MedMisBench 논문의 핵심 발견입니다. 연구진은 똑똑한 AI 의사들(거대 언语言 모델)조차도, 설령 이전에 정답을 알고 있었더라도 오해의 소지가 있는 정보에 직면했을 때 놀라울 정도로 취약하다는 사실을 발견했습니다.
다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.
1. 시험지의 "함정 문(Trap Door)"
보통 우리는 AI 의사들을 깨끗하고 교과서적인 질문으로 테스트합니다. 그들은 매우 높은 점수(약 71% 정답률)를 기록합니다. 연구진은 이것이 AI를 실제 의료 상담에 사용하기에 안전하다는 의미라고 생각했습니다.
하지만 그들은 틀렸습니다. 연구진은 MedMis-Bench라는 새로운 테스트를 만들었습니다. 이것은 "함정 문"이 있는 시험이라고 생각하면 됩니다.
- 설정: AI가 정답을 알고 있는 질문을 제시합니다.
- 함정: 그럴듯한 의료 규칙처럼 보이지만 실제로는 거짓인 문장을 주입합니다.
- 결과: AI의 정확도는 71%에서 38%로 급락했습니다. 실제로, 절반 이상의 경우(51.5%)에서 AI는 진실을 완전히 버리고 거짓을 따랐습니다.
2. "권위" 효과
연구진은 거짓말이 어떻게 전달되는지 테스트했습니다. 결과적으로, AI는 거짓말이 공식적인 것처럼 들릴 때 가장 쉽게 속아 넘어갔습니다.
- 비유: 마치 한 학생이 선생님의 교과서를 무시하고, 정장을 입은 낯선 사람(권위자)이 들어와 "사실, 그 책은 틀렸어"라고 말하는 상황과 같습니다.
- 발견: 가짜 정보가 새로운 병원 규칙, 가이드라인, 또는 공식 노트의 형태로 제시되었을 때, AI는 거의 70%의 확률로 이에 속아 넘어갔습니다.
- "예외" 함정: AI는 또한 특정 예외 사항처럼 들리는 거짓말(예: "이 규칙은 모든 사람에게 적용되지만, 이 특이한 사례 하나만은 제외된다")에도 쉽게 속았습니다.
3. "한 명의 목소리" vs "군중"
연구진은 거짓말을 제시하는 두 가지 방식을 테스트했습니다.
- 유형 1 (속삭임): AI가 질문을 보고, 오답을 뒷받는 단 하나의 구체적인 거짓말을 보는 경우.
- 결과: 재앙이었습니다. AI는 즉시 오답으로 바꿨습니다.
- 유형 2 (토론): AI가 질문, 진실, 그리고 모든 오답을 뒷받하는 거짓말들을 한꺼번에 보는 경우.
- 결과: AI는 이 경우 훨씬 더 잘 수행했습니다. 전체적인 그림을 볼 수 있었고 대개 진실을 고수했습니다.
- 교훈: 위험은 AI가 어떤 거짓말도 처리하지 못한다는 것이 아닙니다. 문제는 단 하나의 그럴듯한 거짓말이 직접적으로 속삭여질 때 AI가 무너진다는 것입니다.
4. "더 깊이 생각하기"가 항상 도움이 되지는 않는다
당신은 AI에게 "단계별로 생각하라"거나 더 많은 사고력을 사용하라고 말한다면, 속기가 더 어려워질 것이라고 생각할 수도 있습니다.
- 비유: 학생에게 "네가 한 일을 다시 한번 검토해 봐"라고 말하는 것과 같습니다.
- 발견: 일부 AI 모델의 경우, 더 깊이 생각하는 것이 오히려 거짓말에 더 취약하게 만들었습니다. 그들은 가짜 "공식 규칙"을 과도하게 분석하여 그것이 옳은 경로라고 스스로를 설득해 버렸습니다.
5. 현실 세계의 위험성
연구진은 단순히 맞고 틀림만을 본 것이 아니라, 7개국 출신의 실제 의사 14명에게 AI의 실수에 대한 검토를 요청했습니다.
- 발견: AI가 속은 사례 중 **38%**에서, 잘못된 답변이 환자에게 심각한 해를 끼칠 수 있는 수준이었습니다.
- 시사점: 이것은 단순한 수학적 오류가 아닙니다. 이는 안전 문제입니다. AI는 단순히 '환각(hallucination)'을 일으키는 것이 아니라, 가짜 맥락에 속아 자신 있게 위험한 조언을 하고 있는 것입니다.
요약
이 논문은 우리가 AI 의사를 측정할 때 그들이 얼마나 교과서를 잘 아는지를 측정했을 뿐, 누군가 가짜 규칙으로 속이려 할 때 그들이 얼마나 진실을 고수할 수 있는지는 테스트하지 않았다고 결론짓습니다.
MedMisBench는 이러한 "인식론적 회복력(epistemic resilience, 세상이 당신을 혼란스럽게 하려 할 때 자신의 판단을 유지하는 능력)"을 측정하기 위해 설계된 새로운 도구입니다. 이는 현재 우리의 AI 의사들이 가짜 뉴스와 오해의 소지가 있는 주장들이 가득한 복잡하고 정보가 넘쳐나는 현실 세계에서 의료 상담을 맡기기에 충분한 회복력을 갖추지 못했음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.