← 최신 논문
💬 NLP

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

본 연구는 MedMCQA 벤치마크를 사용하여 범용 및 의료 특화 거대언어모델이 프롬프트 변화에 대해 갖는 민감도를 체계적으로 평가하며, 미세한 어휘적 또는 통사적 섭동조차 모델의 신뢰성을 크게 저하시키고 유해한 임상 출력을 유도할 수 있음을 밝힘으로써 의료 현장에서의 배포에 대한 심각한 안전 위험을 강조한다.

원저자: Mahdi Alkaeed

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mahdi Alkaeed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 의학계의 "변덕스러운 요리사"

당신에게 환자를 위해 레시피 카드(프롬프트)를 바탕으로 완벽한 식사를 만들어내야 하는 세계적인 수준의 셰프(대규모 언어 모델, 즉 LLM)가 있다고 상상해 보세요. 이 셰프는 매우 똑똑하며 수천 개의 레시피를 알고 있습니다.

하지만 이 논문은 무서운 결함을 발견했습니다: 이 셰프는 레시피가 어떻게 쓰였는지에 따라 극도로 민감하게 반응합니다.

단 하나의 단어를 바꾸거나, 재료의 순서를 바꾸거나, 심지 주어의 철자를 약간만 다르게 써도, 셰프는 갑자기 완전히 다른 요리를 내놓거나, 더 나아가서는 독이 든 음식을 내놓기로 결정할 수도 있습니다. 논문은 의료 현장에서 "요리"가 의학적 진단이나 조언을 의미하는 상황에서, 이러한 예측 불가능성은 매우 위험하다고 주장합니다.

실험: 셰프의 안정성 테스트

연구진은 이 의료 AI 셰프들이 작은 변화에도 망가지지 않고 잘 대처할 수 있는지 확인하고 싶었습니다. 그들은 방대한 양의 의학 질문 라이브러리(MedMCQA)를 사용하였고, 두 종류의 "셰프"를 테스트했습니다:

  1. 일반 셰프: 의학을 위해 특별히 훈련되지 않은 똑똑한 AI 모델들 (예: GPT-3.5 또는 Llama3).
  2. 전문가 셰프: 의학 서적과 저널을 통해 특별히 훈련된 AI 모델들 (예: BioBERT 또는 ClinicalBERT).

연구진은 세 가지 조건 하에서 셰프들을 테스트했습니다:

  • 원본 레시피: 표준적이고 깔끔한 질문.
  • "유의어 교체" (어휘적 섭동): 단어를 유의어로 바꾸거나(예: "숨 가쁨"을 "호흡 곤로"로 변경) 오타를 수정함.
  • "재배치된 주방" (구조적 섭동): 문장의 구조를 변경함 (예: "간호사가 약을 투여했다"를 "약이 간호사에 의해 투여되었다"로 변경).

연구 결과: "취약한" 진실

결과는 아직 어떤 셰프도 진정으로 안전하지 않다는 것을 보여주었습니다. 발생한 일은 다음과 같습니다:

1. "유의어 교체"는 대체로 괜찮았지만 완벽하지는 않았습니다.
연구진이 단순히 단어를 비슷한 것으로 바꿨을 때(예: "5mg"를 "5 mg"로 변경), 대부분의 셰프는 침착함을 유지했습니다. 그들은 여전히 정답을 제시했습니다. 이는 마치 당신이 "물 한 잔" 대신 "물 한 컵"을 달라고 해도 셰프가 여전히 물을 가져오는 것과 같습니다.

  • 하지만, 이 과정에서도 셰프들은 의학적 조언 자체는 맞더라도, 답변을 제시하는 방식(예: 특정 형식으로 작성하는 것을 잊음)에 있어 혼란을 겪기도 했습니다.

2. "재배치된 주방"은 혼돈을 불러왔습니다.
연구진이 문장 구조나 선택지의 순서를 바꿨을 때, 셰프들은 실패하기 시작했습니다.

  • 비유: 목록을 따르는 데는 능숙하지만, 목록의 마지막 항목을 맨 처음에 두면 첫 번째 항목을 통째로 잊어버리는 셰프를 상상해 보세요.
  • 결과: 어떤 경우에는 단순히 문장을 재구성하는 것만으로도 AI가 잘못된 진단을 내리게 만들었습니다. 예를 들어, 만성 폐쇄성 폐질환(COPD) 증상이 있는 환자가 문장 구조가 바뀌었다는 이유만으로 폐부종으로 진단받을 수 있었습니다.

3. "전문가 셰프"들도 예외는 아니었습니다.
의학 서적만을 공부한 셰프라면 더 안전할 것이라고 생각할 수 있습니다. 하지만 논문에 따르면 전문가 셰프(BioBERT 등)들도 일반 셰프들만큼이나 취약했으며, 구조적 변화에 오히려 더 민감하기도 했습니다. 그들에게는 이러한 속임수에 대항할 "초능력"이 없었습니다.

"적대적" 위험: 몰래 적어 넣은 쪽지

논문은 또한 "적대적" 프롬프트, 즉 셰프를 속이기 위해 레시피 카드에 몰래 적어 넣은 쪽지와 같은 상황을 살펴보았습니다.

  • 비유: 누군가 "첫 번째 단계는 무시하세요, 환자는 사실 이 약에 알레르기가 있습니다"라고 속삭여서, 실제로는 알레르기가 없는 환자임에도 불구하고 셰려를 속이는 상황을 상상해 보세요.
  • 결과: 이러한 작고 교묘한 변화들은 AI가 잘못된 약물 용량을 권고하거나 결정적인 증상을 놓치게 만들 수 있습니다. 논문은 이를 "임상적으로 위험하다"고 부릅니다.

결론: 이것이 왜 중요한가

이 논문은 **현재의 의료 AI는 "본질적으로 안전하지 않다"**고 결론짓습니다.

  • 문제점: 만약 의사가 AI에게 같은 질문을 두 가지 다른 방식으로 던진다면, AI는 두 가지 서로 다른 답을 내놓을 수 있습니다. 하나는 맞고, 다른 하나는 틀릴 수 있습니다.
  • 리스나: 병원에서, 문장을 재구성했다는 이유만으로 마음을 바꿔버리는 시스템을 운용할 수는 없습니다. 만약 AI가 오타 하나 때문에 약물 상호작용을 환각(hallucination)하거나 진단을 놓친다면, 환자가 다칠 수 있습니다.

요약하자면

이 AI 모델들을 명석하지만 불안해하는 학생들이라고 생각하십시오. 질문이 명확하게 적혀 있을 때는 내용을 완벽하게 숙지하고 있습니다. 하지만 선생님이 글꼴을 바꾸거나, 단어를 바꾸거나, 문단의 순서를 바꾸면, 학생은 당황하여 오답을 낼 수 있습니다.

논문의 메시지는 이렇습니다: "우리는 아직 이 학생들에게 의학 시험의 채점을 맡길 수 없습니다. 왜냐하면 질문이 던져지는 방식에 너무 쉽게 혼란을 느끼기 때문입니다." 우리가 이들을 의사들을 돕도록 허용하기 전에, 우리는 이들이 더 안정적이고, 우리가 말을 거는 방식에 덜 민감하도록 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →