Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond
이 논문은 6개의 벤치마크 데이터셋을 통해 4가지 의료 정보 추출(MedIE) 작업에서 ChatGPT의 성능, 설명 가능성, 신뢰성 등을 체계적으로 분석하였으며, 그 결과 ChatGPT가 미세 조정된 모델보다 성능은 낮지만 설명력과 충실도는 높으나 과잉 확신과 생성의 불확실성이라는 한계가 있음을 보여줍니다.
지금 우리에게는 **'챗GPT'**라는 아주 똑똑하고 말 잘하는 신입 요리사가 왔습니다. 이 요리사는 레시피를 읽는 법도 알고, 손님과 수다도 잘 떨죠. 하지만 우리가 진짜로 원하는 건, 복잡한 식재료 목록(의료 데이터)을 보고 "이 재료는 무엇이고, 어떤 요리에 쓰이는지" 정확하게 분류해내는 전문적인 작업입니다.
연구진은 이 요리사가 진짜 실력이 있는지 확인하기 위해 5가지 항목으로 시험을 치렀습니다.
1. 실력 테스트 (Performance) 🍲
시험 내용: "이 식재료 리스트에서 채소, 고기, 양념을 정확히 골라내 봐!"
결과:"아직은 전문 요리사(기존 AI 모델)보다 서툴러요."
설명: 챗GPT는 아주 쉬운 재료 분류는 잘하지만, 재료가 서로 엉켜 있거나(중첩된 개체) 관계가 복잡하면(관계 추출) 전문적으로 훈련받은 기존 AI 모델들에 비해 정확도가 떨어졌습니다.
2. 설명 능력 (Explainability) 🗣️
시험 내용: "왜 이 재료를 '고기'라고 분류했는지 이유를 말해봐."
결과:"말은 아주 그럴싸하게 잘해요. 하지만 '허풍'이 좀 있어요."
설명: 챗GPT는 자기가 왜 그렇게 답했는지 논리적으로 아주 잘 설명합니다. 문제는, 자기가 틀린 답을 내놓았을 때도 마치 정답인 것처럼 아주 자신만만하게 설명한다는 점입니다. (이걸 '과잉 확신'이라고 합니다.)
3. 정직함 (Faithfulness) 📜
시험 내용: "딴소리하지 말고, 딱 주어진 식재료 목록에 있는 것만 골라내!"
결과:"시키는 대로 아주 잘 따라요."
설명: 챗GPT는 주어진 지시사항을 어기거나, 없는 재료를 갑자기 만들어내는(환각 현상) 일은 적었습니다. 시키는 규칙(포맷)을 지키는 능력은 훌륭했습니다.
4. 자신감 (Confidence) 😎
시험 내용: "네가 방금 고른 게 맞을 확률이 몇 퍼센트라고 생각해?"
결과:"정답을 맞히든 틀리든, 항상 '100% 확신합니다!'라고 외쳐요."
설명: 이게 가장 위험한 부분입니다. 진짜 정답을 맞혔을 때나, 완전히 틀렸을 때나 똑같이 높은 자신감을 보입니다. 마치 **"모르는 문제도 아는 것처럼 당당하게 말하는 학생"**과 같습니다. 의료 분야에서는 이런 '근거 없는 자신감'이 위험할 수 있죠.
5. 변덕 (Uncertainty) 🎲
시험 내용: "똑같은 재료 목록을 5번 줄 테니까, 매번 똑같이 분류해봐."
결과:"할 때마다 답이 조금씩 바뀌어요."
설명: 챗GPT는 매번 답변을 생성할 때 약간의 무작위성(랜덤함)이 섞여 있습니다. 그래서 똑같은 질문을 해도 결과가 미세하게 달라질 수 있는데, 이는 아주 정밀해야 하는 의료 데이터 추출 작업에서는 큰 걸림돌이 될 수 있습니다.
📝 요약하자면?
이 논문의 결론은 이렇습니다.
"챗GPT는 말솜씨가 좋고 지시도 잘 듣는 아주 유능한 조수 같지만, 아직 전문적인 의료 데이터를 다루기에는 '자신감만 너무 넘치고 가끔 변덕을 부리는' 면이 있다. 따라서 진짜 의사 선생님의 비서로 쓰려면, 이 '근거 없는 자신감'과 '변덕'을 잡는 공부가 더 필요하다!"
[기술 요약] 의료 정보 추출(MedIE) 작업에 대한 ChatGPT 평가: 성능, 설명 가능성 및 그 너머
1. 문제 정의 (Problem Statement)
최근 대규모 언어 모델(LLM)인 ChatGPT는 자연어 처리(NLP) 분야에서 혁신적인 능력을 보여주고 있습니다. 특히 의료 분야(MedNLP)는 고도의 전문 지식과 구조화된 데이터 추출 능력을 요구하므로, ChatGPT가 의료 정보 추출(Medical Information Extraction, MedIE) 작업에서 얼마나 신뢰할 수 있는 성능을 보이는지 체계적으로 검증할 필요가 있습니다. 기존 연구들은 주로 일반적인 NLP 작업이나 무작위 샘플에 집중되어 있어, 복잡한 의료 도메인에서의 **성능(Performance), 설명 가능성(Explainability), 충실성(Faithfulness), 신뢰도(Confidence), 불확실성(Uncertainty)**을 종합적으로 다룬 연구가 부족한 실정입니다.
2. 연구 방법론 (Methodology)
본 연구는 4가지 세부 MedIE 작업과 6개의 벤치마크 데이터셋을 사용하여 ChatGPT(gpt-3.5-turbo)를 다각도로 평가했습니다.
A. 대상 MedIE 작업
개체명 인식 (NER): 의료 관련 개체(질병, 약물 등) 식별 및 분류.
트리플 추출 (TE): 개체 간의 관계(예: 질병-증상 관계)를 공동 추출.
임상 이벤트 추출 (CEE): 이벤트 트리거 식별, 유형 분류 및 인자(Argument) 추출.
ICD 코딩 (ICD Encoding): 진단 용어를 표준 질병 분류 체계(ICD-10)에 매핑.
B. 평가 프레임워크 (5개 차원)
성능 (Performance): Ground Truth와 비교하여 F1-score 측정.
설명 가능성 (Explainability): ChatGPT가 내린 결정에 대해 샘플 및 인스턴스 수준에서 제공하는 설명의 타당성(R-score)을 전문가가 평가.
충실성 (Faithfulness): 지시사항 준수 여부(Instruct following) 및 설명이 원문 데이터에 기반하는지(Faithful reasoning) 평가.
신뢰도 (Confidence): 모델이 스스로 예측 결과에 대해 부여하는 확신 점수(CC-score, IC-score) 분석.
불확실성 (Uncertainty): 동일 샘플에 대해 5회 반복 쿼리하여 결과의 변동성 측정.
C. 실험 설정
프롬프트 구성: 작업 설명, 레이블 세트(설명 포함), 출력 형식(JSON), 소수의 예시(Demonstrations)를 포함한 'Closed MedIE' 설정 적용.
비교 대상: BERT 미세 조정(Fine-tuning) 모델, UIE 모델, 그리고 각 데이터셋의 SOTA(State-of-the-art) 모델.
3. 주요 기여 (Key Contributions)
종합적 평가 체계 구축: 단순 성능 측정을 넘어 설명 가능성, 충실성, 신뢰도, 불확실성을 포함한 5차원적 평가 프레임워크를 제시했습니다.
의료 도메인 특화 검증: 복잡한 의료 텍스트(중첩된 개체, 불연속적 개체 등)를 대상으로 ChatGPT의 한계를 명확히 규명했습니다.
오픈 소스 기여: 향후 연구를 위해 실험에 사용된 코드를 공개했습니다.
4. 연구 결과 (Results)
성능 한계: ChatGPT의 성능은 모든 MedIE 작업에서 미세 조정된(Fine-tuned) 베이스라인 모델이나 SOTA 모델에 미치지 못했습니다. 특히 복잡한 작업(Triple Extraction 등)에서 성능 저하가 두드러졌습니다.
높은 설명 가능성 vs 과잉 확신: ChatGPT는 매우 높은 품질의 설명(R-score 75~95%)을 제공하지만, 틀린 예측에 대해서도 매우 자신감 있는 어조로 설명하는 '과잉 확신(Over-confidence)' 문제가 발견되었습니다.
신뢰도 불일치: 정답을 맞혔을 때와 틀렸을 때의 신뢰도 점수(CC-score vs IC-score) 차이가 거의 없었습니다. 즉, 높은 신뢰도 점수가 반드시 정확한 예측을 보장하지 않습니다.
높은 충실성: 지시사항 준수 및 원문 기반 추론 능력은 80% 이상의 높은 점수를 기록하여, 모델이 엉뚱한 레이블을 생성하기보다는 주어진 틀 안에서 작동함을 확인했습니다.
높은 불확실성: 디코딩 알고리즘(top-p sampling)의 특성상 생성 결과에 변동성이 커, 실제 의료 현장 적용 시 결과의 불안정성을 초래할 수 있습니다.
5. 연구의 의의 (Significance)
본 연구는 ChatGPT가 의료 정보 추출 분야에서 **"설명은 잘하지만, 정확도와 일관성 면에서는 아직 전문 모델을 대체하기 어렵다"**는 점을 시사합니다. 특히 모델이 자신의 오류를 인지하지 못하고 높은 확신을 보이는 현상은 의료 분야와 같이 안전성이 중요한 도메인에서 매우 위험할 수 있음을 경고합니다. 이는 향후 의료용 LLM 연구가 단순히 성능을 높이는 것을 넘어, 신뢰도 교정(Calibration) 및 불확실성 제어에 집중해야 함을 시사하는 중요한 지표가 됩니다.