From Guidelines to Guarantees: A Graph-Based Evaluation Harness for Domain-Specific Evaluation of LLMs
이 논문은 구조화된 임상 지침을 질의 가능한 지식 그래프로 변환하고 그래프 탐색을 통해 동적으로 평가 쿼리를 생성함으로써, 포괄적이고 오염에 강하며 유지보수가 용이한 도메인 특화 LLM 평가 프레임워크를 제안하고 WHO IMCI 지침에 적용하여 모델의 능력 격차를 규명했습니다.
원저자:Jessica M. Lundin, Usman Nasir Nakakana, Guillaume Chabot-Couture
수동 큐레이션: PDF 파서나 LLM 을 이용한 자동 추출은 IMCI 의 복잡한 흐름도 (색상 코딩된 트라이지 경로, 중첩된 결정 분기 등) 를 정확히 재현하지 못했습니다. 따라서 15 년 이상의 임상 경험을 가진 소아과 전문의가 수동으로 그래프를 구축하여 전문성 기반의 유효성 (Validity) 을 보장했습니다.
2.2. 동적 평가 쿼리 인스턴스화 (Evaluation Query Instantiation)
동적 생성: 정적 데이터셋 대신, 그래프 탐색을 통해 평가 시점에 질문을 동적으로 생성합니다.
템플릿 및 변수: 5 가지 질문 유형 (예: 증상→질병, 질병→치료 등) 에 대해 4 가지 템플릿을 사용하며, 환자의 나이 (연령대), 오답 (distractor) 선택 등을 무작위화하여 변형합니다.
오답 (Distractor) 샘플링: 임상적 타당성을 유지하기 위해, 정답과 동일한 연령대에 해당하지만 다른 조건을 가진 노드를 오답으로 선별합니다.
2.3. 오염 저항성 (Contamination Resistance)
표면 형태 오염 방지: 무작위화된 나이, 오답, 템플릿 조합을 통해 동일한 질문이 훈련 데이터에 존재할 확률을 극도로 낮춥니다.
관계 수준 오염 대응: 모델이 특정 가이드라인 버전을 암기했더라도, 가이드라인이 업데이트되거나 다른 버전으로 변경된 경우에도 동일한 프레임워크를 적용하여 모델이 실제 임상 추론 능력을 갖췄는지 평가할 수 있습니다.
3. 주요 기여 (Key Contributions)
그래프 기반 평가 하네스 도입: 커버리지, 오염 저항성, 유효성을 명시적으로 보장하는 평가 프레임워크를 제시했습니다.
가이드라인 - 그래프 변환: 구조화된 임상 가이드라인을 체계적인 평가를 지원하는 지식 그래프로 변환하는 방법을 제시했습니다.
동적 평가 방식: 정적 데이터셋이 아닌, 필요 시점에 쿼리를 인스턴스화하는 동적 평가를 실현했습니다.
체계적 약점 발견: 기존 집계 벤치마크로는 포착되지 않는 임상 추론의 체계적 약점을 실증적으로 보여주었습니다.
4. 실험 결과 (Results)
WHO IMCI 가이드라인을 적용하여 5 가지 언어 모델 (Claude Sonnet 4.6, o4-mini, GPT-5.2, GPT-OSS-20B, MedGemma-4B) 을 평가했습니다.
전체 성능:
최상위 폐쇄형 모델 (Claude, o4-mini, GPT-5.2) 은 약 66~68% 의 정확도를 보였습니다.
오픈 가중치 모델 (GPT-OSS-20B) 은 약 57%, 도메인 파인튜닝 모델 (MedGemma-4B) 은 약 50% 로 상대적으로 낮았습니다.
질문 유형별 성능 차이:
높은 성능:Symptom → Condition(증상 → 질병) 유형에서 모든 모델이 가장 높은 성능 (64~82%) 을 보였습니다. 이는 모델이 증상을 인식하는 능력은 뛰어나다는 것을 의미합니다.
낮은 성능:Condition → Treatment(질병 → 치료) 및 Condition → FollowUp(질병 → 추적 관리) 유형에서 정확도가 크게 하락했습니다. 이는 임상적 관리 결정 및 치료 프로토콜 적용에 대한 추론 능력이 부족함을 시사합니다.
템플릿 영향: 동일한 질문 유형이라도 문장 구조 (템플릿) 에 따라 모델 성능이 크게 달라졌습니다 (예: 일부 템플릿은 14% 까지, 다른 템플릿은 90% 까지 차이). 이는 단일 템플릿 평가의 한계를 보여주며, 다양한 템플릿 사용의 중요성을 강조합니다.
5. 의의 및 의의 (Significance)
확장 가능한 평가 인프라: 가이드라인이 업데이트될 때마다 그래프만 갱신하면 되며, 추가적인 전문가 노동 없이도 새로운 평가 데이터를 무한히 생성할 수 있어 확장성이 뛰어납니다.
책임의 명확화: 평가 프로세스를 '그래프 구축자 (도메인 전문가)', '하네스 운영자 (기술자)', '모델 개발자'로 분리하여 오류의 원인을 명확히 추적할 수 있습니다.
도메인 일반화: IMCI 외에도 말라리아, 결핵, HIV 등 WHO 의 다른 가이드라인이나 법적/규제 문서 등 구조화된 의사결정 로직이 있는 모든 도메인에 적용 가능합니다.
임상적 타당성 보장: 생성된 모든 질문이 전문가가 구축한 그래프 관계에서 파생되므로, 사후 검토 없이도 높은 임상적 정확성을 보장합니다.
결론적으로, 이 연구는 정적 벤치마크의 한계를 극복하고, 도메인 특화 LLM 의 실제 임상 추론 능력을 더 정밀하고 지속적으로 평가할 수 있는 새로운 패러다임을 제시했습니다.