Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs
이 논문은 포르투갈어 임상 텍스트에 대한 개체명 인식 (NER) 을 위해 다양한 BERT 기반 모델과 대규모 언어 모델 (LLM) 을 비교 평가한 결과, 다국어 BERT 모델인 mmBERT 가 제한된 컴퓨팅 자원으로도 가장 우수한 성능을 보였으며, 반복적 계층화 (iterative stratification) 와 같은 불균형 데이터 처리 전략이 성능 향상에 기여함을 입증했습니다.
원저자:Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina FerreiVinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira, Oge Marques, Lucas Emanuel Silva e Oliveira
원저자: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira, Oge Marques, Lucas Emanuel Silva e Oliveira
BERT 기반 모델 (특히 mmBERT) 이 산업계 최상위 LLM 들보다 전반적으로 더 높은 성능을 보였습니다.
LLM 은 추론 속도가 느리고 비용이 높으며, GPT-5 의 '고도 추론 (High reasoning)' 모드를 사용해도 BERT 모델의 성능을 완전히 능가하지 못했습니다.
BERT 모델은 로컬 하드웨어 (RTX 4090) 에서 실행 가능하여 데이터 프라이버시 리스크가 없었습니다.
3.2 데이터 분할 및 불균형 처리 전략의 영향
반복적 계층화 (Iterative Stratification): 단순 무작위 분할에 비해 성능을 크게 향상시켰습니다.
SemClinBr 에서 Micro F1 이 0.6904 에서 0.7646 으로 상승했습니다.
정밀도 - 재현율 곡선 (Precision-Recall Curve) 에서 우상향 (Top-right) 을 더 잘 따라가는 것을 확인했습니다.
불균형 해결 기법의 데이터 의존성:
SemClinBr: 반복적 계층화만으로도 최상의 성능을 달성했습니다.
유방암 데이터셋: 반복적 계층화 + 가중 손실 (최소 가중치 1.0 고정) 의 조합이 가장 효과적이었습니다.
오버샘플링은 데이터셋에 따라 효과가 일관되지 않았습니다.
4. 주요 기여 및 의의 (Key Contributions & Significance)
포르투갈어 임상 NER 벤치마크 확립: 공개 (SemClinBr) 및 사설 (유방암) 데이터셋을 모두 포함하는 최초의 포괄적인 벤치마크를 제공하여, mmBERT 가 새로운 State-of-the-Art 를 수립했습니다.
실용적 검증: 공개 데이터셋의 결과가 사설 의료 환경에서도 재현 가능함을 입증하여, 실제 의료 기관에서의 기술 도입 가능성을 높였습니다.
다중 레이블 불균형 해결 전략 체계화: 반복적 계층화, 가중 손실, 오버샘플링 등 다양한 기법을 체계적으로 비교 분석하여, 데이터 특성에 맞는 최적의 전처리 전략을 제시했습니다.
비용 효율성과 프라이버시: 고비용의 LLM 대신 로컬에서 실행 가능한 경량화된 BERT 모델 (mmBERT) 이 임상 NER 에 더 효율적이고 안전함을 입증했습니다.
오픈 소스 기여: 연구의 재현성을 위해 모든 소스 코드를 GitHub 에 공개했습니다.
5. 결론 및 향후 과제
이 연구는 다국어 전략으로 학습된 mmBERT가 포르투갈어 임상 NER 에서 가장 강력한 성능을 발휘함을 보여주었습니다. 특히 **반복적 계층화 (Iterative Stratification)**와 같은 적절한 데이터 분할 전략이 모델 성능 향상에 결정적인 역할을 함을 강조했습니다.
향후 연구 방향으로는:
mmBERT 와 같은 다국어 모델을 포르투갈어 생의학 코퍼스 (Biomedical corpora) 로 추가 파인튜닝 (Domain-specific pre-training) 하는 것.
다양한 의료 전문 분야와 지역으로의 일반화 능력 검증.
GPT-5 와 같은 LLM 의 추론 능력을 NER 태스크에 더 깊이 탐구하거나, 프롬프트 최적화 (GEPA 등) 를 통한 소형 언어 모델 (SLM) 의 활용 가능성 탐색이 필요합니다.