Comparative Performance of Frontier Large Language Models for Extracting High-Risk Pathologic Features from Unstructured Gastrointestinal Oncology Reports: A Systematic Benchmarking Study with Human and Traditional NLP Baselines
Questo studio di benchmarking sistematico dimostra che i modelli multimodali di frontiera, in particolare Gemini 2.5 Pro e GPT-4o, superano significativamente sia gli esperti umani sotto pressione temporale sia i baselines tradizionali di NLP nell'estrarre lo stato critico di invasione perineurale da referti patologici gastrointestinali non strutturati, mentre una nuova tassonomia delle modalità di errore fornisce una guida azionabile per la selezione del modello basata su specifiche firme di errore.