Performance evaluation and benchmarking across 16 large language models on a comprehensive real-world emergency department triage data set
Este estudio evalúa 16 modelos de lenguaje de gran tamaño con datos reales de triaje en departamentos de urgencias, encontrando que, si bien el uso de prompts estructurados puede lograr una concordancia sustancial con el personal de enfermería para la clasificación de la gravedad, la mayoría de los modelos exhiben una precisión limitada, una deficiente asignación de sectores, un exceso de confianza sistemático y un comportamiento no determinista, lo que indica que aún no están listos para la implementación clínica sin validaciones y mejoras adicionales.