← Últimos artículos
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

Este estudio demuestra que los modelos de lenguaje extensos actuales no logran alcanzar una fiabilidad interevaluador comparable a la de los profesionales médicos al extraer información clínica estructurada de registros electrónicos de otorrinolaringología, lo que sugiere que son más adecuados para la extracción inicial de datos que requiere verificación humana en lugar del despliegue clínico autónomo.

Autores originales: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
Publicado 2026-08-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Los hospitales actuales generan un vasto océano de registros escritos. Cada visita del paciente, cada resultado de prueba y cada decisión de tratamiento queda capturada en notas digitales conocidas como historias clínicas electrónicas. Estos documentos son ricos en detalles, conteniendo el lenguaje específico que los médicos utilizan para describir síntomas, diagnosticar condiciones y planificar la atención. Durante décadas, convertir estas historias no estructuradas en datos organizados y buscables ha sido una tarea difícil, que a menudo requería que los humanos leyeran y reescribieran la información a mano. Recientemente, ha surgido un nuevo tipo de programa informático llamado modelo de lenguaje de gran tamaño. Estos sistemas han sido entrenados con cantidades masivas de texto y pueden leer, comprender y resumir el lenguaje humano con una fluidez sorprendente. Han demostrado que pueden responder preguntas médicas y aprobar exámenes de licencia, lo que ha llevado a muchos a preguntarse si también pueden leer los expedientes de los pacientes y extraer los hechos vitales que contienen de forma automática.

Esta pregunta no se trata solo de ahorrar tiempo; se trata de seguridad y precisión. Si una computadora va a ayudar a los médicos a gestionar la atención al paciente, debe encontrar la información correcta sin inventar cosas o pasar por alto detalles críticos. Un nuevo estudio se propuso probar esta capacidad directamente. Los investigadores reunieron casi cien expedientes reales de pacientes de clínicas de otorrinolaringología y pidieron tanto a médicos humanos como a siete modelos de lenguaje de gran tamaño diferentes que los leyeran. La tarea consistía en extraer hechos específicos, tales como la edad del paciente, sus síntomas, su diagnóstico y los tratamientos que recibió. Para asegurar que todos hablaran el mismo lenguaje, los investigadores requirieron que cada pieza de información fuera traducida a un código estandarizado utilizado por los hospitales en todo el mundo. Esto permitió una comparación precisa de qué tan bien se desempeñaron las máquinas frente a los humanos.

Los resultados revelaron una clara brecha entre la experiencia humana y la inteligencia artificial actual. Cuando los catorce médicos del estudio leyeron los mismos expedientes, coincidieron entre sí en la información extraída el 81 por ciento de las veces. Este alto nivel de acuerdo mostró que los médicos estaban interpretando las notas de manera consistente. Sin embargo, cuando se compararon los modelos computacionales con los médicos, el acuerdo cayó significamente a aproximadamente el 66 por ciento. En otras palabras, las máquinas aún no eran tan confiables como los humanos para identificar los mismos hechos a partir del mismo texto. El estudio probó modelos de diferentes tamaños, desde sistemas masivos con cientos de miles de millones de conexiones hasta otros más pequeños que podrían ejecutarse en computadoras locales. Ninguno de ellos alcanzó el nivel de consistencia mostrado por los profesionales médicos.

El rendimiento varió dependiendo de qué tipo de información se estaba extrayendo. Los modelos fueron bastante buenos encontrando tratamientos y resultados de pruebas, los cuales suelen estar escritos de formas claras y estandarizadas. Fueron menos exitosos con los signos y diagnósticos, que a menudo requieren una comprensión más profunda del contexto clínico. Curiosamente, las computadoras tendieron a encontrar más información que los médicos, particularmente en lo que respecta a los factores de riesgo. Mientras que los médicos suelen centrarse en el problema inmediato, los modelos parecían señalar cada posible riesgo mencionado en el texto. Esto sugiere que las máquinas no solo están copiando el comportamiento humano, sino que están procesando el texto de manera diferente, a veces detectando detalles que un humano podría pasar por alto, pero también potencialmente señalando cosas que no son clínicamente relevantes.

A pesar de estas diferencias, las máquinas demostraron que podrían ser herramientas útiles si se usan correctamente. El estudio encontró que cuando los modelos identificaban una pieza de información, solían estar en lo cierto, con una tasa de precisión del 97 por ciento. Esto significa que rara vez inventaban hechos que no estaban allí. Sin embargo, omitieron cierta información el 15 por ciento de las veces. Este patrón apunta a un rol específico para estas herramientas en el futuro: están mejor dotadas para actuar como un primer pase, escaneando rápidamente los expedientes para extraer candidatos probables para la revisión del médico. La decisión final y la verificación aún tendrían que venir de un humano. Los investigadores concluyeron que, si bien estos modelos son poderosos, aún no están listos para trabajar solos en un entorno clínico. Se consideran mejor como asistentes que pueden ayudar a organizar la inundación de datos médicos, siempre que un experto humano esté siempre presente para revisar su trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →