← Últimos artículos
📄 health informatics

Towards understanding the disease landscape of clinical trials in Germany: Ontology and embedding-based pipelines versus Large Language Models for ICD-10 Harmonization

Este estudio demuestra que, si bien una ontología determinista y un proceso basado en incrustaciones pueden armonizar parcialmente los datos heterogéneos de condiciones de ensayos clínicos en Alemania con los estándares CIE-10, los modelos de lenguaje de gran tamaño (específicamente GPT-4o) lo superan significativamente al lograr una concordancia casi perfecta con la codificación de expertos humanos, ofreciendo así una solución superior para el análisis del panorama de enfermedades entre registros.

Autores originales: Ndabashinze, R., Franzen, D., Kozuch, E., Aagerup, J., Fink, A., Yerunkar, S. S., Hunter, K., Mayo-Wilson, E., Ying, X., Kilicoglu, H., Schorr, S. G., Seidler, A. L.

Publicado 2026-08-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ndabashinze, R., Franzen, D., Kozuch, E., Aagerup, J., Fink, A., Yerunkar, S. S., Hunter, K., Mayo-Wilson, E., Ying, X., Kilicoglu, H., Schorr, S. G., Seidler, A. L.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina intentar organizar una biblioteca masiva donde cada libro está escrito en un idioma diferente, utiliza un alfabeto distinto y, a veces, solo tiene una nota adhesiva que dice "algo sobre una persona enferma" en lugar de un título. Este es el estado actual de los datos de los ensayos clínicos. Los científicos realizan miles de experimentos para probar nuevos medicamentos, pero registran estos ensayos en diferentes bases de datos por todo el mundo. Algunos utilizan códigos médicos estrictos, otros usan diccionarios médicos sofisticados y algunos simplemente lo escriben en inglés o alemán común. Es como intentar contar cuántas personas están estudiando "problemas cardíacos" cuando una base de datos dice "problemas cardíacos", otra dice "molestias del corazón" y una tercera simplemente dice "ay, me duele el pecho". Sin una forma de traducir todas estas diferentes descripciones a un lenguaje común, es increíblemente difícil ver el panorama general de qué enfermedades están estudiando realmente los científicos y dónde están las brechas.

Para resolver esto, los investigadores necesitan un traductor. En el mundo médico, el "lenguaje universal" para las enfermedades se llama CIE-10, una lista gigante de códigos que categoriza cada condición de salud conocida. El desafío es tomar las descripciones desordenadas y mixtas de los registros de ensayos y convertirlas automáticamente en el código CIE-10 correcto. Durante mucho tiempo, los científicos han intentado construir programas informáticos que actúen como bibliotecarios estrictos, siguiendo un libro de reglas rígido para emparejar palabras con códigos. Más recientemente, un nuevo tipo de cerebro informático superinteligente llamado Modelo de Lenguaje Extenso (LLM) ha entrado en la conversación. Estos modelos están entrenados con enormes cantidades de texto y son excelentes para entender el contexto y los matices, casi como un humano que puede leer entre líneas. La gran pregunta es: ¿Pueden estos cerebros de IA hacer un mejor trabajo traduciendo las descripciones de los ensayos que los antiguos sistemas basados en reglas?

Este artículo se sumerge directamente en esa pregunta construyendo un proceso de alta tecnología para traducir las descripciones de ensayos clínicos de cuatro de los principales registros en Alemania a los códigos estándar de la CIE-10. Los investigadores crearon un "proceso determinista", que es una forma elegante de decir un proceso robótico de varios pasos. Primero, el robot extrae las menciones de la enfermedad. Luego, intenta emparejarlas utilizando un diccionario médico estricto (ontología) y un motor de búsqueda inteligente que busca significados similares (embeddings). Incluso añadieron una segunda versión que reclasifica las mejores opciones para ver si puede encontrar la correcta. Pero no se detuvieron ahí. También probaron un poderoso Modelo de Lenguaje Extenso (GPT-4o), pero con un giro: obligaron a la IA a seguir la misma lógica paso a paso y las mismas reglas que utilizan los expertos humanos, solo para ver si la IA podía ser un mejor "bibliotecario" que el robot.

Los resultados fueron un poco impactantes para el enfoque de la vieja escuela. Cuando probaron su proceso de robot basado en reglas contra un "estándar de oro" de códigos escritos por expertos médicos humanos, el robot acertó solo aproximadamente el 49% de las veces al buscar el código específico de tres letras. Fue decente adivinando la categoría general (como "enfermedad del corazón" frente a "enfermedad de los pulmones), acertando aproximadamente el 59%, pero tuvo dificultades con los detalles. El robot a menudo se confundía con enfermedades de nombres similares o no podía encontrar el código correcto en su diccionario.

Sin embargo, el Modelo de Lenguaje Extenso estaba en una liga completamente diferente. Cuando la misma IA recibió las mismas reglas y el mismo trabajo, alcanzó una asombrosa precisión del 96.7%. Estuvo en acuerdo con los expertos humanos casi perfectamente. El artículo sugiere que el superpoder de la IA no es solo conocer los códigos, sino su capacidad para entender el contexto de una oración. Por ejemplo, si un ensayo menciona "diabetes de inicio en la edad adulta", la IA sabe instantáneamente que eso significa diabetes tipo 2, mientras que el robot podría quedarse trabado intentando emparejar las palabras exactas. La IA también logró asignar códigos plausibles a aproximadamente el 82% de las menciones que el robot descartó y rechazó.

Los autores encontraron que el principal fallo del robot no fue en la clasificación de los códigos, sino en siquiera encontrar el código correcto para empezar. Si el código correcto no estaba en la lista inicial de candidatos del robot, ninguna cantidad de reclasificación podría salvarlo. La IA, por otro lado, fue mucho mejor para descifrar cuál debería ser el código correcto, incluso cuando el texto era desordenado o vago. El estudio concluye que, si bien los antiguos sistemas basados en reglas están bien para obtener una idea general de las tendencias de las enfermedades, los Modelos de Lenguaje Extenso son los claros ganadores para lograr la precisión en los detalles. Sugieren que los estudios futuros que busquen el panorama de los ensayos clínicos utilicen estas herramientas de IA para obtener una imagen mucho más clara y precisa de qué enfermedades se están estudiando, ayudando a asegurar que los esfuerzos de investigación estén realmente enfocados en las necesidades de salud que más importan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →