Polish-English medical knowledge transfer: A new benchmark and results
Este artículo presenta un nuevo referente médico polaco-inglés derivado de más de 24.000 preguntas de exámenes de licenciatura y especialización para evaluar los modelos de lenguaje de gran tamaño de vanguardia frente al desempeño humano, revelando que, si bien los modelos superiores se aproximan a los niveles humanos, persisten desafíos significativos en la traducción translingüe y la comprensión específica del dominio.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La inteligencia artificial ha aprendido a leer y escribir con una fluidez que a menudo rivaliza con la conversación humana. Estos sistemas, conocidos como modelos de lenguaje extensos, son entrenados con vastas cantidades de texto de internet, libros y artículos, lo que les permite responder preguntas, resumir historias y resolver problemas. Sin embargo, su conocimiento no está distribuido de manera uniforme. Debido a que la mayoría de los datos utilizados para enseñarlos provienen de fuentes de habla inglesa, estos modelos tienden a entender el inglés mucho mejor que otros idiomas. Esto crea una brecha significativa cuando la tecnología se aplica a campos especializados como la medicina, donde las directrices, las enfermedades y los tratamientos pueden variar de un país a otro. Si un médico en Polonia confía en una IA entrenada principalmente con datos médicos estadounidenses o británicos, el consejo podría no ajustarse a la realidad local, lo que potencialmente podría conducir a errores en el diagnóstico o el tratamiento.
Investigadores en Polonia se propusieron medir exactamente qué tan bien se desempeñan estas mentes artificiales cuando se les pide que piensen como un médico polaco. Crearon un nuevo campo de pruebas basado en los exámenes reales que los estudiantes de medicina y los especialistas deben aprobar para ejercer en su país. Estos exámenes son rigurosos, cubriendo desde la anatomía básica hasta procedimientos quirúrgicos complejos, y están escritos en polaco. El equipo recopiló más de 22,000 preguntas de estos exámenes del mundo real, incluyendo algunas que habían sido traducidas profesionalmente al inglés. Al alimentar estas preguntas a varios modelos de IA, pudieron ver si las máquinas podían superar los mismos obstáculos que los estudiantes humanos, y si el idioma de la pregunta cambiaba el resultado.
Los resultados revelaron un panorama claro de dónde se encuentran estos modelos. Los sistemas de inteligencia artificial más avanzados, particularmente uno conocido como GPT-4o, se desempeñaron notablemente bien, respondiendo correctamente casi el 90 por ciento de las preguntas en el examen general de licencia médica. Esta puntuación es lo suficientemente alta como para que el modelo aprobara el examen junto con un estudiante de medicina típico. Sin embargo, la historia cambia cuando las preguntas se vuelven más difíciles o especializadas. Cuando los investigadores probaron los modelos en exámenes para estudiantes de odontología y en exámenes avanzados para especialistas médicos, las puntuaciones bajaron significamente. Incluso la mejor IA tuvo dificultades con el examen de odontología, y en los exámenes de especialistas, no logró superar al médico humano promedio en más del 30 por ciento de los campos médicos probados. En algunas áreas específicas, como la audiología y la otorrinolaringología, la IA tuvo un desempeño peor que cada uno de los humanos que realizaron el examen ese año.
Una parte crucial del estudio fue comparar cómo los modelos manejaban las mismas preguntas en polaco versus inglés. Los investigadores encontraron que, para la mayoría de los modelos, el idioma marcaba una gran diferencia. Cuando se hacía una pregunta en inglés, la IA tenía muchas más probabilidades de acertar que cuando la misma pregunta se hacía en polaco. Esto sugiere que los modelos no están comprendiendo realmente los conceptos médicos de una manera universal; en su lugar, están dependiendo de patrones que aprendieron de textos en inglés. A medida que los modelos se volvían más grandes y potentes, esta brecha entre idiomas comenzó a reducirse, pero no desapareció por completo. Un modelo diseñado específicamente para el idioma polaco funcionó mejor en preguntas en polaco que en inglés, pero aun así no pudo igualar la potencia bruta de los modelos más grandes y de propósito general cuando se les preguntaba en inglés.
El estudio también destacó que aprobar un examen de opción múltiple no es lo mismo que ser un médico competente. Los exámenes utilizados en el estudio son pruebas escritas donde un estudiante selecciona la respuesta correcta de una lista de opciones. La práctica médica real, sin embargo, implica hablar con los pacientes, escuchar sus historias, examinar sus cuerpos y tomar decisiones cuando no existe una única respuesta correcta. Los investigadores enfatizaron que, si bien estas herramientas de IA son impresionantes, aún no pueden reemplazar la interacción humana y el juicio complejo requeridos en un hospital. Los modelos pueden ser asistentes útiles, ayudando a organizar información o redactar informes, pero no están listos para tomar el lugar de un médico con licencia.
En última instancia, el trabajo sirve como una advertencia y una guía para el futuro de la tecnología médica. Muestra que, si bien la inteligencia artificial está mejorando en la respuesta a preguntas médicas, aún no es lo suficientemente confiable como para ser confiada ciegamente, especialmente cuando el idioma o la especialidad médica específica cambian. Los hallazgos sugieren que, antes de que estas herramientas se utilicen en las clínicas, deben ser probadas rigurosamente en los idiomas y contextos específicos donde serán utilizadas. La brecha entre el desempeño en inglés y polaco demuestra que un modelo entrenado en un conjunto de datos no puede simplemente asumirse que funcionará perfectamente en otro. A medida que la tecnología continúa evolucionando, el objetivo es crear sistemas que no solo sean inteligentes, sino también justos y precisos para los pacientes en todas partes, independientemente del idioma que hablen.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.