← Últimos artículos
💻 computer science

Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review

Esta revisión de alcance de 49 estudios de XAI clínica revela que las evaluaciones priorizan abrumadoramente la confianza y las percepciones del usuario sobre las capacidades críticas de supervisión, como la detección de fallos y sesgos, apoyándose fuertemente en medidas no validadas y evaluando raramente el desempeño en sistemas desplegados.

Autores originales: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Publicado 2026-09-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En los hospitales modernos, los médicos dependen cada vez más de programas informáticos para ayudar a diagnosticar enfermedades y sugerir tratamientos. Estas herramientas, construidas sobre complejos modelos matemáticos, pueden procesar vastas cantidades de datos de pacientes más rápido que cualquier ser humano. Sin embargo, estos modelos a menudo funcionan como una "caja negra", ofreciendo una recomendación sin explicar cómo llegó a esa conclusión. Para solucionar esta opacidad, los investigadores han desarrollado un campo llamado inteligencia artificial explicable. El objetivo es simple: proporcionar el razonamiento de la computadora junto con su respuesta, de forma muy parecida a como un médico muestra su procedimiento en una pizarra. La esperanza es que, al ver la lógica detrás de una sugerencia, un clínico pueda decidir si confiar en ella, detectar un error o anularla si el consejo es peligroso. Esta capacidad de revisar y corregir a la máquina se conoce como supervisión humana, y se considera esencial para la seguridad en decisiones médicas de alto riesgo.

Una nueva revisión de la investigación científica, sin embargo, sugiere que la forma actual en que probamos estas explicaciones está omitiendo la parte más crítica del trabajo. Nicolas Frey y sus colegas de Charité – Universitätsmedizin Berlin examinaron cuarenta y nueve estudios publicados entre 2015 y principios de 2026 que probaron cómo los médicos y los estudiantes de medicina interactúan con estas herramientas explicables. Los investigadores querían saber si los estudios realmente demostraban que las explicaciones ayudan a los clínicos a detectar errores, o si simplemente estaban midiendo cuánto les gustaba la apariencia de la explicación a los clínicos. Encontraron una brecha significativa. Mientras que los estudios preguntaban frecuentemente a los médicos si encontraban las explicaciones confiables o fáciles de entender, casi nunca probaron si esas explicaciones realmente ayudaban a los médicos a identificar cuándo la computadora estaba equivocada.

La revisión trazó exactamente qué medían estos cuarenta y nueve estudios. Los resultados mostraron un fuerte enfoque en sentimientos y percepciones. En cuarenta y dos de los estudios, los investigadores preguntaron a los participantes qué tanta confianza tenían en el sistema. En treinta y cuatro estudios, preguntaron si las explicaciones eran útiles, y en treinta y tres, preguntaron si eran comprensibles. Estas preguntas dependen del autoinforme, donde un médico simplemente dice: "Me siento seguro con esta respuesta". Los investigadores encontraron que solo una mínima fracción de los estudios fue un paso más allá para probar el comportamiento real. Solo tres estudios probaron si un médico podía detectar un fallo específico en la lógica de la computadora, y solo un estudio probó si un médico podía reconocer un sesgo sistemático en el consejo del sistema. Quizás lo más sorprendente sea que ni un solo estudio probó si un médico podía predecir correctamente qué haría la computadora en una situación nueva, una habilidad que sería fundamental para una verdadera comprensión.

La evidencia sugiere que el panorama actual de la investigación prioriza el sentimiento de seguridad sobre la mecánica de la seguridad. La mayoría de los estudios tuvieron lugar en entornos controlados y simulados en lugar de en hospitales reales y concurridos. En estas simulaciones, a menudo se mostraban a los médicos consejos correctos e incorrectos de la computadora, pero los estudios rara vez midieron si los médicos rechazaban con éxito el consejo erróneo. En su lugar, a menudo medían si los médicos estaban de acuerdo con la computadora, sin saber si ese acuerdo era con una respuesta correcta o incorrecta. Los investigadores señalaron que un médico puede reportar una alta confianza en un sistema y aun así seguir ciegamente una recomendación peligrosa, o puede sentirse confundido por una explicación pero aun así tomar la decisión correcta al ignorar a la computadora. Debido a que los estudios se centraron tanto en lo primero —lo que los médicos decían que sentían—, proporcionaron poca evidencia de que las explicaciones realmente ayudaran a los médicos a detectar errores cuando la computadora se equivocaba.

Además, los métodos utilizados para recopilar estos datos fueron a menudo débiles. Más de la mitad de las mediciones dependieron de preguntas ad-hoc o escalas no verificadas en lugar de herramientas establecidas y científicamente probadas. Solo diez de los doscientos cincuenta y tres puntos de datos de la revisión utilizaron un instrumento validado, que es una prueba estándar y confiable para aspectos como la confianza o la satisfacción. La gran mayoría de los datos provinieron de encuestas simples donde los médicos calificaban su experiencia en una escala. La revisión también destacó que solo dos de los cuarenta y nueve estudios analizaron sistemas que estaban realmente desplegados y en uso en entornos clínicos reales. El resto fueron experimentos donde el comportamiento de la computadora era controlado por los investigadores, lo que significa que no sabemos si las explicaciones se mantienen cuando un médico está bajo presión de tiempo, cansado o lidiando con un caso de paciente complejo.

Los autores argumentan que este desequilibrio crea una falsa sensación de seguridad. Señalan que la confianza es una actitud, mientras que la supervisión es una acción. Un médico puede sentirse muy confiado en un sistema pero aun así fallar al no anular una recomendación errónea. Para saber realmente si una explicación es segura, los investigadores deben probar comportamientos específicos: ¿Puede el médico predecir qué dirá la computadora a continuación? ¿Puede detectar un error cuando la computadora se equivoca? ¿Puede reconocer cuándo la computadora tiene un sesgo contra un determinado grupo de pacientes? La revisión encontró que estas habilidades específicas y críticas para la seguridad estaban casi totalmente ausentes en la literatura actual. Los estudios nos mostraron cómo se sienten las explicaciones para un clínico, pero no nos mostraron si esas explicaciones ayudan a un clínico a hacer mejor su trabajo cuando la máquina falla.

El artículo concluye que para que la inteligencia artificial explicable sea verdaderamente útil y segura, la forma en que la probamos debe cambiar. Los estudios futuros deben ir más allá de preguntar a los médicos cómo se sienten y comenzar a probar lo que realmente hacen. Esto significa diseñar experimentos donde la corrección de la computadora sea manipulada para ver si los médicos pueden distinguir lo correcto de lo incorrecto. Significa usar herramientas probadas y confiables para medir actitudes en lugar de adivinar basándose en encuestas simples. Finalmente, significa probar estos sistemas en el mundo real, a lo largo del tiempo, para ver si las explicaciones continúan apoyando la toma de decisiones acertadas cuando los riesgos son altos y la presión es real. Hasta que estos cambios ocurran, la comunidad médica tendrá una imagen clara de cuánto les gustan las explicaciones a los médicos, pero muy pocas pruebas de que esas explicaciones realmente mantengan seguros a los pacientes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →