Whose Truth Is Ground Truth?: Consequences of Label Choice on Machine Learning Models Predicting Depression
Este estudio demuestra que la elección de las etiquetas de depresión en las historias clínicas electrónicas —ya sean codificadas por el proveedor, reportadas por el paciente o concordantes— altera significativamente el rendimiento y la importancia de las características de los modelos de aprendizaje automático, revelando que las etiquetas derivadas del proveedor pueden amplificar inadvertidamente los sesgos demográficos a pesar de producir puntuaciones AUC ligeramente superiores.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de enseñarle a un robot a reconocer un tipo específico de ave. Le muestras miles de fotos, pero hay un inconveniente: a veces las fotos están etiquetadas por un experto en observación de aves, y otras veces por la persona que realmente vio el ave en la naturaleza. El experto puede no ver un ave porque estaba escondida, o puede identificar erróneamente una especie de apariencia similar. La persona en la naturaleza puede estar emocionada y pensar que vio un ave rara cuando solo era una común. Si solo enseñas al robot usando las etiquetas del experto, este aprenderá a ver lo que el experto ve, no necesariamente lo que realmente está ahí. Este es el corazón de un campo creciente llamado Aprendizaje Automático (Machine Learning), donde las computadoras aprenden a encontrar patrones en cantidades masivas de datos para hacer predicciones. En la atención médica, los científicos están tratando de construir estos "robots doctores" para detectar problemas de salud mental como la depresión antes de que empeoren. Pero aquí está la parte difícil: a diferencia de un hueso roto que se muestra claramente en una radiografía, la depresión es invisible. Depende de cómo se siente un paciente y de cómo un médico interpreta esos sentimientos. Este artículo plantea una pregunta grande e importante: si enseñamos a nuestros robots doctores usando las notas del médico como la "verdad", ¿aprenderán lo mismo que si enseñáramos usando el propio informe del paciente sobre cómo se siente?
Los investigadores detrás de este estudio, Natasha Tonge y Leah Adams de la Universidad George Mason, decidieron poner esta pregunta a prueba. Examinaron una enorme pila de registros médicos de más de 644,000 adultos que visitaron centros de salud comunitarios entre 2012 y 2019. Querían ver si la "verdad fundamental" (la etiqueta utilizada para decirle a la computadora qué cuenta como depresión) cambiaba la forma en que la computadora aprendía. Construyeron tres versiones diferentes de un modelo de aprendizaje automático, cada una entrenada con una definición diferente de depresión:
- La visión del médico: El modelo aprendió solo de los casos en los que un médico había escrito oficialmente un diagnóstico de depresión en la ficha del paciente.
- La visión del paciente: El modelo aprendió solo de pacientes que reportaron síntomas graves en un cuestionario (el PHQ-9), incluso si el médico no había escrito un diagnóstico.
- La visión del acuerdo: El modelo aprendió solo de los casos en los que tanto el paciente reportó síntomas graves como el médico había escrito un diagnóstico.
Utilizaron un tipo de algoritmo de computadora llamado "árbol" (piensa en esto como un diagrama de flujo que hace preguntas de sí o no para tomar una decisión) para predecir quién tenía depresión. Alimentaron a la computadora con datos como edad, raza, género, presión arterial y si el paciente tenía ansiedad u otros problemas de salud.
Aquí está lo que encontraron, y es un poco sorprendente. Primero, los modelos de computadora no fueron perfectos para detectar la depresión sin importar qué etiqueta usaran. Su precisión, medida por una puntuación llamada AUC, osciló entre 0.62 y 0.64. Para ponerlo en perspectiva, una puntuación perfecta es 1.0, y un intento al azar es 0.5. Así que los modelos eran mejores que adivinar, pero todavía perdían muchos casos. El modelo entrenado con las etiquetas de los médicos fue el mejor para encontrar los casos que los médicos ya habían identificado (con una sensibilidad de 0.33), pero aun así perdió aproximadamente dos tercios de ellos.
El descubrimiento más interesante no fue sobre qué tan bien funcionaban los modelos, sino sobre qué pensaban que era importante. El "cerebro" de la computadora cambió de opinión dependiendo de a quién escuchaba.
- Cuando el modelo escuchaba las etiquetas de los médicos, decidió que cosas como ser blanco, ser mujer y ser soltero eran las pistas más grandes de que alguien tenía depresión.
- Cuando el modelo escuchaba los síntomas graves del paciente, esas pistas demográficas se volvieron menos importantes. En su lugar, el modelo se centró fuertemente en si el paciente tenía ansiedad, su edad y su presión arterial.
- Lo único que se mantuvo importante en los tres modelos fue la ansiedad. Si un paciente tenía ansiedad, la computadora era más propensa a marcarlo por depresión, sin importar qué etiqueta estuviera usando.
Los autores sugieren que este cambio es una señal de advertencia. Si construimos herramientas de IA que solo aprenden de lo que los médicos escriben, la IA podría empezar a pensar que la depresión es principalmente sobre una cierta raza o género, simplemente porque eso es lo que los médicos en el pasado han tendido a diagnosticar. Podría perder de vista a los pacientes que están sufriendo pero que aún no han sido diagnosticados. El estudio sugiere que, para que estas herramientas de IA sean justas y confiables, deben incluir la propia voz del paciente, no solo las notas del médico. Si no lo hacemos, corremos el riesgo de construir un sistema digital que repita los mismos puntos ciegos y sesgos que existen en el mundo real, perdiendo potencialmente a las personas que más necesitan ayuda. Los investigadores no probaron que un método sea perfecto, pero demostraron claramente que la elección de quién define la "verdad" cambia la comprensión total del problema por parte del robot.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.