← Últimos artículos
🤖 AI

Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts

Este estudio revela que añadir consignas de diversidad, equidad e inclusión (DEI) a las consultas médicas provoca que los modelos de lenguaje de gran tamaño inventen de forma frecuente e inexacta atributos demográficos del paciente no solicitados, un fenómeno denominado "inyección demográfica" que aumenta significativamente la tasa de recomendaciones clínicas incorrectas en 47 modelos.

Autores originales: Diego Mardian, Frank Liu

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Diego Mardian, Frank Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el campo de la inteligencia artificial, que evoluciona rápidamente, una nueva generación de programas informáticos ha aprendido a leer y escribir como los humanos, ofreciendo consejos sobre todo, desde la literatura hasta la medicina. A medida que estas herramientas se trasladan al ámbito de la atención sanitaria, los expertos han instado a los desarrolladores a programarlas con un tipo específico de sensibilidad: una conciencia de la diversidad, la equidad y la inclusión. El objetivo es garantizar que, cuando un médico pida ayuda a una computadora para un paciente, la máquina considere cómo factores como la raza, los ingresos o el trasfondo cultural podrían influir en los resultados de salud. Este enfoque asume que, al pedir explícitamente a la computadora que piense en estas realidades sociales, esta se volverá más justa y precisa. Sin embargo, la relación entre las instrucciones de una computadora y su producción es compleja, y los mensajes bienintencionados pueden, a veces, desencadenar comportamientos inesperados que distorsionan la misma información que pretenden aclarar.

Investigadores de la Universidad Estatal de Arizona investigaron qué sucede cuando aplican estas instrucciones centradas en la equidad a preguntas médicas. Probaron cuarenta y siete modelos diferentes de inteligencia artificial, que iban desde sistemas comerciales ampliamente utilizados hasta programas especializados de código abierto, utilizando una vasta colección de preguntas médicas de opción múltiple. En su experimento, tomaron escenarios médicos estándar —descripciones de pacientes con síntomas específicos pero sin mención de su trasfondo— y pidieron a los modelos que los resolvieran. Compararon las respuestas de los modelos bajo cuatro condiciones diferentes: sin instrucción adicional, con una instrucción sin sentido, con una instrucción médica neutral y con una sola frase que dirigía al modelo a considerar la diversidad y la equidad.

Los resultados revelaron un patrón sorprendente y constante. Cuando los modelos recibían la instrucción centrada en la equidad, frecuentemente comenzaban a inventar detalles sobre los pacientes que nunca estuvieron en la descripción original. Los investigadores llaman a este fenómeno "inyección demográfica". En los grupos de control, donde no se dio ninguna instrucción especial, los modelos añadían detalles demográficos no declarados, como la raza o el estatus social de un paciente, en menos del uno por ciento de los casos. Pero cuando se añadía el mensaje de equidad, ese número saltó al treinta y tres por ciento en cada uno de los modelos probados. Esto significa que, aproximadamente una de cada tres veces que se le pide a la computadora considerar la equidad, esta decide silenciosamente asignar una raza, edad o situación económica específica a un paciente que no tiene ninguna.

La mayoría de las veces, esta invención era inofensiva. Los modelos añadían una declaración general sobre cómo una determinada enfermedad afecta a un grupo específico de personas en el mundo real, sin cambiar su recomendación médica final. Sin embargo, una parte pequeña pero significativa de estas respuestas fue más allá. En aproximadamente el dos y medio por ciento de los casos, el modelo adjuntó la demografía inventada directamente al paciente específico de la historia. Este cambio en la identidad del paciente causó que el modelo cambiara su consejo médico y, casi siempre, el nuevo consejo era erróneo. Por ejemplo, ante un caso de una mujer con una inflamación de cuello indolora y marcadores sanguíneos normales, un modelo podría identificar correctamente la condición como un tipo específico de inflamación de la tiroides. Pero al ser instado a considerar la equidad, el mismo modelo podría decidir repentinamente que la paciente era una mujer negra o hispana y, basándose en esa identidad inventada, cambiar su diagnóstico a una enfermedad diferente e incorrecta.

El estudio encontró que la forma en que se redactaba la instrucción importaba enormemente. Los mensajes más detallados que pedían al modelo considerar los determinantes sociales de la salud o grupos demográficos específicos causaron que los modelos inventaran detalles de los pacientes con mayor frecuencia, elevando la tasa de invención hasta el cincuenta y seis por ciento. Los investigadores determinaron que este comportamiento era impulsado por el contenido de la instrucción de equidad en sí, no simplemente por el hecho de que el modelo estuviera leyendo más texto. Descartaron la idea de que los modelos estuvieran simplemente distraídos por palabras adicionales, ya que las instrucciones que eran igual de largas pero no relacionadas con la equidad no causaron el mismo efecto. En su lugar, los modelos parecían haber aprendido una asociación fuerte durante su entrenamiento: cuando ven palabras relacionadas con la equidad, esperan ver detalles demográficos y se sienten compelidos a proporcionarlos, incluso cuando el usuario no lo ha pedido.

Este descubrimiento resalta un fallo sutil pero crítico en cómo estos sistemas procesan las instrucciones. La computadora no actúa con malicia o sesgo en el sentido humano; más bien, está siguiendo un patrón que ha aprendido para ser útil. Al decirle que considere la equidad, interpreta que eso es una orden para completar la información faltante, asumiendo que un cuadro médico completo requiere una etiqueta demográfica. Al hacerlo, reescribe la identidad del paciente, convirtiendo un caso genérico en uno específico que nunca existió. Los investigadores enfatizan que, si bien la precisión general de los modelos disminuyó solo ligeramente, los errores se concentraron precisamente en los casos donde los modelos intentaban ser más útiles. El estudio concluye que cualquier instrucción que impulse a un modelo sobre cómo razonar puede causar que añada detalles no solicitados y, en el mundo de alto riesgo de la medicina, incluso un pequeño cambio en la descripción de un paciente puede conducir a un diagnóstico erróneo peligroso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →