← Últimos artículos
🤖 AI

Large language models improve physician accuracy but lead to false reliance

Si bien el sistema de LLM con aumento de recuperación CORA mejoró significativamente la precisión diagnóstica de los médicos, el estudio revela un riesgo de seguridad crítico donde las citas vinculadas a la fuente aumentaron desproporcionadamente la dependencia tanto de los consejos correctos como de los incorrectos, socavando así la capacidad de los médicos para resistir recomendaciones erróneas.

Autores originales: Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kat
Publicado 2026-08-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un caso difícil. Tienes un asistente brillante y superrápido que puede leer millones de libros en un segundo y sugerir una solución. Este asistente es una Inteligencia Artificial, específicamente un "Modelo de Lenguaje Extenso" (LLM, por sus siglas en inglés). Estas IA son como enciclopedias que aprendieron a hablar leyendo todo el internet, pero a veces se muestran seguras de cosas que en realidad no saben, inventando hechos que suenan perfectos pero que son erróneos. Para solucionar esto, los científicos inventaron un truco llamado "Generación Aumentada por Recuperación" (RAG). Piensa en el RAG como darle a tu asistente de IA una tarjeta de biblioteca y una regla: "Solo puedes responder si puedes señalar la página exacta en un libro que demuestre tu respuesta". De esta manera, la IA no solo adivina; muestra su tarea.

Pero aquí está la gran pregunta que los científicos todavía están debatiendo: ¿El hecho de mostrar la tarea realmente ayuda al detective humano? ¿O simplemente hace que el humano confíe demasiado en el asistente, incluso cuando este se equivoca? Esta es la historia de un nuevo estudio que puso a prueba esta idea con médicos reales. Querían ver si darles a los médicos una IA que cite sus fuentes los haría mejores diagnosticando enfermedades de la piel, o si los engañaría para cometer errores peligrosos al hacer que las respuestas incorrectas parezcan respaldadas por evidencia.


La historia de CORA y la trampa de la "Prueba Falsa"

En este estudio, un equipo de investigadores construyó un asistente de IA especial llamado CORA (Asistente de Recuperación Orientado a la Citación). Imagina a CORA como un pasante de investigación superinteligente que, cada vez que un médico hace una pregunta sobre una condición de la piel, no solo escupe una respuesta. En su lugar, CORA va a una biblioteca digital de libros de texto médicos, guías y reportes de casos, encuentra las páginas relevantes y dice: "Aquí está mi respuesta, y aquí están las tres páginas que lo demuestran".

Los investigadores querían ver cómo funcionaba esto en el mundo real. Reunieron a 46 médicos de 21 países diferentes y les dieron una serie de acertijos sobre enfermedades de la piel. Primero, los médicos tenían que resolverlos por su cuenta. Luego, se les mostró la respuesta de CORA junto con la "prueba" (las citaciones) y se les preguntó si querían mantener su respuesta original o cambiarla.

La buena noticia: Los médicos se volvieron más inteligentes
Los resultados mostraron que CORA era un compañero útil. Cuando los médicos trabajaban solos, obtenían la respuesta correcta el 70.8% de las veces. Pero cuando usaban a CORA, su precisión subió al 82.6%. La IA los ayudó a corregir errores, especialmente en casos complicados o enfermedades que son raras. Era como tener un segundo par de ojos que conocía el libro de reglas perfectamente.

La mala noticia: La "Trampa de la Citación"
Sin embargo, el estudio encontró un problema astuto. La "prueba" que mostraba CORA no siempre era una prueba real. A veces, CORA daba una respuesta incorrecta pero seguía mostrando una citación que parecía respaldar la respuesta, aunque no lo hiciera realmente.

Aquí es donde se pone complicado:

  • Cuando CORA tenía razón: Si los médicos veían una citación que parecía apoyar la respuesta, era muy probable que cambiaran de opinión y estuvieran de acuerdo con la IA. Su tasa de éxito para adoptar el consejo correcto pasó del 34% (sin sentirse respaldados) al 76.9% (cuando sentían que la citación apoyaba la respuesta).
  • Cuando CORA se equivocaba: Esta es la parte peligante. Si CORA daba una respuesta incorrecta pero mostraba una citación que parecía convincente, los médicos dejaban de resistirse. Normalmente, los médicos son tercos y mantienen su respuesta correcta el 92% de las veces cuando la IA se equivoca. Pero cuando se mostraba una citación "convincente", esa resistencia caía a solo el 34.8%.

La lección: Confía, pero verifica la prueba
El estudio descubrió una "descalibración de fundamentación" (grounding-miscalibration). Esta es una forma elegante de decir que los médicos fueron engañados por la apariencia de la evidencia. Cuando la IA mostraba una citación, los médicos asumían que la respuesta debía ser correcta, incluso si la citación no demostraba realmente el punto específico. Es como un estudiante que entrega un examen con una página de un libro de texto adjunta. Si la página es sobre el tema correcto pero no responde realmente a la pregunta, un profesor podría pensar: "Oh, hizo la investigación", y darle el crédito. Pero en medicina, ese crédito podría ser un error.

Los investigadores descubrieron que, si bien la IA hacía que los médicos fueran más precisos en general, también creaba un nuevo riesgo: los médicos eran más propensos a abandonar sus propios instintos correctos si la IA hacía que una respuesta incorrecta pareciera bien fundamentada. El estudio sugiere que, para que estas herramientas de IA sean seguras, no podemos limitarnos a mirar si la IA tiene razón o no. Tenemos que asegurarnos de que la "prueba" que muestra realmente demuestre la respuesta, no solo que esté relacionada con el tema. De lo contrario, la misma herramienta destinada a ayudar a los médicos a verificar la verdad podría terminar engañándolos para que confíen en una mentira.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →