Large Language Models for Pulmonary Embolism Health Education: A Four- Model Comparison of Reliability, Quality, and Readability
Este estudio compara cuatro modelos de lenguaje de gran tamaño en la educación sanitaria sobre embolia pulmonar, encontrando que, si bien Copilot y Perplexity demostraron una fiabilidad y un suministro de fuentes superiores, ninguno de los modelos cumplió con los estándares de legibilidad recomendados para la educación del paciente, lo que destaca la necesidad de supervisión profesional.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que el internet es una biblioteca gigante y bulliciosa donde cualquiera puede entrar y hacer una pregunta. En el pasado, si preguntabas sobre una condición médica aterradora, podrías recibir una pila de libros viejos, un artículo de periódico confuso o un rumor descabellado de un extraño. Pero recientemente, ha llegado un nuevo tipo de bibliotecario: el Modelo de Lenguaje Extenso (LLM, por sus siglas en inglés). Piensa en ellos como robots superinteligentes e incansables que han leído casi todo lo escrito en internet y pueden charlar contigo en un lenguaje sencillo. Son excelentes para escribir historias, resolver problemas matemáticos e incluso responder preguntas de salud.
Pero aquí está la parte complicada: cuando se trata de problemas de salud graves, ser un buen narrador no es suficiente. Necesitas un bibliotecario que conozca los hechos, admita cuando no está seguro y explique las cosas con la suficiente sencillez para que una persona cansada y preocupada pueda entenderlas. Una de esas condiciones aterradoras es la Embolia Pulmonar (EP). Es como un atasco de tráfico en los pulmones causado por un coágulo de sangre, y puede ser muy peligrosa. Debido a que es tan seria, la gente suele acudir rápidamente a Google para encontrar respuestas. Este artículo plantea una gran pregunta: si le haces la misma pregunta a cuatro bibliotecarios de IA diferentes, ¿te darán el mismo buen consejo? ¿O algunos sonarán seguros de sí mismos pero estarán equivocados, o darán respuestas que sean demasiado difíciles de leer?
El Gran Duelo de la IA: ¿Quién es el Mejor Bibliotecario de Salud?
En este estudio, investigadores del Hospital Popular del Condado de Xinfeng decidieron poner a prueba a cuatro de los chatbots de IA más populares. Eligieron a ChatGPT, Gemini, Microsoft Copilot y Perplexity AI. Para que la pelea fuera justa, no les hicieron preguntas extrañas o inventadas. En su lugar, analizaron lo que la gente realmente busca en Google durante un periodo de cinco años. Encontraron las 31 preguntas más comunes que la gente hace sobre la Embolia Pulmonar, cosas como "¿Cuáles son los síntomas?", "¿Cómo se trata?" y "¿Es peligroso durante el embarazo?".
Luego, introdujeron estas mismas 31 preguntas en cada uno de los cuatro modelos de IA. Como había cuatro modelos y 31 preguntas, los investigadores terminaron con 124 respuestas diferentes para calificar. Actuaron como maestros estrictos, utilizando cuatro "boletas de calificaciones" diferentes para revisar las respuestas:
- Fiabilidad: ¿Admitió la IA lo que sabía y lo que no sabía? ¿Mostró su tarea (fuentes)?
- Calidad: ¿Fue el consejo equilibrado y útil?
- Legibilidad: ¿Era el lenguaje lo suficientemente simple como para que un estudiante de sexto grado lo entendiera? (Los médicos suelen recomendar que la información de salud sea así de simple para que todos puedan comprenderla).
- Fluidez General: ¿Se leía con fluidez?
Los Resultados: Las "Buenas" Noticias y las "Malas" Noticias
Aquí está el giro de la trama: Los cuatro modelos de IA respondieron a todas las preguntas. Ninguno falló ni se negó a hablar. Todos sonaron seguros de sí mismos y escribieron con frases claras y fluidas. Si solo leyeras el primer párrafo, todos parecerían expertos útiles.
Sin embargo, cuando los investigadores miraron más de cerca, las diferencias fueron enormes.
La Puntuación de "Fuente" (Benchmark JAMA):
Imagina un ensayo donde obtienes puntos por listar tus fuentes. Dos modelos, Copilot y Perplexity, fueron los únicos que se molestaron en mostrar su trabajo. Proporcionaron citas (enlaces a donde obtuvieron su información). Los otros dos, ChatGPT y Gemini, la mayoría de las veces solo dieron respuestas sin mostrar de dónde venían. De hecho, ChatGPT y Gemini obtuvieron una puntuación de 0 por mostrar fuentes, mientras que Copilot y Perplexity puntuaron ligeramente más alto (alrededor de 1 de 4). Esto significa que si quisieras verificar si la IA estaba diciendo la verdad, solo podrías hacerlo realmente con los dos primeros.
La Puntuación de "Fiabilidad" (DISCERN):
Esta puntuación verifica si el consejo es equilibrado y seguro.
- Copilot y Perplexity obtuvieron una mediana de 41.
- ChatGPT obtuvo 35.
- Gemini obtuvo 33.
En una escala donde 63 es "excelente" y 16 es "muy pobre", los cuatro modelos se situaron en el rango de "pobre" a "regular". Incluso los "ganadores" (Copilot y Perplexity) no alcanzaron el nivel de "bueno". Estaban bien, pero no eran excelentes.
El Problema de la "Legibilidad":
Aquí es donde la trama se vuelve un poco frustrante. La Asociación Médica Americana dice que los consejos de salud deben escribirse a un nivel de lectura de sexto grado para que cualquier persona, independientemente de su educación, pueda entenderlos.
- Los investigadores revisaron las respuestas utilizando seis fórmulas matemáticas diferentes para medir qué tan difícil era leer el texto.
- Ninguno de los cuatro modelos pasó la prueba.
- Las respuestas más fáciles estaban escritas en un nivel de noveno grado (ChatGPT).
- Las respuestas más difíciles estaban escritas en un nivel de decimosexto grado (Copilot), ¡lo cual es como un nivel de lectura universitaria!
- La puntuación de "Facilidad de Lectura de Flesch" (donde una puntuación más alta es más fácil) fue de alrededor de 35 a 48 para todos ellos. Para pasar, necesitaban una puntuación de 80 o más.
Básicamente, los robots de IA estaban escribiendo en un lenguaje que es demasiado complicado para que la persona promedio lo lea rápidamente, especialmente cuando tiene miedo y está preocupada por una emergencia médica.
El Veredicto: No Dejes que el Robot Conduzca el Coche
El estudio encontró que, aunque estos modelos de IA son excelentes para sonar inteligentes y organizar la información, no están listos para reemplazar a un médico.
- Copilot y Perplexity fueron los "mejores" estudiantes porque mostraron sus fuentes y tuvieron una estructura ligeramente mejor, pero aun así escribieron con demasiadas palabras complicadas.
- ChatGPT y Gemini fueron un poco peores al mostrar fuentes, aunque sonaban igual de fluidos.
- Crucialmente, el estudio encontró que ningún modelo combinó hechos fiables, fuentes claras Y un lenguaje sencillo.
Los autores concluyen que estas herramientas de IA son como un copiloto útil, pero nunca deberían ser los que conducen el coche. Pueden ayudar a explicar qué es una enfermedad o qué preguntas hacer al médico, pero no pueden diagnosticarte, decirte si estás a salvo o decidir tu tratamiento. Si usas una IA para obtener información de salud, debes recordar que puede ser segura de sí misma pero estar equivocada, y puede ser demasiado difícil de leer. El mejor plan es usar la IA para obtener un punto de partida, pero luego hacer que un médico humano real revise el trabajo.
En resumen: los bibliotecarios de IA son educados y rápidos, pero todavía están aprendiendo a hablar el idioma "humano" y a demostrar que no se están inventando las cosas. Hasta que mejoren, necesitamos mantener a un humano en el proceso.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.