← Últimos artículos
📄 medicine

GPT-4o and DeepSeek-V3 responses to common migraine questions: a cross-sectional comparative study of accuracy, completeness, empathy, readability and safety

Este estudio comparativo transversal encontró que, si bien tanto GPT-4o como DeepSeek-V3 proporcionaron información generalmente precisa y segura sobre la migraña, DeepSeek-V3 demostró puntuaciones significativamente más altas en completitud y legibilidad, aunque ninguno de los modelos fue uniformemente superior en empatía o seguridad.

Autores originales: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

Publicado 2026-08-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Millones de personas viven con migraña, una afección que va mucho más allá de un simple dolor de cabeza para causar una discapacidad significativa y alterar la vida cotidiana. Debido a que los síntomas de una migraña a veces pueden parecerse a los de un accidente cerebrovascular u otras afecciones cerebrales graves, los pacientes suelen recurrir a internet en busca de respuestas. En años recientes, un nuevo tipo de programa informático conocido como modelo de lenguaje de gran tamaño se ha convertido en una fuente popular para esta información. Estos sistemas pueden leer vastas cantidades de texto y generar respuestas de apariencia humana para casi cualquier pregunta, ofreciendo explicaciones inmediatas sobre el diagnóstico, los desencadenantes y los tratamientos. Sin embargo, debido a que estos programas no son médicos, existe una preocupación real de que puedan proporcionar consejos incompletos, pasar por alto señales de advertencia peligrosas u ofrecer tranquilidad cuando una persona en realidad necesita atención médica urgente.

Para comprender qué tan bien se desempeñan estas herramientas digitales en un entorno médico de alto riesgo, los investigadores realizaron una comparación directa entre dos de los sistemas más avanzados disponibles: GPT-4o y DeepSeek-V3. El estudio se centró específicamente en las preguntas comunes que las personas hacen sobre la migraña. Los investigadores recopilaron cien preguntas distintas de fuentes del mundo real, incluyendo tendencias de búsqueda en línea y discusiones en foros públicos donde los pacientes comparten sus experiencias. Estas preguntas cubrieron una amplia gama de temas, desde la naturaleza de los síntomas de advertencia y los desencadenantes del estilo de vida hasta la seguridad de los medicamentos y los resultados a largo plazo. Para asegurar que la evaluación fuera justa e imparcial, dos neurólogos revisaron las respuestas generadas por cada modelo sin saber qué programa informático las había producido. Calificaron las respuestas basándose en qué tan precisos eran los hechos médicos, qué tan completa era la información, si el tono era empático y solidario y, lo más importante, si el consejo era seguro para que un paciente lo siguiera.

Los resultados mostraron que ambos programas informáticos generalmente proporcionaron información precisa y segura, reconociendo con éxito la necesidad de ayuda médica profesional cuando se mencionaban señales de advertencia graves. Sin embargo, un sistema, DeepSeek-V3, superó consistentemente al otro en áreas específicas. Proporcionó respuestas más completas, asegurando que los pacientes recibieran no solo los hechos básicos, sino también el contexto necesario sobre alternativas e incertidumbres. Además, el texto generado por DeepSeek-V3 era significativamente más fácil de leer y comprender, utilizando estructuras de oraciones más simples y un lenguaje más claro. Si bien ambos modelos mostraron niveles similares de empatía en su tono, y ambos fueron lo suficientemente seguros como para ser considerados herramientas útiles, la diferencia en la completitud y la legibilidad fue clara y estadísticamente significativa.

En una prueba específica que involucraba veinticinco preguntas que describían síntomas de "bandera roja" peligrosos, como un dolor de cabeza repentino y el peor de la vida o problemas neurológicos nuevos, ambos modelos funcionaron bien al identificar correctamente la necesidad de atención urgente. No obstante, incluso en estos escenarios críticos, el sistema que produjo el texto más claro y legible mantuvo su ventaja. Los investigadores concluyeron que, si bien estas herramientas de inteligencia artificial se están convirtiendo en aliadas poderosas para la educación del paciente, nunca deben reemplazar la evaluación de un médico. En su lugar, se utilizan mejor para ayudar a las personas a comprender conceptos generales y reconocer cuándo necesitan buscar ayuda profesional, siempre que sus respuestas sean revisadas con cuidado. El estudio destaca que, a medida que estas tecnologías evolucionan, su capacidad para comunicar ideas médicas complejas de manera sencilla y completa es tan importante como la precisión de los hechos que presentan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →