← Últimos artículos
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

Este estudio revela que, si bien los modelos de lenguaje de gran escala de vanguardia generan una proporción significativa de citas médicas poco fiables —principalmente mediante la atribución errónea en lugar de la fabricación—, un sistema automatizado de Cadena de Verificación puede detectar estos errores con una precisión de nivel experto, ofreciendo una solución viable para garantizar la integridad de las citas en la escritura médica asistida por IA.

Autores originales: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

Publicado 2026-09-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

En la práctica médica moderna, escribir un artículo de investigación o un artículo de revisión es un proceso riguroso que exige una precisión absoluta. Los autores no solo deben sintetizar conocimientos médicos complejos, sino también anclar cada afirmación a una fuente de evidencia específica y existente. Estas fuentes son las citas, que actúan como las huellas de los descubrimientos científicos, dirigiendo a los lectores de vuelta a los estudios originales que sustentan una nueva idea. Durante décadas, este proceso ha sido una labor humana, que requiere la verificación cuidadosa de nombres, fechas y títulos de revistas para asegurar que una referencia realmente exista y diga lo que el autor afirma que dice. Sin embargo, una nueva herramienta ha entrado en el laboratorio y la biblioteca: el modelo de lenguaje de gran tamaño. Estos son programas informáticos potentes entrenados en vastas cantidades de texto que pueden redactar artículos, resumir hallazgos y generar listas de referencias en segundos. Si bien ofrecen una promesa de velocidad y eficiencia, ha surgido una pregunta crítica: ¿pueden estas máquinas confiar en encontrar las huellas correctas, o a veces las inventan?

Esta pregunta no es meramente académica; toca el corazón de la integridad médica. Si una computadora escribe una revisión médica e incluye una cita que parece real pero apunta al estudio equivocado, o peor aún, a un estudio que nunca existió, todo el argumento podría colapsar. Este fenómeno, conocido como alucinación, ha sido una debilidad conocida de los modelos informáticos anteriores. Pero a medida que estas herramientas han evolucionado, volviéndose más rápidas y equipadas con la capacidad de buscar en internet en tiempo real, no ha quedado claro si finalmente han aprendido a citar correctamente. La comunidad médica necesita saber si estos nuevos y avanzados modelos son lo suficientemente fiables como para ser utilizados en investigaciones serias, y si no lo son, si existe una forma práctica de detectar sus errores antes de que se publiquen.

Un equipo de investigadores se propuso responder a estas preguntas sometiendo a tres de los modelos informáticos más avanzados a una prueba estricta. Pidieron a cada modelo que escribiera una serie de breves revisiones médicas sobre nueve temas diferentes dentro del campo de la cardiología, el estudio del corazón y los vasos sanguíneos. Los temas variaban desde condiciones comunes hasta procedimientos poco frecuentes, asegurando una mezcla de sujetos con muchos estudios publicados y sujetos con muy pocos. Se instruyó a cada modelo para que escribiera una revisión de aproximadamente 600 a 900 palabras e incluyera exactamente treinta referencias para cada artículo, para un total de 270 revisiones y más de 8,000 citas. Crucialmente, los investigadores permitieron que los modelos utilizaran sus herramientas de búsqueda web integradas, simulando cómo un usuario las emplearía realmente en un entorno del mundo real. El objetivo era ver cuántas de estas miles de citas eran realmente correctas.

Los resultados revelaron un panorama de variación significativa y error persistente. Cuando los investigadores verificaron cada una de las citas contra la base de datos médica oficial, descubrieron que los modelos no eran perfectos. Un modelo, GPT-5.5, fue el que mejor se desempeñó, produciendo citas problemáticas en aproximadamente el 11.5 por ciento de los casos. Sin embargo, los otros dos modelos, Claude Opus 4.8 y Gemini 3.5 Flash, cometieron errores en casi el 30 por ciento de sus citas. Esto significa que, por cada diez referencias generadas por los modelos menos precisos, aproximadamente tres eran defectuosas. Los investigadores también investigaron si los modelos tenían más dificultades con temas que tenían menos estudios publicados, temiendo que la falta de información disponible pudiera confundir a la computadora. Encontraron que, si bien las tasas de error eran ligeramente menores para temas con más literatura, la diferencia no era lo suficientemente fuerte como para ser considerada una regla definitiva. Los modelos cometieron errores en todos los ámbitos, independientemente de cuánta información hubiera disponible sobre el tema.

Quizás el descubrimiento más revelador fue la naturaleza de los errores mismos. Los investigadores esperaban encontrar muchos casos donde la computadora simplemente inventara un artículo falso, una forma clásica de alucinación. En su lugar, descubrieron que la gran mayoría de los errores eran mucho más sutiles. Alrededor del 77 por ciento de las citas problemáticas fueron casos de atribución errónea. En estos casos, la computadora proporcionaba un identificador real y válido para un artículo médico real, pero ese artículo no era el que el modelo pretendía. Era como si la computadora hubiera encontrado un libro real en una biblioteca pero lo hubiera colocado en el estante equivocado, etiquetándolo con el título de un libro diferente. Este tipo de error es particularmente peligroso porque parece correcto a primera vista; un lector humano podría ver un número válido y asumir que la referencia es confiable, solo para descubrir más tarde que la fuente no respalda el punto que se está exponiendo. La fabricación real, donde la computadora inventaba un artículo que no existe en absoluto, fue sorprendentemente rara, representando menos del 1 por ciento de los errores.

Reconociendo que estos errores sutiles son difíciles de detectar para los humanos sin una verificación sistemática, los investigadores probaron un nuevo método de verificación llamado Cadena de Verificación (Chain-of-Verification). Este enfoque utiliza el propio modelo de computadora, pero de una manera diferente. En lugar de pedir al modelo que simplemente liste las referencias, el sistema descompone la tarea en una serie de preguntas pequeñas e independientes. Le pide al modelo que encuentre el artículo basándose en su título y autor, luego que verifique si la revista y el año coinciden, y finalmente que confirme que el identificador apunta al documento correcto. Al obligar al modelo a verificar cada pieza de información por separado contra la base de datos, en lugar de confiar en su memoria, el sistema puede detectar sus propios errores. Cuando los investigadores probaron este método contra un conjunto de referencias que habían sido cuidadosamente revisadas por un experto humano, el sistema automatizado demostró ser notablemente efectivo. Identificó correctamente el 96.8 por ciento de las citas problemáticas, incluyendo cada caso de atribución errónea y fabricación, mientras que rara vez marcaba una cita correcta como un error.

El estudio concluye que, si bien la nueva generación de herramientas de escritura médica es poderosa, aún no está lista para ser confiada sin supervisión. El fallo más común no es la invención de hechos falsos, sino el etiquetado incorrecto de los reales, un error que requiere un tipo específico de verificación para ser detectado. Los investigadores encontraron que un proceso de verificación automatizado puede realizar esta comprobación con una precisión comparable a la de un experto humano. Esto sugiere que el futuro de la escritura médica asistida por IA no será una elección entre el humano y la máquina, sino una asociación donde la máquina redacta el contenido y un sistema de verificación especializado asegura que cada una de las citas apunte a la verdad. Hasta que dicha verificación se convierta en una práctica estándar, las citas generadas por estos modelos deben tratarse con cautela, ya que pueden llevar a los lectores a la fuente equivocada de la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →