← Últimos artículos
💻 computer science

A human-validated procedure for linking PhD dissertation metadata to OpenAlex author profiles

Este artículo presenta y valida un método generalizable, verificado por humanos, que combina medidas de similitud a nivel de carácter, tópicas y basadas en transformers para vincular de manera fiable los metadatos de las tesis doctorales con los perfiles de autor de OpenAlex, logrando una alta precisión en el seguimiento de las trayectorias académicas y revelando que aproximadamente el 17,3% de los graduados de doctorado en Norteamérica no pueden ser vinculados a publicaciones posteriores.

Autores originales: Jens Peter Andersen, Chaoqun Ni

Publicado 2026-08-28
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jens Peter Andersen, Chaoqun Ni

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cada año, cientos de miles de estudiantes de todo el mundo completan sus doctorados, un hito que marca su entrada formal en el mundo de la investigación. Durante décadas, los científicos que estudian cómo se desarrollan las carreras académicas han dependido de un grupo específico de personas para saber qué sucede después: aquellos que continúan publicando artículos en revistas. Al rastrear estos trabajos publicados, los investigadores han construido una imagen de cuánto tiempo permanecen activos los científicos, qué tan productivos son y cómo evolucionan sus carreras. Sin embargo, esta imagen tiene un punto ciego significativo. Solo incluye a las personas que siguieron publicando. Ignora al vasto número de graduados que abandonan el mundo de la publicación académica por completo, quizás para trabajar en la industria, el gobierno o la enseñanza, o simplemente para dejar de escribir para revistas. Debido a que estos individuos no aparecen en las bases de datos estándar utilizadas para rastrear la producción científica, son efectivamente invisibles para los estudios que intentan comprender el alcance total del impacto de un doctorado. Sin saber quién falta, cualquier estimación de éxito profesional o deserción se basa en una muestra que ya ha sido filtrada por el requisito de seguir publicando.

Para resolver este problema, un equipo de investigadores ha desarrollado una nueva forma de conectar los puntos entre una tesis doctoral y la carrera posterior de su autor, incluso si ese autor nunca publicó otro artículo. Se centraron en la enorme brecha entre el registro de un título y el registro de una carrera. El desafío es inmenso: una tesis es a menudo el único registro del trabajo de una persona en un campo específico, y las bases de datos que contienen millones de artículos científicos están llenas de personas que comparten nombres comunes. Un investigador llamado "John Smith" en una tesis de 2009 podría ser la misma persona que un "J. Smith" que publicó un artículo en 2015, o podrían ser dos personas completamente diferentes. La dificultad se ve agravada por el hecho de que muchos graduados cambian sus nombres, usan diferentes iniciales o publican bajo variaciones ligeramente distintas de sus nombres. Los métodos anteriores a menudo dependían de una simple coincidencia de nombres o de voluntarios que ya habían vinculado su propio trabajo, ambos de los cuales fallan al capturar a la mayoría silenciosa de los graduados que no continúan en el mundo de la publicación.

Los investigadores abordaron esto creando un sistema computarizado que actúa como un bibliotecario altamente calificado, comparando los detalles de una tesis contra millones de posibles coincidencias en una base de datos global de publicaciones científicas llamada OpenAlex. En lugar de solo mirar los nombres, el sistema lee los títulos de las tesis y los títulos de los artículos publicados, descomponiéndolos en pequeñas piezas de texto para ver cuánto se superponen. También utiliza tecnología avanzada para comprender los temas subyacentes del trabajo, reconociendo que un artículo sobre "aprendizaje automático" puede estar relacionado con una tesis titulada "inteligencia artificial" aunque las palabras sean diferentes. El sistema genera una puntuación que representa qué tan probable es que la persona que escribió la tesis sea la misma persona que escribió los artículos. Para asegurar que este sistema funcione, los investigadores lo probaron haciendo que expertos humanos revisaran miles de posibles coincidencias, verificando si las suposiciones de la computadora eran correctas. Encontraron que, al combinar la coincidencia de texto con el análisis de temas, el sistema podía identificar de manera confiable a la misma persona a través de diferentes registros con un alto grado de precisión.

Los resultados de este nuevo método revelan una realidad sorprendente sobre la fuerza laboral académica. Cuando los investigadores aplicaron su sistema a un gran grupo de graduados de doctorado de América del Norte, encontraron que una parte significativa de estos individuos no pudo ser vinculada con ninguna publicación posterior en la base de datos. Específicamente, estiman que entre el 10.2% y el 20.7% de una cohorte típica de graduados de doctorado nunca aparece en las principales bases de datos bibliográficas después de recibir su título, con una mejor estimación del 17.3%. Esto significa que casi uno de cada cinco graduados doctorales está ausente de los mapas estándar de las carreras científicas. Este grupo no es necesariamente un fracaso; pueden tener éxito en otros sectores, pero su ausencia de los datos sesga nuestra comprensión de lo que sucede después de un doctorado. El estudio también mostró que la tasa de "desaparición" del registro de publicaciones aumenta con el tiempo. Mientras que aproximadamente el 73% de los graduados todavía se observa publicando en el año inmediatamente posterior a su título, esa cifra cae a aproximadamente el 50% quince años después. Este declive es aún más pronunciado cuando se incluye a los graduados que nunca publicaron en absoluto, lo que sugiere que la mayoría de los investigadores contribuyen a la literatura científica solo durante un período de tiempo limitado.

Los investigadores también probaron si la inteligencia artificial moderna podría reemplazar su sistema computarizado estructurado. Encontraron que, si bien los modelos de lenguaje de gran tamaño podían realizar juicios muy precisos cuando tenían mucha confianza, eran más lentos y ligeramente menos efectivos para encontrar coincidencias en todo el grupo que el sistema de puntuación especializado. El enfoque más eficiente, sugieren, es usar el sistema especializado y rápido para escanear todos los datos y luego usar la inteligencia artificial solo para verificar los casos en los que el primer sistema no está seguro. Este proceso de dos pasos permite una visión exhaustiva de los datos sin estancarse en el tiempo y el costo de revisar cada registro con un modelo complejo.

En última instancia, este trabajo hace más que simplemente arreglar un problema técnico de coincidencia de datos; cambia la historia de la carrera académica. Al contabilizar a los graduados que no publican, el estudio proporciona una imagen más honesta y completa de los resultados de la formación doctoral. Muestra que el camino después de un doctorado es mucho más diverso de lo que los datos han permitido ver anteriormente, con un número sustancial de personas moviéndose hacia roles que no implican la publicación en revistas académicas. El método desarrollado aquí es abierto y puede aplicarse a otros campos y países, ofreciendo una nueva herramienta para que los responsables de políticas y los investigadores comprendan el verdadero destino de los millones de personas que obtienen un doctorado cada año. Nos recuerda que el final de una tesis no es siempre el comienzo de una carrera científica, y que el valor de un doctorado se extiende mucho más allá de las páginas de una revista.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →