The name-collision burden of name-based author attribution is unequal across name origins: a measurement in OpenAlex, and an identifier-based remedy (SigmaCV)
Este estudio cuantifica la carga significativamente mayor de colisiones de nombres que enfrentan los investigadores de Asia Oriental en comparación con sus homólogos anglófonos y otros dentro de la base de datos OpenAlex, demostrando que la atribución basada en nombres es inherentemente desigual y abogando por la adopción de soluciones basadas en identificadores como SigmaCV para garantizar una evaluación de la investigación justa.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: La carga de la colisión de nombres en OpenAlex y el remedio de SigmaCV
Declaración del problema
La evaluación responsable de la investigación depende de la atribución correcta de los trabajos académicos a investigadores específicos. Sin embargo, una parte significativa de la práctica actual todavía atribuye trabajos basándose en cadenas de nombres en lugar de identificadores persistentes. Este enfoque falla sistemáticamente para apellidos comunes y para nombres romanizados de escrituras no latinas (particularmente nombres de Asia Oriental), lo que genera "colisiones de nombres" donde múltiples entidades de autores distintos comparten el mismo nombre normalizado. El artículo postula que esta ambigüedad no es simétrica; la carga de la colisión de nombres recae desproporcionadamente en los investigadores con nombres de Asia Oriental, lo que crea una precondición estructural para una evaluación inequitativa. Si bien trabajos previos establecieron la dirección de este efecto, este artículo tiene como objetivo cuantificar la magnitud de la carga en toda la población de autores con ORCID en los datos académicos abiertos.
Metodología
El estudio utiliza una instantánea única y completa de la base de datos OpenAlex de marzo de 2026, que comprende aproximadamente 113,6 millones de entidades de autor. El análisis se centra en los ~4,63 millones de autores dentro de esta instantánea que poseen un ORCID iD.
Estratificación de la población: Los autores se estratifican por el país de su última institución conocida en tres grupos:
- Asia Oriental: Japón, China, Corea del Sur, Taiwán, Hong Kong.
- Anglófonos: EE. UU., Reino Unido, Australia, Canadá, Nueva Zelanda, Irlanda.
- Otros: Europa continental y Brasil (que sirven como una base de comparación tosca de escritura latina).
- Nota: Se utiliza el país como un proxy del origen del nombre y la exposición a la romanización, no como etnia autodeclarada.
Operadores de coincidencia: Los autores definen un operador de nombre exacto transparente y autodefinido (minúsculas, eliminación de acentos, colapso de espacios en blanco) para calcular los recuentos de colisión para tres estrategias de atribución distintas:
- Recuento de entidades de nombre completo (Límite superior): El número de entidades de autor de OpenAlex que comparten el nombre completo normalizado exacto. Esto incluye una posible sobre-fragmentación de la base de datos.
- Recuento restringido por ORCID (Límite inferior conservador): El subconjunto de coincidencias de nombre completo que también poseen un ORCID. Dado que los distintos ORCIDs representan personas reales distintas, esto sirve como un proxy conservador del número de personas reales distintas que comparten un nombre.
- Inicial + Apellido (Peor caso de legado): El número de entidades que comparten la misma inicial y apellido, lo que representa el peor escenario para la coincidencia basada solo en cadenas de nombres (por ejemplo, estilos de citación heredados).
Análisis estadístico: El estudio calcula estadísticas de población exactas (medianas, rangos intercuartílicos, percentiles 90) en lugar de estimaciones de muestreo. Emplea la correlación de rango-biserial () para medir los tamaños del efecto entre estratos y la regresión binomial negativa para ajustar por volumen de publicación, campo y edad de la carrera.
Resultados clave
El estudio encuentra que la carga de la colisión de nombres es grande y marcadamente desigual entre los orígenes de los nombres, y la disparidad se amplía a medida que las estrategias de atribución se vuelven menos específicas.
Estrategia restringida por ORCID (Proxy de persona real):
- El investigador de Asia Oriental promedio comparte su nombre con 3 personas reales distintas (IQR 1–17).
- En contraste, el investigador anglófono y el del grupo "Otros" tiene un nombre único (mediana de 1).
- El 10,5% de los investigadores de Asia Oriental comparten su nombre con al menos 100 personas reales distintas, en comparación con el 0,9% de los anglófonos y el 0,1% del grupo "Otros".
- El tamaño del efecto es grande ( frente a anglófonos; frente a Otros).
Estrategia de entidad de nombre completo:
- El investigador de Asia Oriental promedio coincide con 9 entidades (frente a 1 para otros), lo que refleja tanto colisiones reales como sobre-fragmentación de la base de datos.
Estrategia de Inicial + Apellido (Peor caso de legado):
- La disparidad es más extrema aquí. El investigador de Asia Oriental promedio colisiona con 4.846 identidades distintas (IQR 1.240–16.548).
- El 92,3% de los investigadores de Asia Oriental colisionan con al menos 100 identidades bajo esta estrategia.
- Las medianas de los anglófonos y de "Otros" son 69 y 34, respectivamente.
- Los tamaños del efecto son muy grandes ( y ).
Pruebas de robustez:
- Volumen de publicación: Una regresión binomial negativa que ajusta por el número de publicaciones muestra que el estrato de Asia Oriental sigue cargando con aproximadamente 6,5 a 8,6 veces el recuento de colisiones esperado del estrato anglófono. La brecha no es un artefacto de la mayor productividad entre los autores de Asia Oriental.
- Análisis de sensibilidad: La reclasificación de los autores por apellido en lugar de por país de institución fortalece la brecha observada, confirmando que el proxy de país es conservador.
Contribuciones
- Cuantificación de la ambigüedad de nombres: El artículo proporciona la primera cuantificación de la población completa y directa de la carga de colisión de nombres en los datos académicos abiertos. Descompone la carga en tres capas (entidades de nombre completo, personas reales restringidas por ORCID y coincidencias de legado basadas en iniciales), demostrando que para los nombres romanizados de Asia Oriental, la atribución basada en iniciales no es un inconveniente menor, sino un fallo categórico.
2.SigmaCV: Los autores presentan SigmaCV, una aplicación web de código abierto (Apache-2.0) y FAIR que ensambla currículos académicos mediante un identificador persistente (ORCID) en lugar de por nombre. Sirve como una instancia desplegada del principio de que la atribución debe estar anclada a un identificador para evitar la ambigüedad de nombres.
Significancia y Reivindicaciones
El artículo afirma medir la ambigüedad de nombres, que es una precondición necesaria para una atribución inequitativa, pero distingue explícitamente esto de un daño demostrado en la evaluación.
- Alcance de la reivindicación: Los autores declaran que miden la exposición al riesgo (la carga de colisión), no las consecuencias posteriores (por ejemplo, distorsiones específicas de citación o resultados de evaluación). Argumentan que una carga grande y distribuida de forma desigual hace posibles los indicadores inflados y las citas mal atribuidas, amenazando así la equidad en la evaluación de la investigación.
- Remedio: El artículo aboga por un arreglo estructural: cambiar la atribución de cadenas de nombres a identificadores persistentes. Enfatiza que esto es un consenso en el campo (implementado por OpenAlex, Scopus, Web of Science y ORCID) en lugar de una invención novedosa, y que SigmaCV es una implementación de este principio.
- Limitaciones y compensaciones de equidad: Los autores reconocen que su población está restringida a los poseedores de ORCID, lo que significa que el remedio propuesto (atribución basada en identificadores) beneficia actualmente a quienes ya tienen identificadores. Señalan que la adopción de ORCID es desigual globalmente, por lo que, si bien el anclaje por identificador resuelve el problema de la ambigüedad de nombres para los identificados, puede desplazar la brecha de equidad hacia un requisito de "poseer un identificador". No afirman que esto sea una solución completa para todos los investigadores, sino que argumentan que es un correctivo necesario para la población identificada.
En resumen, el artículo proporciona evidencia empírica de que la atribución basada en nombres crea un riesgo sistemáticamente mayor de confusión para los investigadores de Asia Oriental en comparación con sus homólogos anglófonos y europeos, lo que motiva un cambio hacia sistemas basados en identificadores como SigmaCV para garantizar una evaluación de la investigación justa.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.