← 最新论文
📊 statistics

The name-collision burden of name-based author attribution is unequal across name origins: a measurement in OpenAlex, and an identifier-based remedy (SigmaCV)

本研究量化了在 OpenAlex 数据库中,东亚研究人员面临的姓名冲突负担显著高于其英语使用者及其他群体这一现象,证明了基于姓名的归属机制本质上是不平等的,并倡导采用如 SigmaCV 等基于标识符的解决方案,以确保研究评估的公平性。

原作者: Basile Chrétien

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Basile Chrétien

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:OpenAlex 中的姓名冲突负担与 SigmaCV 的补救方案

问题陈述
负责任的研究评估依赖于将学术成果正确归功于特定的研究人员。然而,目前的实践中仍有很大一部分仍基于姓名字符串而非持久标识符进行归属。这种方法在处理常见姓氏以及从非拉丁脚本(特别是东亚姓名)罗马化后的姓名时,会系统性地失效,导致“姓名冲突”(即多个不同的研究者实体共享同一个规范化的姓名)。本文认为,这种歧义并非对称的;姓名冲突的负担不成比例地落在东亚背景的研究人员身上,这为不公平的评估创造了结构性的前提条件。虽然先前的研究已经确立了这种效应的方向,但本文旨在量化整个开放学术数据中拥有 ORCID 的作者群体的负担程度。

研究方法
本研究利用了 2026 年 3 月 OpenAlex 数据库的一个完整快照,包含约 1.136 亿个作者实体。分析重点在于该快照中约 463 万名拥有 ORCID iD 的作者。

  • 人口分层: 作者根据其最后已知机构所在的国家分为三组:

    • 东亚: 日本、中国、韩国、台湾、香港。
    • 英语国家: 美国、英国、澳大利亚、加拿大、新西兰、爱尔兰。
    • 其他: 欧洲大陆和巴西(作为粗略的拉丁字母脚本基准)。
    • 注: 使用国家作为姓名来源和罗马化暴露程度的代理指标,而非自我报告的族裔。
  • 匹配算子: 作者定义了一个透明的、自定义的精确姓名算子(包括转小写、去除重音符号、消除空格),以计算三种不同归属策略下的冲突计数:

    1. 全名实体计数(上界): 共享完全相同的规范化全名的 OpenAlex 作者实体的数量。这包含了潜在的数据库过度拆分情况。
    2. ORCID 受限计数(保守下界): 全名匹配中同时也拥有 ORCID 的子集。由于不同的 ORCID 代表不同的真实个体,这可以作为共享同一姓名的不同真实人数的保守代理指标。
    3. 首字母 + 姓氏计数(遗留的最坏情况): 共享相同首字母和姓氏的实体数量,代表了仅靠姓名字符串匹配的最坏情况(例如,传统的引用风格)。
  • 统计分析: 研究计算了精确的人口统计数据(中位数、四分位距、第 90 百分位数)而非抽样估计。研究采用秩相关系数(rr)来衡量不同层级之间的效应量,并使用负二项回归来调整出版量、学科领域和职业阶段的影响。

核心结果
研究发现,姓名冲突的负担规模巨大,且在不同姓名来源之间存在显著的不平等,这种差异随着归属策略变得不够具体而进一步扩大。

  • ORCID 受限策略(真实人物代理):

    • 中位数的东亚研究人员与其姓名共享的真实人数为 3 人(IQR 为 1–17)。
    • 相比之下,中位数的英语国家和“其他”类研究人员拥有唯一的姓名(中位数为 1)。
    • 10.5% 的东亚研究人员与至少 100 个真实个体共享姓名,而英语国家研究人员为 0.9%,“其他”组为 0.1%。
    • 效应量较大(相对于英语国家,r=0.49r = -0.49;相对于“其他”组,r=0.55r = -0.55)。
  • 全名实体策略:

    • 中位数的东亚研究人员匹配 9 个实体(相对于其他组为 1),反映了真实的冲突以及数据库的过度拆分。
  • 首字母 + 姓氏策略(遗留的最坏情况):

    • 在此策略下,差异最为极端。中位数的东亚研究人员与 4,846 个不同身份发生冲突(IQR 为 1,240–16,548)。
    • 在此策略下,92.3% 的东亚研究人员与至少 100 个身份发生冲突。
    • 英语国家和“其他”组的中位数分别为 69 和 34。
  • 稳健性检查:

    • 出版量: 经过调整出版数量的负二项回归显示,东亚组承担的预期冲突计数仍约为英语国家组的 6.5 到 8.6 倍。这一差距并非源于东亚作者更高的生产力。
    • 敏感性分析: 通过按姓氏而非机构国家进行重新分类,观察到的差距更加显著,证实了使用国家作为代理指标是保守的。

贡献

  1. 量化姓名歧义: 本文首次对开放学术数据中的姓名冲突负担进行了全人口层面的直接量化。它将负担分解为三个层面(全名实体、ORCID 受限的真实人物以及基于首字母的遗留匹配),证明对于罗马化的东亚姓名,基于首字母的归属不仅是一个微小的干扰,而是一种范畴性的失败。
  2. SigmaCV: 作者提出了 SigmaCV,这是一个开源(Apache-2.0)、符合 FAIR 原则的 Web 应用,它通过持久标识符(ORCID)而非姓名来汇编学术简历。它作为“归属应锚定于标识符以避免姓名歧义”这一原则的具体实现案例。

意义与主张
论文声称测量的是姓名歧义,这是不公平归属的必要前提条件,但明确区分了这与已证实的评估损害之间的关系。

  • 主张范围: 作者指出,他们测量的是风险暴露度(冲突负担),而非下游后果(例如,具体的引用扭曲或评价结果)。他们认为,一个巨大且分布不均的负担使得夸大的指标和错误的引用归属成为可能,从而威胁到研究评估的公平性。
  • 补救措施: 论文倡导一种结构性的修复:将归属方式从姓名字符串转向持久标识符。作者强调,这是领域内的共识(已被 OpenAlex、Scisco、Web of Science 和 ORCID 采用),而非一项新发明;SigmaCV 是这一原则的一种实现方式。
  • 局限性与公平权衡: 作者承认其研究人群受限于 ORCID 持有者,这意味着所提议的补救措施(基于标识符的归属)目前仅惠及那些已经拥有标识符的人。他们指出,全球范围内 ORCID 的采用并不均衡,因此虽然通过标识符锚定解决了姓名歧义问题,但也可能将公平差距转移到“必须持有标识符”的要求上。他们并不声称这是一个针对所有研究人员的完整解决方案,但认为对于已识别的人群而言,这是一个必要的纠正措施。

总之,本文提供了经验证据,表明基于姓名的归属会导致东亚研究人员面临比英语和欧洲同行更高且更系统的姓名冲突风险,从而推动向基于标识符的系统(如 SigmaCV)转型,以确保研究评估的公平性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →