← 最新论文
💻 computer science

A human-validated procedure for linking PhD dissertation metadata to OpenAlex author profiles

本文提出并验证了一种通用的、经人工验证的方法,该方法结合了字符级、主题级和基于 Transformer 的相似性度量,以可靠地将博士论文元数据与 OpenAlex 作者档案进行关联,从而实现高精度地追踪学术职业轨迹,并揭示了大约 17.3% 的北美博士毕业生无法与其后续发表的论文建立关联。

原作者: Jens Peter Andersen, Chaoqun Ni

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jens Peter Andersen, Chaoqun Ni

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每年,全球有数十万名学生完成博士学位,这一里程碑标志着他们正式进入研究领域。几十年来,研究学术职业生涯如何展开的科学家们一直依赖于一类特定的人群来告诉他们后续发生了什么:即那些继续在期刊上发表论文的人。通过追踪这些已发表的作品,研究人员构建了一幅关于科学家活跃时长、生产力以及职业演变过程的图景。然而,这幅图景存在一个显著的盲点。它仅包含了那些继续从事出版工作的人。它遗漏了大量完全离开学术出版界的毕业生,这些人可能转而从事工业界、政府或教学工作,或者仅仅是停止了为期刊撰稿。由于这些人并不出现在用于追踪科学产出的标准数据库中,因此在试图理解博士学位的完整影响范围的研究中,他们实际上是隐形的。如果不知道谁被遗漏了,那么任何关于职业成功或流失率的估计,都是基于一个已经被“必须持续发表论文”这一要求所过滤过的样本。

为了解决这个问题,一个研究小组开发了一种新方法,用以连接博士论文与其作者随后职业之间的纽带,即使该作者此后再未发表过任何论文。他们关注的是学位记录与职业记录之间巨大的鸿接收。这项挑战是巨大的:一篇论文往往是一个人在特定领域工作的唯一记录,而包含数百万篇科学文章的数据库中充满了重名的人。例如,一位在2009年论文中名为“John Smith”的人,可能是2015年发表了一篇论文的“J. Smith”,也可能是两个完全不同的人。由于许多毕业生会更改姓名、使用不同的首字母缩写或以略微不同的姓名形式发表作品,这一难度进一步加剧。以往的方法通常依赖于简单的姓名匹配或依靠已经关联了自身作品的志愿者,这两者都无法捕捉到那些不继续从事出版工作的沉默的大多数毕业生。

研究人员通过创建一个计算机化系统来解决这一问题,该系统就像一位高水平的图书管理员,将论文的细节与全球科学出版物数据库 OpenAlex 中的数百万个潜在匹配项进行对比。该系统不仅仅是查看姓名,它还会阅读论文标题和已发表论文的标题,将其分解为细小的文本片段,以观察它们之间的重叠程度。它还利用先进技术来理解作品的底层主题,能够识别出即便措辞不同,关于“机器学习”的论文也可能与标题为“人工智能”的论文相关联。该系统生成一个分数,代表论文作者与文章作者为同一人的可能性。为了确保系统的有效性,研究人员通过让专家评审数千个潜在匹配项,检查计算机的判断是否正确,以此对系统进行了测试。他们发现,通过将文本匹配与主题分析相结合,该系统能够可靠地识别不同记录中的同一个人,并具有极高的准确度。

这一新方法的结果揭示了学术劳动力市场的一个惊人现实。当研究人员将该系统应用于北美的一组大规模博士毕业生时,他们发现其中很大一部分人无法在数据库中关联到任何后续的出版物。具体而言,他们估计,在典型的博士毕业生群体中,有 10.2% 到 20.7% 的人在获得学位后从未出现在主要的文献数据库中,其最佳估算值为 17.3%。这意味着近五分之一的博士毕业生在标准的科学职业地图中是缺失的。这一群体并不一定意味着失败;他们可能在其他领域取得了成功,但他们的缺席扭曲了我们对博士毕业后情况的理解。研究还表明,“从出版记录中消失”的速率会随着时间的推移而增加。虽然大约 73% 的毕业生在获得学位后的第一年仍能观察到发表作品,但到十五年后,这一比例降至约 50%。如果将那些从未发表过作品的毕业生也计算在内,这种下降趋势会更加剧烈,这表明大多数研究人员仅在有限的时间窗口内对科学文献做出贡献。

研究人员还测试了现代人工智能是否可以取代他们的结构化计算机系统。他们发现,虽然大型语言模型在高度自信时可以做出非常准确的判断,但与专门的评分系统相比,它们在处理整个群体匹配时速度较慢,且效果略逊一筹。他们建议,最有效的方法是使用快速的专门系统扫描所有数据,然后仅在第一个系统不确定时才使用人工智能进行复核。这种两步走的过程可以在不因使用复杂模型而陷入时间与成本困境的情况下,实现对数据的全面观察。

最终,这项工作不仅仅是修复了一个数据匹配方面的技术问题,它更改变了学术职业的叙事。通过将那些不再发表论文的毕业生纳入考量,这项研究为博士培养成果提供了一个更诚实、更完整的图景。它表明,博士之后的路径远比以往数据所允许看到的要多样化,大量的人正转向不涉及学术期刊出版的角色。这里开发的方法是开放的,可以应用于其他领域和国家,为政策制定者和研究人员提供了一个了解每年获得博士学位的人群真实命运的新工具。它提醒我们,论文的终点并不总是科学职业的起点,博士学位的价值远不止于期刊的篇幅。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →