Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset
本文介绍了 SBC-AND,这是一个由 442 条葡萄牙语科学出版记录组成的精选数据集,旨在解决作者姓名消歧研究中非英语语言代表性不足的问题,并作为一个具有挑战性的基准,用于评估多语言消歧模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“姓名标签”的混淆
想象一下,你走进一个巨大的图书馆,里面有数百万本由不同的人写的书。问题在于,许多人的名字都一样,比如“John Smith”或“Maria Silva”。
在科学界,这是一个巨大的麻烦。如果一位名叫“Maria Silva”的研究员写了一篇关于计算机的论文,而另一位“Maria Silva”写了一篇关于历史的论文,图书馆可能会误以为他们是同一个人。这会扰乱他们的名誉、引用次数以及我们对研究人员如何进行协作的理解。这种辨别哪篇论文属于哪位“Maria Silva”的任务被称为作者姓名消歧(Author Name Disambiguation, AND)。
差距:“仅限英语”的派对
长期以来,科学家们一直在开发工具来解决这种混淆问题,但这些工具大多是在英语姓名上进行练习的。这就像是一位派对策划师,非常擅长组织英语宾客,但从未见过任何拥有葡萄牙语姓名的人。
葡萄牙语姓名非常复杂。它们通常有多个姓氏(如“Silva”或“Santos”),还有像“de”、“da”或“dos”这样的小连接词。此外,在科学记录中,这些名字经常被缩写或书写得不一致(例如,“A. Silva”与“Ana Silva”)。正因如此,现有的工具在遇到葡萄牙语出版物时会显得力不从心。
解决方案:SBC-AND “训练健身房”
该论文的作者创建了一个名为 SBC-AND 的新工具。你可以把它看作是一个专门的训练健身房。
- 里面有什么? 它收集了来自巴西计算机科学期刊的 442 篇真实科学文章。
- 它是如何组织的? 作者将这些文章分成了“歧义块”。想象一个贴着“Silva”标签的盒子。在盒子里,有来自 232 个不同的真实人物的论文,他们都拥有相同的姓氏。
- 目标: 该数据集是经过“人工校验”的,这意味着已经有人检查并标注了哪些论文准确属于哪位真实的人物。这为计算机提供了一个可以用来测试自己的“正确答案解析”。
实验:测试计算机的大脑
研究人员不仅制作了这个数据集,还对其进行了测试。他们使用了一个灵活的计算机系统(称为 ADAN),该系统试图将论文重新分类回正确的组别。
他们使用了两种不同的“大脑”模型(能够理解语言的 AI 模型)来测试该系统:
- BAAI/bge-m3:一个多语言模型。
- IBM Granite:另一个多语言模型。
他们还调整了系统的“深度”(它进行思考的层数)以及它练习的时间长短(训练轮数/epochs)。
结果:一项艰巨的挑战
以下是计算机尝试对论文进行分类时的表现:
- “大局观”与“细节”: 计算机在保持组别之间相互独立方面做得相当好(比如把“Silva”盒子与“Oliveira”盒子分开)。然而,在正确分类“Silva”盒子内部的论文时,它却遇到了困难。
- 得分情况: 计算机在整体结构上的得分不错(准确率约为 90%),但当涉及到将特定的论文对匹配到正确的作者时,得分显著下降(约为 45%)。
- 原因: 论文解释说,这是因为数据集中的许多真实作者在列表中仅有一两篇论文。这就像是在派对上试图识别一个人,但你只能见到他们一次;很难将他们与看起来相似的其他人的区分开来。
- 胜出者: IBM Granite 模型表现略优于另一个模型,尤其是在使用特定“思考深度”(两层)时。将系统变得更“深”(三层)并没有帮助;反而让情况变得更加混乱。
总结
论文得出结论,SBC-AND 是对现有技术的一次非常严苛的测试。它强调了虽然计算机在组织科学数据方面正在变得越来越好,但在处理像葡萄牙语这样姓名复杂且作者发表作品较少的语言时,仍然面临挑战。
作者已将该数据集在线发布,以便其他研究人员可以使用它来构建更好的工具,确保在未来,每一位“Maria Silva”都能为自己的工作获得应有的认可。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。