Large-scale dataset of automatically classified rhetorical sections in scientific papers
本文提出了一个大规模数据集,该数据集包含来自 Semantic Scholar 开放研究语料库中 1560 万篇科学论文的自动分类修辞章节,经验证达到了人类水平的一致性,并能够对科学写作模式进行细粒度的计算分析。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你走进一座拥有 1560 万篇科学论文 的巨大图书馆。如果你试图阅读所有的论文,你会感到不知所措。但更令人困惑的是,每篇论文都像是一个谜题:有些有清晰的章节,如“引言(Introduction)”或“方法(Methods)”;而另一些则使用奇怪的标题,如“探索之旅(The Journey of Discovery)”或“我们的发现(What We Found)”。
这篇论文是关于构建一个超快速、自动化的图书管理员,它能穿梭于整座图书馆,查看每一篇论文,并瞬间将页面分类到正确的章节中。
以下是他们实现这一目标的原理,用简单的语言进行了解释:
1. 问题所在:“凌乱的桌面”
科学家通常按照一种被称为 IMRaD 的标准格式撰写论文(引言 Introduction、方法 Methods、结果 Results 和讨论 Discussion)。这就像一个食谱:你说明你在做什么菜,如何烹饪,发生了什么,以及你对它的看法。
但在现实世界中,科学家的写作是很“乱”的。
- 一篇论文可能会把“方法(Methods)”部分称为“实验设计(Experimental Design)”。
- 另一篇可能会把“结果(Results)”称为“发现(Findings)”。
- 有些论文甚至会将章节混合在一起,比如“结果与讨论(Results and Discussion)”。
试图通过人工在数百万篇论文中寻找“方法”部分是不可能的。以往使用计算机进行的尝试就像是用一块小磁铁在干草堆里找针——它们只能处理小规模的论文集,无法大规模扩展。
2. 解决方案:基于规则的侦探
作者并没有使用一个试图像人类一样去“思考”的复杂且昂贵的 AI(那既费时又昂贵),而是构建了一个基于规则的侦探(Rule-Based Detective)。
把这个侦探想象成一个拿着清单的、非常严格的图书管理员:
- 第一轮(精确匹配): 侦探寻找“Introduction”这个词。如果看到了,就给它打上标签。
- 第二轮(模式匹配): 侦探寻找各种变体。如果它看到了“Study Design”或“How We Did It”,它就会明白:“啊,那是‘方法’部分!”
- “填空”技巧: 有时侦探会漏掉某个标题。但它知道,如果前一页写着“Methods”,后一页写着“Results”,那么这两页之间的所有内容必然属于“Methods”部分。它会自动填补这些空白。
为什么要采用这种方法?
作者选择这种“笨拙”但快速的方法,而不是使用“聪明”的 AI,是因为:
- 速度: 它在普通计算机上仅用几小时就处理了 1500 万篇论文。
- 透明度: 你可以查看规则并说:“哦,它之所以把这里标记为‘方法’,是因为它看到了‘设计’这个词。” 而对于复杂的 AI,它往往是一个“黑盒”,你不知道它为什么做出某种选择。
- 成本: 运行成本极低。
3. 结果:一个整洁、有序的图书馆
在让侦探跑完整个图书馆后,他们过滤掉了那些过于混乱的论文(例如只有单一章节的论文,因为那不是一篇真正的科学研究)。
最终的数据集:
- 1350 万篇论文 现在被整齐地组织起来了。
- 每篇论文的章节都被贴上了标签(引言、方法、结果等)。
- 涵盖了主要的科学、技术、工程和数学(STEM)领域,其中很大一部分是医学和生物学论文。
4. 它奏效了吗?(“味觉测试”)
为了确保他们的侦探不仅仅是在瞎猜,他们进行了两项测试:
- 人工测试: 他们聘请了 32 名拥有硕士或博士学位的聪明人,手动标注了 100 篇论文。
- AI 测试: 他们要求一个强大的大语言模型(类似于超级聪明的聊天机器人)来标注 1000 篇论文。
结论:
基于规则的侦探表现得和人类一样好。
- 人类专家之间的共识率仅为 61%(这实际上相当低,说明即使是专家也会觉得某些章节难以界定!)。
- 侦探与人类的一致性几乎处于同一水平(58%)。
- 这意味着,这台计算机在分类这些论文方面与人类专家一样出色,但它能比人类快数百万倍。
5. 盒子里装了什么?
作者并没有将这些成果据为己有。他们免费发布了这座图书馆的完整地图。
- 他们并没有提供论文的全文(因为这些内容在其他地方已经可以获取)。
- 相反,他们提供了一份“地图”,这份地图准确地告诉你在那 1350 万篇论文中,每一个“引言(Introduction)”是从哪里开始、到哪里结束的。
总结
这篇论文是关于创建一个巨大的、免费的科学写作地图。通过使用简单、快速的规则而非复杂的 AI,他们成功地将数百万篇杂乱的科学论文整理成了整齐的章节。这使得其他研究人员能够研究科学家是如何写作的,观察不同领域的趋势,或者在以前无法实现的规模上分析科学传播。
底线是: 他们构建了一个快速、廉价且可靠的机器人图书管理员,它能比人类更好地整理世界上的科学论文,并且他们把钥匙交给了所有人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。