SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions
本文介绍了 SciSchema.org,这是首个包含 16 个由专家标注的模式的多学科集合,旨在标准化不同领域科学过程的描述,从而通过人机协同的开发工作流实现结构化注释、可复现性和跨研究比较。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学一直依赖于书面文字来分享发现是如何实现的。研究人员在期刊文章中描述实验,将材料清单、机器设置和逐步指令交织在段落文本之中。这种方法对于能够推断上下文并填补空白的人类读者来说效果很好,但却为机器制造了显著的障碍。计算机难以理解,在一部论文中提到的“加热至 80 度”与另一部论文中提到的“维持在 353 开尔文”意味着相同的事物,或者理解生物实验室中的特定化学过程与化学实验室中的过程遵循相似的逻辑。随着科学变得更加自动化和跨学科——人工智能系统和机器人实验室试图阅读并执行这些指令——缺乏一种通用的、结构化的科学方法语言已成为一个瓶颈。如果没有一种将发现的散文转化为刚性的、机器可读格式的方法,比较研究、复现结果以及实现研究自动化的潜力将很大程度上无法得到开发。
为了填补这一空白,一个大型国际研究团队推出了 SciSchema.org,这是一个全新的结构化模板集合,旨在以人类和计算机都能理解的方式来描述科学过程。该团队由来自生物学、物理学、心理学和材料科学等不同领域的专家组成,他们并非仅仅通过手工编写这些模板。相反,他们开发了一种协作工作流,由人类专家引导人工智能模型去挖掘数千篇科学论文,并提取出特定实验的核心组成部分。其成果是一套包含 16 个不同“模式”(schemas)或结构化大纲的集合,涵盖了从使用 CRISPR-Cas9 进行基因编辑到重建粒子物理中中微子事件等各种过程。这些模式精确定义了记录给定类型实验时需要记录哪些信息——例如所使用的特定仪器、其运行条件以及采取的具体步骤——从而将传统论文中杂乱、非结构化的散文转化为清晰、可比的数据。
该项目始于确定 16 个在文献中已有成熟且频繁描述的特定科学过程,以确保有足够的素材可以使用。随后,团队为每个过程招募了领域专家(从分子生物学家到心理学家)来担任指导者。这些专家提供了其领域标准程序的初步描述以及一系列相关的科学论文。核心工作涉及一个“人机协同”(human-in-the-loop)系统,其中大型语言模型(能够阅读并理解文本的高级 AI 工具)被要求阅读这些论文并为该过程提出一个结构化大纲。AI 会扫描文本,识别诸如温度设置或化学浓度等重复出现的细节,并起草一个将这些细节组织到逻辑类别中的模式。
然而,AI 并非独自工作。在模型生成初始草案后,人类专家会对它们进行审查,指出缺失的细节,纠正术语,并建议如何对不同的信息进行分组。这种反馈被反馈回 AI,随后 AI 对其草案进行优化。这种生成与专家修正的循环在多个阶段反复进行,AI 在每一步中都会阅读更多的论文。该过程旨在迭代,使 AI 能够从专家的修正中学习,并逐渐构建出更准确、更全面的结构。团队使用 12 种不同的 AI 模型测试了这一工作流,涵盖了从小型、快速的模型到庞大、复杂的模型,以观察哪种方法能产生最好的结果。
这一严谨过程的结果是创建了 16 个最终的、经过专家注释的模式。每个模式都作为特定类型科学过程的主模板。例如,“聚合酶链式反应”(PCR)模式(一种用于复制 DNA 的常用技术)定义了所用生物材料、遗传引物设计、热循环条件以及所得数据的特定字段。同样,“金属材料疲劳测试”模式概述了金属类型、测试样品形状、施加的力以及环境条件等字段。这些模式并不填充特定实验的数据;相反,它们是科学家可以用来以标准化方式记录自身数据的空白表单。通过使用这些模板,研究人员可以确保实验中的每一个关键细节都被捕捉,并以易于搜索、与其他研究进行比较以及被软件处理的格式进行记录。
研究人员发现,最终模式的质量在很大程度上取决于 AI 与人类专家之间的协作。虽然 AI 模型能够生成复杂的结构并识别数百篇论文中的模式,但它们通常需要人类引导以确保科学准确性和术谱的恰当性。团队观察到,随着接触更多论文和更多轮次的专家反馈,AI 模型变得更加详细且结构更加复杂。最庞大且最详细的模式是由最先进的指令遵循模型生成的,这些模型生成的提纲拥有数百个特定字段和多层组织结构。然而,关于什么构成了“金标准”结构的最终决定权始终掌握在人类专家手中,他们从 AI 的各种草案中挑选出最佳元素来创建最终版本。
该研究的一个关键发现是,这种人机伙伴关系可以比传统的纯手动方法更快地产生高质量、特定领域的模式。团队仅用两个月时间就开发并验证了所有 16 个模式,如果依靠专家手动提取并组织每一项细节,这个时间框架是不可能实现的。该过程还揭示了不同类型的科学过程需要不同程度的细节。某些过程,如心理学中用于测量反应时间的“斯特鲁普任务”(Stroop Task),生成的模式字段较少且嵌套较浅,反映了实验性质较为简单、标准化的特点。而另一些过程,如生物学中的“Bulk RNA-seq 文库制备”,则产生了具有深层嵌套信息的极其复杂的模式,反映了涉及的湿实验操作的复杂性和多步骤特性。
发布的集合不仅包括最终的模式,还包括它们创建的完整历史记录。数据存档包含了 AI 生成的中间草案、专家提供的反馈以及用于该过程的论文元数据。这种透明度使其他研究人员能够准确了解这些模式是如何构建的,理解特定设计选择背后的逻辑,并将其材料用于自己的项目。这些模式提供两种格式:一种旨在用于标准的计算机文档,另一种旨在用于知识图谱(即用于连接不同来源信息的链接数据网络)。这种双重格式确保了这些模式可以广泛应用于各种软件系统,从简单的资料录入表单到复杂的科学数据库。
这项工作的意义在于它改变了科学知识存储和分享的方式。通过提供一种描述科学“如何做”的结构化方式,SciSchema.org 使人们能够超越基于文本搜索的局限性。研究人员最终不再仅仅搜索提到特定关键词的文章,而是可以搜索所有使用了特定组合的仪器、条件和材料的实验,无论原作者在散文中是如何描述它们的。这种能力对于科学的未来至关重要,在未来,比较、复现和自动化实验的能力对于解决复杂的全球挑战将是关键。该项目表明,虽然人工智能是组织信息的强大工具,但当它受到人类专业知识的引导时最为有效,这种协同作用可以捕捉科学实践的细微差别和深度,并将其转化为机器可读的形式。
团队通过开放许可将这些资源免费向公众发布,包括模式、用于生成它们的代码以及分析工具。这确保了科学界可以建立在此基础上,增加针对其他过程的新模式,并根据需要完善现有模式。该项目还包括与“开放研究知识图谱”(Open Research Knowledge Graph)的连接,该系统允许将这些结构化描述直接链接到原始科学论文,从而在发现的原始文本与可复现性的结构化数据之间架起一座桥梁。通过这样做,SciSchema.org 为实现这样一个未来提供了切实的一步:在这个未来中,科学的方法将像其结果一样,是易于获取、比较和复用的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。