← 最新论文
🔬 materials science

Optimizing Data Extraction from Materials Science Literature: A Study of Tools Using Large Language Models

本研究评估了五种人工智能工具在从材料科学文献中提取带隙数据方面的有效性,发现虽然实现完全自动化仍具挑战性,但这些工具显著提升了精度并能高效地过滤无关论文,从而弥合非结构化文献与结构化数据库之间的差距。

原作者: Wenkai Ning, Musen Li, Jeffrey R. Reimers, Rika Kobayashi

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenkai Ning, Musen Li, Jeffrey R. Reimers, Rika Kobayashi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在广袤的材料科学领域,研究人员不断寻找完美的原子组合,以创造出新的电池、更快的计算机芯片或更坚固的建筑材料。为了寻找这些组合,他们需要数据:描述材料行为的具体数值,例如电流通过所需的能量。这一被称为“带隙”(bandgap)的信息,是理解一种材料是导体还是绝缘体的关键。然而,这些关键数据并非整齐地排列在有序的电子表格中,而是深埋在数百万篇科学论文之中,以复杂的句子形式呈现,散落在不同的章节里,甚至隐藏在表格或图表中。几十年来,科学家们不得不逐一阅读这些论文,手动搜寻这些数字并将其输入数据库。这个过程缓慢、乏味且容易产生人为错误,导致现有的知识与实际可用于发现的知识之间存在巨大的鸿隙。

为了弥补这一差距,一个研究小组决定测试现代人工智能是否能够承担这项繁重的工作。他们转向了大语言模型(Large Language Models),这是一种在海量文本上训练过的强大计算机程序,能够理解并生成人类语言。其想法很简单:如果一台机器能读懂一个句子并理解其含义,那么它应该能够找到隐藏在句子中的特定数值并自动将其提取出来。研究人员收集了材料科学领域的 200 篇随机科学论文,并要求五种不同的 AI 工具充当“数字图书管理员”,搜索文本以寻找每一个提到的带隙值。随后,他们将这些机器的结果与由人类专家仔细提取的一组数据进行了对比,从而观察 AI 的表现究竟如何。

研究结果显示,虽然这些 AI 工具尚未准备好完全取代人类研究人员,但它们的表现远比此前预想的要出色,尤其是在一项特定任务上:知道何时停止。研究人员发现,这些工具在识别不包含所需数据的论文方面表现得非常出色。事实上,大多数工具都能正确忽略掉 94% 到 99% 不含相关信息的论文。这种“空值精确度”(null precision)是一个至关重要的特性,因为这意味着人类研究人员可以使用这些工具过滤掉成千上万篇无关的文档,从而留下一个规模较小、易于处理的论文清单,其中确实包含所需的数据。即便这些工具仍需要人类协助来验证最终的数值,仅凭这一点就足以节省大量时间。

然而,当涉及到实际寻找并记录正确的数值时,这些工具面临着显著的挑战。表现最好的工具也仅找到了人类专家所定位到的带隙值的约 20%。虽然它找到的数字通常是正确的,但它遗漏了绝大部分数据。研究人员发现,难点不在于数学,而在于语言。科学论文描述材料的方式往往让计算机难以追踪。一种材料可能在一段话中以全称被提及,而在下一段中则使用简称;或者该数值与材料名称之间可能隔着好几段其他文字。AI 工具难以将这些遥远的碎片信息联系起来,经常无法意识到像“它”(it)这样的代词是指向前面提到的某种特定材料。

研究还强调,文档的格式比预想中更为重要。研究人员对两类版本的同一篇论文进行了测试:作者上传的原始草稿版本,以及期刊出版的最终专业排版版本。他们发现,工具的表现会根据其阅读的版本不同而有所差异。带有复杂布局和额外信息的最终出版版本有时会令 AI 感到困惑,导致其结果与较简单的草稿版本不同。这表明,文档的视觉呈现方式会改变计算机理解其内容的方式,对于任何依赖这些工具的人来说,这是一个微妙但重要的细节。

在测试的五种工具中,研究人员发现最成功的方法涉及一种被称为“提示工程”(prompt engineering)的技术——即人类用户精心设计指令来引导 AI,以及另一种将文档拆分为较小部分以帮助 AI 专注于相关章节的方法。有趣的是,依赖于旧有的、基于规则的系统的工具表现不如新型、更灵活的 AI 模型。新型模型更擅长通过文本进行推理,尽管它们仍然会遗漏很多数据。研究人员指出,最大的失败发生在 AI 试图猜测不存在的信息(这种现象被称为“幻觉”)或未能捕捉到测量时的具体条件(如温度或材料相态)时。

最终,该研究得出结论:我们目前还没有达到可以让机器自动构建完美材料科学数据库的程度。这些工具目前还不完整,无法独立使用。然而,它们足以作为一个高效的第一道过滤器。通过使用这些 AI 工具快速扫描数千篇论文并剔除无关论文,研究人员可以将精力集中在少数真正含有所需数据的论文上。研究人员建议,未来的路径在于将机器的速度与人类专家的谨慎判断相结合,例如通过同时使用多种工具,或者教导 AI 更好地理解科学写作的语境。虽然实现完全自动化科学数据库的梦想仍然遥远,但这项工作表明,我们已经拥有了开始使这一过程变得更加快速高效的正确工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →