← 最新论文
📄 earth_science

GeoExtractor: A Framework for Structured Information Extraction from Geoscientific Literature

本文介绍了 GeoExtractor,这是一个由大语言模型驱动的多智能体框架,它采用层级提取策略,将非结构化的地球科学文献自动转换为结构化数据,其性能显著优于现有方法,并成功地从编译的锆石分析数据库中重建了已知的构造模式。

原作者: Zhong Peng, Ziqi Song, Yufei Ye, Shuang Li, Zongyuan Xiang, Jiang Yang

发布于 2026-07-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhong Peng, Ziqi Song, Yufei Ye, Shuang Li, Zongyuan Xiang, Jiang Yang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,地球科学的世界就像一座巨大且混乱的图书馆。在这座图书馆里,存放着过去一个世纪以来地质学家撰写的数百万本书籍、文章和报告。这些文档中蕴藏着“黄金”:关于岩石年龄、化学成分和地理位置的具体数字。但问题在于:这些黄金被埋藏在杂乱无章的句子、凌乱的表格和散落的图表中。

为了建立一个有用的数据库,科学家们过去不得不扮演拿着放大镜的图书管理员,逐页手工阅读,以寻找并复制这些数字。这个过程缓慢、令人精疲力竭,而且意味着大量的宝贵数据正处于无法被计算机利用的闲置状态。

GeoExtractor 正式登场。

把 GeoExtractor 想象成一支配备了特殊工具的超级聪明、不知疲倦的机器人图书管理员团队。他们并不试图一次性读完整本书并猜测答案,而是使用一种巧妙的、循序渐进的策略来挖掘信息。

以下是这个“团队”的工作方式,我们使用简单的类比来解释:

1. 策略:不要试图一口吞下大象

如果你要求一台普通的计算机一次性阅读一篇 50 页的地质学论文并提取 20 个不同的数字,它很可能会感到困惑或遗漏信息。这就像要求某人在一次坐席中背诵完一整部百科全书。

GeoExtractor 将这项工作分解:

  • 第一步:寻找“主角”(主键)。 首先,系统扫描文档以寻找主要对象,例如“岩石样本 A”或“钻孔 B”。它将这些对象视为“锚点”。
  • 第二步:侦探循环。 一旦找到了一个岩石样本,它不会仅仅去猜测其年龄或位置。相反,它会进入一个循环:
    • 决策: “我还需要这个岩石的哪些信息?啊,我需要它的年龄。”
    • 检索: 它表现得像一名在特定书架上搜寻的侦探,专门寻找提到该特定岩石年龄的段落或表格。
    • 生成: 它写下答案。
    • 重复: 它转向下一个信息点(如位置),再次进行搜索,然后记录下来。

2. 两阶段搜索:网与矛

有时,信息很容易找到(例如清晰表格中的数字)。而有时,信息则隐藏得很深。论文描述了一个“两阶段检索”系统来处理这种情况:

  • 第一阶段(网): 对于大多数问题,系统会撒出一张大网,快速捕捉相关的文本。这种方式效率很高,能够涵盖基础内容。
  • 第二阶段(矛): 如果“网”没有捕捉到任何东西,或者答案需要连接来自三个不同页面的线索(例如:“该岩石位于此位置,该位置属于此省份,而该省份又是此山脉的一部分”),系统就会切换到“矛”模式。它会执行更深层次的多步搜索,以拼凑来自文档不同部分的线索。这就像是在破解一个谜团,嫌疑人的位置在第一章被提及,而犯罪现场却在最后一章被描述。

3. 质量控制:事实核查员

在机器人团队提交最终清单之前,一个“验证模块”会充当严格的编辑。它会根据原始文本检查团队找到的每一个数字。如果机器人编造了一个数字,或者找不到能证明该数字的原文,编辑就会将其划掉。这防止了“幻觉”(即凭空捏造)现象。

结果:从数年到数小时

研究人员在四种不同类型的地质课题(如古磁场、石油勘探和岩石化学)上测试了这个系统。

  • 测试: 他们将 GeoExtractor 与其他方法进行了对比,包括“一次性通读法”和标准的基于示例的工具。
  • 胜出: GeoExtractor 表现出了最高的准确性,尤其是在数据复杂或分散在文档各处时。它特别擅长捕捉其他方法容易忽略的关联性。

现实世界测试:中亚造山带

为了证明其在现实世界中的有效性,团队使用 GeoExtractor 为一个巨大的造山运动区域——中亚造山带(CAOB)构建了一个数据库。

  • 任务: 他们向系统输入了 179 篇包含 2,259 个岩石样本数据的科学论文。
  • 速度: 一位人类专家手动完成这项工作大约需要 1,400 小时(平均每篇论文 8 小时)。而 GeoExtractor 用时不到 45 小时
  • 成果: 机器人提取的数据不仅仅是一串数字列表;当科学家观察其中的模式时,发现这些数据完美契合已知的地质理论,即关于地球地壳在数百万年间如何移动和变化的理论。这证明了机器人不仅是在复制数字,它还理解数据的结构。

核心结论

GeoExtractor 是一个能将杂乱、无序的科学故事转化为清晰、结构化数据的工具。它并不是要取代科学家,而是将他们从枯燥、重复的数据录入工作中解放出来,让他们能够专注于重大的发现。它将一座由难以阅读的文本组成的图书馆,变成了一个可搜索、计算机友好的宝库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →