HERMES: a multi-agent framework for structured knowledge extraction from ultra-long documents in geoscience
HERMES 是一个可扩展的多智能体框架,它利用一个协调大语言模型,从超长、非结构化的地球科学文档中提取面向 FAIR 原则的结构化知识,成功地将 55 卷的《无脊椎动物古生物学论著》转化为一个具有高准确度且比人工方法效率提升六倍的综合数据库。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学的世界就像一座宏大的古老图书馆,其中最重要的故事并非存储在闪亮的平板电脑上,而是储存在层层叠叠、尘土飞扬的厚重书籍中。这些书籍记录了关于我们星球的发现——化石曾生活在哪里,岩石是如何形成的,以及数百万年前地球磁场的样子。问题在于,这些故事的编写方式是计算机无法读取的。它们被困在长篇段落、杂乱的表格和带有微小说明的图片中。这就像是一张用只有少数人类专家才能破译的秘密代码编写的藏宝图。为了解决这个问题,科学家们正在构建由人工智能驱动的“数字图书管理员”。这些不仅仅是简单的搜索引擎;它们是智能系统,能够阅读一本书,理解故事与表格之间的区别,并提取出特定的事实以构建一个新的、可搜索的数据库。一个大问题是:计算机是否足够聪明,能够在阅读这些庞大且复杂的书籍时,既不产生困惑、不遗漏细节,也不凭空捏造事实?
由此,HERMES诞生了——一支旨在应对这一挑战的新型数字侦探团队。不要把HERMES仅仅看作一个单一的机器人,而要把它看作一个在处理巨大拼图时组织有序的建筑施工队。与其让一名工人试图一次性读完一本500页的书,HERMES使用一个“管理者”AI来协调一个专家团队。其中一位专家负责扫描页面并将图片转化为文本;另一位专家负责搜寻特定的名称,例如化石物种;第三位专家负责检查数字以确保其合理;第四位专家则扮演侦探的角色,准确记录下书中的每个事实是在何处发现的,以便人类进行复核。该系统在《无脊椎动物古生物学专论》(Treatise on Invertebrate Paleontology)上进行了测试,这是一套传奇的系列丛书,共55册,包含了数千页关于古代海洋生物的内容。结果令人印象深刻:HERMES成功提取了32,277个化石名称和近452,000条相关细节,创建了一个此前通过人工构建几乎是不可能的、高度组织化的庞大数据库。研究团队发现,这个AI团队的工作速度大约是人工手动完成工作的六倍,同时保持了极高的准确性。更棒的是,该系统不仅适用于化石;当研究人员给它提供关于地球磁场和岩石化学的不同类型的书籍时,它也能适应并表现良好,这表明这种“智能体团队”(team of agents)的方法可以帮助解锁许多不同科学领域的知识。
论文解释说,虽然现代AI在阅读长文本方面正变得越来越好,但它在处理非常长的文档时往往会在“中间部分”遇到困难,容易遗漏隐藏在开头与结尾之间的重要线索。它还难以证明其信息的来源,而这在科学领域至关重要。HERMES通过分解任务解决了这个问题。“编排者”(Orchestrator,即管理者)阅读用户的请求并指挥团队。“解析器”(Parser)将书籍数字化,将扫描件转化为文本和图表。“实体识别器”(Entity Recognizer)寻找我们寻找的特定事物,比如恐龙的名字。“标注器”(Annotator)抓取与这些名称相关的细节,但它使用了一种被称为“检索增强生成”(retrieval-augmented generation)的聪明技巧,仅查看与该细节相关的特定页面,从而防止它进行猜测或产生幻觉。随后,“验证器”(Validator)根据严格的规则(例如确保化石名称拼写正确)来检查工作,而“追踪器”(Tracer)则标记出该事实在原始PDF中的确切位置。
当研究人员在《专论》这55卷书籍上测试该系统时,系统生成了一个包含32,277个化石实体和451,878个属性的数据库。负责审查工作的专家团队发现,AI的表现非常准确,寻找正确化石的平均得分约为0.90,获取细节的准确度约为0.91。这是一个巨大的效率飞跃:四名专家手动处理仅一卷书就需要45天,而HERMES帮助团队在总计53个人工日内完成了整个系列。作者指出,如果没有这种自动化辅助,他们可能永远不会尝试去整理整个系列。
论文还表明这种方法具有灵活性。当研究人员将HERMES应用于关于古地磁学(研究地球磁场历史的学科)和地球化学(研究岩石化学性质的学科)的书籍时,它不需要从头开始重新训练。他们只需更改“验证器”用于检查工作的规则,系统就能很好地处理新的数据类型。然而,作者也谨慎地指出,该系统并非完美无缺。如果文本在页面之间划分得过于混乱,或者原始书籍是从模糊的复印件扫描而来的,导致计算机误读了字母(例如将“Beraunia”误读为“Bcraunia”),它有时会遗漏细节。他们还强调,虽然AI承担了繁重的工作,但仍需要人类专家来验证最终结果,尤其是针对书中那些最棘手的部分。论文总结道,这种多智能体方法提供了一种将陈旧、杂乱的科学档案转化为干净、可用数据的实用途径,但它在人类与机器协作时效果最佳——由AI完成大部分提取工作,由人类进行最终的质量检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。