An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Document Layouts: A Plant Science Use Case
本文提出了一种结合了基于规则的解析与大语言模型的模块化智能体框架,用于从描述性文档布局中稳健地提取并富集植物性状注释,成功处理了近 5,000 个植物物种中的 55,000 多个性状。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几个世纪以来,植物学家一直依赖厚重的印刷卷册来描述世界上的植物。这些书籍通常充满了密集的文本段落,包含了理解一个物种如何生存、生长在哪里以及外观如何的关键。然而,为了让计算机能够使用这些知识,必须将这些信息从人类可读的页面转换为机器可以搜索和分析的结构化数据。挑战在于这些文本的数量之巨和复杂程度之高,它们由多种语言编写,并包含对植物特征(称为“性状”)的细微描述。手动提取这些数据既缓慢又容易出错,而传统的计算机方法往往难以理解科学语言的细微差别或旧扫描页面的布局。为了解决这个问题,研究人员开始构建一种结合了严格逻辑规则与人工智能灵活推理能力的系统,旨在将植物描述图书馆转化为庞大的、可搜索的数据库。
在最近的一项研究中,一个研究小组开发了一种新系统,旨在阅读这些植物学文本并自动提取有关植物特征的具体细节。该过程始于旧书的数字扫描件,这些书籍通常只是文本的图像。系统首先使用光学字符识别技术,这种技术将那些图像转化为计算机可以读取的实际字母和单词。一旦文本变得可读,系统就会通过将描述归类到正确的植物名称下进行组织。这一步至关重要,因为一本书可能会描述成千上万个不同的物种,计算机必须准确知道一个植物的描述在哪里结束,另一个又在哪里开始。研究人员发现,仅仅阅读文本是不够的;系统需要理解页面的结构,以便准确地分隔不同的部分。
为了提取实际信息,该团队构建了一个像专业工作小组一样的流水线。第一组工作人员遵循严格的、预先编写的规则来寻找特定的模式。例如,如果文本提到“叶子”后跟着一个测量值,如“4厘米”,系统就会记录该植物具有该尺寸的叶子。这些规则精确且可靠,但它们只能找到被明确告知去寻找的内容。为了捕捉更多细节,系统采用了第二组由大语言模型驱动的工作人员,这些是经过海量人类写作训练的高级人工智能程序。这些AI代理充当虚拟专家,可以建议描述植物部位的新词汇和短语,帮助系统识别那些仅靠规则可能遗漏的描述。这种结合使得系统既准确又具有适应性,能够在不丢失原始数据清晰度的前提下填补空白。
研究人员在来自新喀里多尼亚、塞内加尔和喀麦隆的三组大型植物学文本集上测试了该系统。结果显示,该系统成功提取了近56,000个特定的性状注释,涵盖了近5,000个不同的植物物种。平均而言,系统为每种分析的植物识别了约九个不同的性状。当他们在基于规则的严格系统中加入AI驱动的词汇扩展功能时,注释的总数增加了近60%,覆盖了他们所寻找性状的四分之三。这一改进证明了虽然规则提供了坚实的基础,但AI代理显著扩展了系统理解植物学家描述植物多样化方式的能力。
研究还表明该系统具有鲁棒性,这意味着即使在扫描文本质量发生变化时,它也能表现得始终如一。研究人员测试了不同的图像转文本方法,发现虽然某些方法在识别植物名称方面略好,但提取的性状总数无论使用哪种方法都保持稳定。这表明该流水线足够可靠,能够处理历史文献中混乱的现实情况。然而,该系统并非完全自动化;它仍然需要人类专家在将AI代理提出的建议添加到最终规则之前进行审核。这种人工监督确保了数据的可信度,并防止系统编造事实——这是单独使用人工智能时的一个常见风险。
最终,这项工作为组织世界植物知识提供了一个强大的工具。通过将非结构化文本转化为组织有序的数据,该系统有助于科学家建立更好的数据库,以研究生物多样性和植物进化。这种方法证明,将人类设计的规则的精确性与人工智能的灵活推理能力相结合,可以解锁隐藏在数百万页科学文献中的信息。研究人员公开了他们的代码和数据供他人使用,确保这种方法可以应用于其他需要理解和组织复杂文本的领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。