Lightweight Semantic Embeddings Enable Redundancy-Sensitive Knowledge Graph Construction for LLM-Based Document Processing
本文介绍了 AMODD,这是一个利用轻量级语义嵌入来对冗余文档章节进行去重并对图实体进行聚类的机器学习增强型流水线,在保持高检索质量的同时,显著降低了知识图谱构建过程中的大语言模型(LLM)Token 消耗与延迟。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一种日益增长的紧张关系:一方面是理解海量信息的渴望,另一方面是计算能力的实际限制。大语言模型(一种能够阅读和书写人类语言的高级软件)常被用于将杂乱、非结构化的文档转化为有序的知识图谱。可以将知识图谱想象成一张事实的结构化地图,其中特定的信息片段被链接在一起,以展示它们之间的关系。这对于能源或法律等行业极其有用,因为这些行业的法规和技术标准可能跨越数百页。然而,当这些文档包含重复内容时,一个显著的问题就出现了。技术手册和法律条文经常在不同的章节中用略微不同的措辞重述相同的规则或定义。当计算机尝试处理此类文档时,它往往会将每一个章节都视为一个独特的谜题,要求昂贵的人工智能去反复分析同一个核心概念。这种方法不仅速度缓慢,而且非常耗费资金,因为使用这些人工智能系统的成本直接与它们处理的文本量挂钩。
富士通欧洲研究中心(Fujitsu Research of Europe)的研究人员致力于通过创建一种更智能的方式来构建这些知识地图,从而解决这种低效问题。他们开发了一个名为 AMODD 的系统,全称为“数据定义自动映射”(Automated Mapping of Data Definitions),并为其增加了一个新的智能层。该增强系统不再盲目地处理文档的每一页,而是首先使用一种轻量级工具来阅读文本并理解其含义。这个工具就像一个快速扫描仪,能够识别出文档中两个不同的章节实际上是在表达相同的意思,即使它们使用的词汇不同。通过在主 AI 接触到这些内容之前识别出这些近乎重复的部分,该系统可以完全跳过冗余的工作。随后,它仅处理唯一的章节,提取事实,并将可能表述方式不同但含义相似的事实归类在一起。最后,当人类针对文档提问时,系统会基于词义而非仅仅匹配精确关键词来进行搜索。
为了测试这种方法是否奏效,研究团队创建了一系列与氢能法规相关的合成文档。他们设计了三个版本的文档:一个几乎没有重复内容的短文档,一个包含部分重复章节的中等长度文档,以及一个充满高度冗余的长文档。随后,他们将同样的文档通过两个不同的流程进行处理。第一个是标准方法,它独立处理每一个章节。第二个是他们配备了意义扫描层的新型增强方法。结果显示,出现了一种完全取决于文档重复程度的清晰模式。对于几乎没有重复内容的短文档,新系统由于必须执行寻找不存在的重复项的额外步骤,速度略慢。然而,随着文档的重复性增加,新系统开始展现优势。在中等长度且具有中度重复的文档上,新方法减少了近 58% 的 AI 调用次数,并将 AI 处理的总文本量削减了 56.7%。在高度冗余的长文档上,节省效果更为显著,减少了 85.4% 的 AI 调用次数和 84.9% 的文本处理量。
除了节省金钱和时间之外,研究人员还非常谨慎地确保这种效率提升不会以损失重要信息为代价。他们测量了最终进入知识图谱的事实(或称“三元组”)数量。他们发现,虽然新系统在处理重复性文档时生成的图谱规模较小,但这并不是因为它丢弃了独特的事实。相反,规模变小是由于它移除了旧系统所保留的重复事实副本。新系统成功地保留了核心知识,同时剥离了噪声。此外,当测试系统回答问题的能力时,新方法表现得更为出色。当被问及类似“这份文档是关于什么的?”这类宽泛的问题时,新系统利用其对意义的理解,能够比旧系统更有效地检索相关事实;而旧系统在问题使用的词汇与文本不完全一致时,表现得较为吃力。
该研究得出结论,这种轻量级的改进改变了这些系统处理文档的方式。与其让成本和时间随文档总长度线性增长,不如让新方法随其中包含的独特信息量进行扩展。如果一份文档充满了重复的条款,系统会识别出这一点并停止在这些内容上浪费资源。研究人员指出,这种方法并非适用于所有情况的“万灵药”:对于缺乏可跳过内容的短篇、独特文档,它不会带来任何收益。然而,对于许多行业中常见的长篇、重复性的技术和监管文本,这种方法提供了一种在不牺牲最终知识图谱质量的前提下,使人工智能变得更高效、更经济的实用途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。