W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases
本文介绍了 W-RAG,这是一个源感知检索框架,它通过采用本体引导的检索和源级权重分配来解决异构企业知识库中全局排序的局限性,从而提高文档覆盖率和生成质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代职场中,编写如政策手册、合并报告或产品发布计划等复杂文档,通常需要从许多不同的地方汇总信息。一个团队可能需要同时查阅公司内部规则、科学研究论文、政府法规和市场新闻。为了解决这一问题,计算机科学家开发了一些系统,允许人工智能在写作前先查找事实。这种被称为“检索增强生成”(retrieval-augmented generation)的方法,就像是一个数字助手,阅读一整座文档图书馆,并利用这些笔记来起草回复。其目标是让 AI 更加准确且立足于现实,防止其捏造事实。然而,当这些系统试图同时从多种不同类型的“图书馆”中收集信息时,一个显著的问题出现了。
挑战在于,并非所有信息源都是平等的,它们在单一文档中所扮演的角色也各不相同。标准系统通常将它找到的每一段文本都视为在同一场比赛中竞争,纯粹根据词汇与用户问题的匹配程度来挑选顶尖结果。在企业环境中,这种方法往往会失效。它可能会引入数百页包含正确关键词的普通新闻文章,却完全忽略了来自特定政府法规或技术安全指南中的某一个关键段落。其结果是,生成的草案听起来流畅,却遗漏了使文档在法律或技术上有效的核心专业细节。AI 的“上下文窗口”会被某一类来源所占据,从而导致缺乏构建完整图景所需的多元证据。
研究人员 Hridya Dhulipala、Rajesh Ombase、Michael Wang 和 Tien N. Nguyen 着手解决这个特定的问题。他们提出了一种名为 W-RAG 的新框架,即“源感知检索”(source-aware retrieval)。该系统不再让所有图书馆的所有文档在一个大池子中互相竞争,而是组织了搜索过程。它首先识别文档所需的特定主题(例如“数据隐私”或“金融合规”),并使用结构化的概念图谱来寻找相关段落。接着,它不再将所有内容统一排名,而是在每个特定的图书馆内分别对最佳文档进行排序。最后,它为每个图书馆分配一个特定的“预算”,决定最终文档中有多少空间应由公司报告填充,多少由科学论文填充,以及多少由法律文本填充。这确保了最终的草案是证据的平衡组成,反映了任务的真实需求,而非仅仅取决于某个来源中可用的文本量。
为了测试这种方法是否奏效,该团队创建了一个专门针对此类企业写作的新数据集。他们构建了一百个真实的场景,范围涵盖了从起草医疗保健政策到准备并购报告等各种情况。对于每个场景,他们都构建了四个截然不同的信息库:一个包含公司备案和操作指南,另一个包含科学研究,第三个包含法律和监管文本,第四个包含市场新闻和行业报告。随后,他们要求 AI 根据这些混合来源编写文档。研究人员发现,那些仅仅从全局列表中挑选顶尖结果的标准系统表现得非常吃力。这些系统生成的文档往往虽然流畅但并不完整,因为它们忽略了较小的、专业化的图书馆,从而未能涵盖任务的强制性要求。
结果显示,当使用这种新的源感知方法时,情况发生了明显变化。通过迫使系统尊重每个知识库的不同角色,生成的文档质量得到了显著提升。与之前最好的方法相比,新方法的文档需求满足度提升了百分之五十以上;而与标准系统相比,提升幅度则超过了百分之百。它还确保了用于编写文档的信息来自于正确的来源组合,而不是向规模最大或文本量最丰富的图书馆倾斜。这项研究表明,对于复杂的现实世界写作任务而言,信息的选择和平衡方式与寻找信息的能力同样重要。通过仔细管理证据的构成,系统可以生成不仅具有事实依据,而且在结构上完整的草案,从而满足现代企业写作的多样化需求。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。