RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation
本文提出了检索与构建(Retrieval-And-Structuring, RAS)框架,该框架通过迭代式检索和结构化知识构建来动态构建特定问题的知识图谱,从而显著提升大语言模型在知识密集型任务上的多步推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个非常棘手的谜团,比如弄清楚一位著名的科学家在结婚后究竟信仰什么宗教。你手头有一个巨大的图书馆(互联网)可以利用,但你无法读完每一页。
现有方法的问题
现在的多数 AI 助手的工作方式就像是一个被递给一叠随机纸张的学生。他们被告知:“这里有五份关于这位科学家的文档;请写出一个答案。”这个学生必须阅读这些杂乱、无序的纸张,尝试在脑海中把这些点连接起来,并祈祷自己不会凭空捏造(这被称为“幻觉”问题)。如果这些纸张相互矛盾或者难以理解,学生就会感到困惑,并给出错误或不确定的答案。
新解决方案:RAS(检索与结构化)
这篇论文介绍了一种名为 RAS 的新框架。请不要把 RAS 看作是一个阅读一叠纸张的学生,而要把它看作是一个正在建立案卷的侦探。
以下是 RAS 如何运作的步骤,使用我们的侦探类比:
侦探的计划 (Planning):
与其只是随机抓取纸张,侦探首先会问:“我现在到底需要知道什么?”- 如果 AI 已经知道了答案,它就会停止并撰写报告。
- 如果它不知道,它会创建一个具体的、有针对性的问题(“子查询”)来寻找拼图缺失的部分。这就像是在说:“我知道他娶了谁,但我不知道他们的信仰是什么。让我们专门搜索他们的宗教观点。”
收集证据并进行整理 (Retrieval & Structuring):
侦探前往图书馆,找到能回答那个特定问题的具体页面,然后做了一件至关重要的事情:他们不仅仅是阅读页面,而是将事实转化为一张地图。- RAS 不再将信息保留为冗长、混乱的段落,而是将信息分解为简单、清晰的事实:主体(玛丽·居里) -> 关系(信仰) -> 客体(不可知论)。
- 他们将这些事实画在一块白板上(“知识图谱”)。如果它稍后发现了新的事实,它会将该事实添加到地图中,将其与之前的已知事实连接起来。这创造了一个针对这个特定谜团的、不断增长且有组织的真相网络。
破案 (Answering):
最后,侦探观察完成后的地图。因为信息组织得逻辑清晰且明确,AI 可以看到全貌而不会迷失在噪音中。它仅根据地图上清晰的连接关系来撰写最终答案。
为什么这更好?
- 不再有“脑雾”: 旧的方法强迫 AI 去猜测事实是如何连接的。RAS 则显式地构建这些连接,就像画线在地图上一样。
- 不再浪费时间: 它不会阅读整个图书馆。它只寻找它需要的东西,然后进行组织。
- 更少的错误: 通过将杂乱的文本转化为结构化的事实,AI 就不太容易凭空捏造。
结果
作者在七种不同类型的困难知识任务(例如回答复杂的科学问题或编写长篇、详细的解释)上测试了这个“侦探”。
- 当使用开源 AI 模型时,RAS 将准确率提高了约 7%。
- 当使用强大的、付费的(专有)AI 模型时,准确率提高了约 8.7%。
底线
RAS 改变了 AI 处理知识的方式。它不再淹没在无序文本的海洋中,而是作为一个聪明的组织者,为被问到的每一个问题构建一张定制的、基于事实的地图。这使得 AI 更聪明、更准确,并且在处理复杂问题时的推理能力更强。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。