← 最新论文
💬 NLP

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

本文介绍了 GTA-RAG,这是一个图-轨迹增强的强化学习框架,它通过从实体-文档图中合成可执行的多跳问答轨迹来提供稠密的、轨迹级的监督,从而与现有的基于强化学习的基准模型相比,显著提高了多轮检索增强推理中的证据链覆盖率和答案准确性。

原作者: Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在浩瀚的人类知识数字图书馆中,大型语言模型已成为寻找答案的强大工具。这些系统通过海量文本训练而成,能够针对几乎任何问题生成流畅的回答。然而,当一个问题需要从不同地方拼凑事实时——例如通过一系列中间细节将特定地点与一个人的传记联系起来——它们有时会显得力不从心。为了解决这个问题,研究人员开发了一种称为检索增强生成(retrieval-augmented generation)的方法。这种方法允许模型暂停思考,搜索数据库以获取相关文档,并利用这些新鲜的事实来构建答案。这就像是给学生一本可以查阅的教科书来应对考试,而不是仅仅依靠记忆。

挑战在于,当答案需要多个步骤时。简单的搜索可能会找到提到某个名字的文档,但未必能找到解决谜题所需的特定事实。模型必须随后提出一个后续问题,找到另一个文档,并将两者联系起来。近期,教计算机进行这种多步搜索的尝试主要依赖于一种训练方法,即仅在计算机得出正确最终答案时给予奖励。这产生了一个隐藏的问题:计算机可能会通过运气或利用其已知的事实猜中正确答案,而从未真正找到证明该答案为真的特定文档。它学会了绕过预定的过程,而不是学习材料本身。

一组研究人员引入了一个名为 GTA-RAG 的新框架来解决这一问题。他们没有等待看到最终答案是否正确,而是设计了一个系统,会对计算机在寻找过程中发现正确证据的行为给予奖励。他们构建了一个知识库地图,将文档与其内部提到的人物、地点和事物连接起来。通过这张地图,他们创建了数千个练习题,其中通往答案的路径是清晰定义的。然后,他们训练计算机遵循这些路径,每当它成功检索到新的拼图碎片时,都会给予奖励。这种方法确保了计算机学会去搜寻所需的特定文档,而不是仅仅猜测最终结果。

研究人员在各种需要将多个事实联系起来的难题上测试了这种方法。他们将这个新系统与使用旧有的“仅针对答案”奖励系统的其他先进方法进行了对比。结果显示出明显的差异。使用新方法时,计算机在寻找支持答案所需的完整证据链方面表现得显著更好。在涉及复杂多步问题的测试中,该系统在定位正确文档的能力上有了大幅提升,其证据覆盖率达到了 82% 以上,而旧方法约为 68%。

至关重要的是,研究发现这种进步并非来自于计算机增加了搜索尝试或在死胡同中浪费时间。事实上,新系统通常能以更少的搜索次数找到正确信息。它学会了变得更加精准,知道在每一步应该寻找哪个文档。研究人员还验证了计算机并未仅仅死记硬背练习题。当测试全新的、未见过的题目时,它依然表现出色,这证明它确实学会了搜集证据的技能。即使在计算机规模较小时,该系统依然运作良好,这表明训练方法比背后的“大脑”规模更为重要。

最重要的发现之一是,该系统停止了走捷径的行为。在之前的训练方法中,即使计算机忽略了最重要的文档,只要它猜对了,有时也能得出正确答案。而新的训练方法使得如果不检索完整的证据链,就无法获得高分。研究人员观察到,计算机变得更加忠实于事实,确保每一个答案都有其找到的文档作为支撑。这种从“猜测”向“基于证据的推理”的转变,是迈向需要可靠性和准确性的人工智能的重要一步。

该方法的成功依赖于一种特定类型的地图,这种地图将文档与其包含的实体相连。研究人员通过阅读他们的文本集并提取事实(例如“托马斯·杰斐逊居住在蒙蒂塞洛”)来构建这张地图。然后,他们利用这张地图生成了答案取决于沿着文档特定路径进行的练习题。在利用这些练习题训练计算机之前,他们运行了一项检查,以确保计算机确实能够找到它应该找到的文档。如果计算机在检查过程中未能定位到文档,该练习题就会被丢弃。这一验证步骤确保了训练是基于现实且可实现的任务。

研究人员在五组不同的问题集上测试了他们的系统,涵盖了从简单的实事查询到需要三步或更多推理步骤的复杂谜题。在简单问题上,新系统的表现与现有的最佳方法持平。然而,在复杂的、多步跳转的问题上,它显著超越了其他方法。例如,在以困难的多跳问题著称的 HotpotQA 数据集上,新系统取得了 52.9 的得分,以明显优势击败了之前的最佳强化学习(RL)方法。当系统在其他复杂数据集上进行测试时,这一差距进一步扩大,证明了这种改进在不同类型的难题中都是一致的。

研究还观察了移除其新系统中特定部分后会发生什么情况。当他们停止对寻找过程中的证据给予奖励,而仅对最终答案给予奖励时,系统寻找完整文档链的能力大幅下降。这证实了新的奖励系统是提升性能的关键驱动力。同样,当他们移除检查文档是否可检索的步骤时,系统的表现也出现了下滑,这表明验证过程对于创建高质量训练数据至关重要。这些测试证明,整个框架协同工作,创造了一个更有效的学习者。

这项工作表明,我们如何教计算机搜索信息,与信息本身一样重要。通过提供清晰的、关于如何寻找证据的逐步指导,而非仅仅评判最终结果,研究人员可以训练模型变得更加可靠和准确。该系统并不依赖于计算机拥有庞大的内部知识;相反,它教会了计算机如何有效地使用外部工具。这对于那些对准确性要求极高的应用场景尤为重要,例如医疗诊断或法律研究,因为在这些领域,错误的猜测可能会带来严重后果。

研究人员承认,他们的方法取决于所构建地图的质量。如果地图不完整或包含错误,计算机可能无法学习正确的路径。他们还指出,他们的实验侧重于开放域问题,目前尚不清楚这种方法在更专业的领域或处理不同类型的数据时表现如何。然而,目前的成果是令人鼓舞的,表明结构化的训练方法可以显著提高人工智能处理复杂推理任务的能力。

最后,这项研究证明,教计算机像研究员一样思考是可能的。通过奖励收集证据的过程,而非仅仅是最终结论,系统学会了严谨与精准。它停止了猜测,开始进行验证。这种转变代表着向更值得信赖的人工智能迈进,即构建在坚实事实基础之上,而非仅仅基于概率的智能。研究人员已公开了他们的代码,允许他人基于此项工作进行改进,并进一步完善机器与世界知识交互的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →