← 最新论文
💬 NLP

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

本文介绍了 EviPath,这是一个通过将“问题-答案-证据”三元组合成为可执行的智能体-环境交互轨迹的溯因推理框架,旨在解决检索增强生成(RAG)智能体开发中的数据稀缺问题,使小模型能够在开放域问答任务中达到最先进的性能。

原作者: Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何破解谜题。你给它一个问题,比如“谁是第一个登上月球的人?”,并给它一堆书来阅读。在人工智能的世界里,这被称为检索增强生成(Retrieval-Augmented Generation,简称 RAG)。机器人必须找到书中的正确页面(检索),然后写出答案(生成)。但棘手的地方在于:我们知道最终答案是“尼尔·阿姆斯特朗”,但我们并没有关于人类是如何一步步推导出这个答案的“日记”。我们没有一张地图来告诉机器人应该先打开哪本书、阅读哪一句话,以及如何将这些线索联系起来。

没有这张地图,机器人只能靠猜。它可能会尝试读一本关于太空的书,然后是一本关于篮球的书,接着是一本关于月球的书,希望自己能偶然撞上正确的答案。这就像是通过玩数百万场国际象棋来学习下棋,并寄希望于通过赢下几局来最终摸索出规则。这种方式既缓慢、昂贵,而且如果机器人本身并不擅长猜测,往往会失败。科学家们曾尝试通过让机器人“大声思考”(思维链,Chain-of-Thought)来解决这个问题,但通常,这些想法只是事后补写的静态解释,而不是一个真正的、互动的寻找信息的过程地图。所以,大问题在于:我们如何教会机器人成为一名侦探,而不是强迫它在整个过程中盲目猜测?


从证据到轨迹:侦探指南

本文介绍了一种巧妙的新方法,称为 EviPath(基于证据锚定的推理路径合成)。把 EviPath 想象成一个针对机器人侦探的“逆向工程”工具。EviPath 不是要求机器人通过猜测来寻找答案,而是从答案和证据开始,反向推导出机器人应该采取的完美路径。

作者称之为溯因推理(abductive reasoning)。在日常生活中,想象你走进一个房间,看到一个破碎的花瓶在地板上,旁边坐着一只看起来一脸愧疚的猫。你不能确定到底发生了什么,但你可以推断出最可能的故事:“猫撞倒了花瓶。”EviPath 对问题也做同样的事情。它观察最终答案和“黄金”证据(证明答案正确的特定事实),然后询问:“一个聪明的侦探为了从问题得到这个答案,需要采取哪些步骤?”

三阶段侦探训练法

该论文提出了一种三阶段训练过程,用以构建这些完美的侦探地图:

  1. 溯因子任务规划(幕后黑手):
    首先,系统查看一个复杂的问题和最终答案。它将这个大谜题分解成更小、更易处理的线索。例如,如果问题是“哪部电影的导演出生更早?”,系统不会仅仅进行猜测。它会制定计划:“第一,找到电影 A 的导演。第二,找到电影 B 的导演。第三,找到他们的出生日期。第四,比较他们。”这创建了一个“黄金计划”,明确告诉机器人要分步搜索什么。

  2. 忠实子问题回答(外勤特工):
    接下来,系统模拟机器人实际执行工作的过程。它获取这些小的子问题,并使用“黄金证据”作为一个安全的局部图书馆。它生成一段思维链,就像外勤特工在自言自语一样:“我需要找到《Ek Paheli》的导演。查看证据,我看到了 Naresh Kumar。现在我需要他的出生日期……”这一部分至关重要,因为它教会机器人如何利用证据来形成想法,而不是凭空捏造(幻觉)或迷失方向。

  3. 对话式微调(角色扮演):
    最后,所有这些完美的步骤都被转化为用户与助手之间的对话。机器人接受这种对话的训练,学习像它刚刚观察到的侦探那样行动。它学会说:“我需要搜索 X,”然后说“我找到了 Y”,最后说“因此,答案是 Z。”

为什么这比旧方法更好

论文指出,过去训练这些机器人的方式——使用强化学习(Reinforcement Learning, RL)——就像是在黑暗中对着靶盘投掷飞镖。你希望机器人最终能获得奖励(正确答案),但如果机器人本身规模较小或不够聪明,它可能永远拿不到奖励,从而直接放弃。这被称为“冷启动”问题。

EviPath 通过提供一条清晰、密集的解决方案地图解决了这个问题。作者在三个主要的问答数据集(HotpotQA、MuSiQue 和 2WikiMultihopQA)上测试了该方法。他们使用这些合成数据训练了一个拥有 80 亿参数的模型(一个中等规模的“大脑”)。

结果令人印象深刻。使用 EviPath 训练的模型表现优于几乎所有其他方法,包括那些使用更大模型或复杂强化学习的方法。在开放域问答中,它在精确匹配(Exact Match)得分上实现了 14.7% 的绝对增益(衡量答案是否完全正确的指标)。这意味着机器人不仅仅是运气好,而是学会了更好的思考方式。

本文排除了哪些可能性

值得注意的是,这种方法并非做所有事情。论文明确排除了“你不需要一个庞大的、超智能模型作为起点”的想法。他们展示了即使是较小的模型(如 10 亿或 30 亿参数的模型),在接受了这些高质量路径的训练后,也能成为优秀的侦探。他们还反对“静态”解释(仅仅阅读一段长篇推理)就足够的观点;机器人需要学习搜索和规划的交互式过程。

此外,论文指出,主要的瓶颈不在于机器人的“大脑”大小或学习算法的复杂度,而在于训练数据的质量。如果你给机器人一张清晰的地图(EviPath),它可以解决复杂的谜题。如果你只是让它在黑暗中徘徊(标准的 RL),它往往会失败。

核心结论

EviPath 是一种教 AI 智能体成为侦探的新方法。它不是强迫它们去猜测和碰运气,而是从答案反向推导回问题。通过这样做,它创建了一个包含 26.5 万个“黄金”侦探故事的海量库。结果呢?规模较小、成本较低的 AI 模型突然能够以更高的准确率解决复杂的、多步骤的问题,这证明了有时,教机器人的最好方式就是向它展示人类是如何一步步解开谜题的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →