← 最新论文
💬 NLP

EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

EviSD 是一个证据条件的自蒸馏框架,它通过利用实例级证据和标准答案作为特权信息来优化训练过程中的动作级信用分配,从而增强搜索增强型语言智能体,在不改变推理时行为的情况下,在多个基准测试中实现了卓越的性能。

原作者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一名侦探。在人工智能的世界里,这种机器人被称为“搜索增强智能体”(search-augmented agent)。它的任务是通过思考、在互联网上搜寻线索、再次思考、再次搜索,直到最终找到答案来解决棘手的难题。为了让它变得更好,我们使用了一种叫做“强化学习”的训练方法。把它想象成一种电子游戏,只有在游戏结束时,机器人才会得到一个“赢”或“输”的信号。如果它破解了谜团,它会获得高分;如果失败了,它就会得到零分。

这种“赢或输”的方法存在一个问题:这有点像只看学生的期末考试成绩,而不看他们的平时作业。如果机器人得到了正确答案,我们知道整个过程都是优秀的,但我们不知道究竟是哪一次搜索非常精彩,又是哪一次搜索是在浪费时间。是因为第一次搜索找到了黄金线索?还是机器人只是在最后一次猜测时运气好?因为机器人无法区分这两者,它可能会不断进行糟糕的搜索,只为最终能撞大运赢一次。本文解决了侦探旅程中混乱的中段部分,试图教会机器人分辨哪些动作是有帮助的,哪些是干扰项,从而让它成为一名更聪明、更高效的调查员。

由此诞生了 EviSD,这是一个聪明的全新训练技巧,它充当了机器人的“特权教练”。研究人员发现,在机器人学习的过程中,它其实可以接触到一份“参考表”,但在实际工作时它是没有这份表的。这份参考表包含了“标准答案”(正确的解决方案)和“支持性证据”(证明答案正确的特定文本段落)。

以下是 EviSD 的工作原理,我们用一个有趣的类比来解释:想象机器人是一个正在考试的学生。

  1. 学生(机器人): 学生仅利用他们当时掌握的信息参加考试。他们写下自己的搜索查询语句和最终答案。
  2. 教练(老师): 在学生完成后,同一个机器人模型会戴上“教练帽”。教练会查看学生的答案,但被允许偷看那份包含证据和正确答案的参考表。
  3. 反馈循环: 教练会将学生写下的内容与他们应该写下的内容进行对比,同时已知那些秘密线索。
    • 如果学生提出了一个能找到证据的绝佳搜索问题,教练会给予点赞。
    • 如果学生提出的问题很模糊,无法提供帮助,教练会温柔地提醒他们下次要改进。
    • 至关重要的是,教练不仅仅是说“你对了”或“你错了”。他们会说:“你搜索‘X’的行为很棒,因为它与证据相符;但你搜索‘Y’的行为是个死胡同。”

EviSD 的魔力在于,它利用这种“教练的反馈”来微调机器人的大脑,且仅针对机器人做出动作的具体部分(即搜索查询和最终答案)。它不会试图重写机器人的整个性格,也不会强迫它去背诵参考表。相反,它更像是一个音量调节旋钮。如果机器人的原始训练说“这次搜索很好”,那么如果证据支持这一点,教练就会把这个音量调得更高;如果原始训练不确定,教练会帮助澄清;但如果机器人最终答错了,教练不会假装那个搜索是完美的——“赢或输”的得分依然是最重要的。

研究人员在七个不同的问答挑战上测试了这种方法,范围从简单的常识题到复杂的步骤推理谜题。他们发现 EviSD 始终优于其他顶尖方法。事实上,与现有的最佳技术相比,它将机器人的准确率提高了约 1.3 到 2.3 个百分点。或许更令人印象深刻的是,机器人学会了变得更高效,寻找答案所需的搜索次数也减少了(从平均 2.27 次降至 1.87 次)。

本文指出,这种方法是一个重要的进步,因为它解决了“信用分配”(credit assignment)问题——即弄清楚哪些具体行动导致了成功——同时又不会改变机器人在现实世界中的行为方式。当机器人外出解决实际问题时,它并没有参考表,但这没关系;它只需运用在训练期间学到的更聪明的习惯即可。这项研究表明,通过给机器人一个利用“特权视角”进行反思的机会,我们可以教会它成为一名更敏锐的侦探,从而能够区分出是运气使然的猜测,还是经过周密计划的调查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →