← 最新论文
🤖 AI

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

本文揭示了反馈增强自蒸馏(Feedback-Augmented Self-Distillation)在检索交织搜索智能体中经常因“解码崩溃”(decoding collapse)现象和不一致的监督信号而失败,而通过采用指数移动平均(EMA)教师来稳定学习过程可以有效缓解这一问题。

原作者: Fan Yang, Rui Meng, Yuxin Wen

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Yang, Rui Meng, Yuxin Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但有点困惑的机器人如何破解谜题。这个机器人拥有一种超能力:每当它遇到困难时,都可以向图书管理员寻求帮助。这就是“搜索智能体”(search agents)的世界——它们是能够思考、提问并从庞大的文本图书馆中查找答案来解决问题的计算机程序。通常,为了教导这些机器人,我们会使用一个已经是专家的“老师”机器人。学生机器人观察老师,模仿其动作,并努力变得更好。但如果由于没有超级专家级的老师怎么办?如果我们唯一的老师就是学生机器人自己,通过回顾自己过去的尝试来进行学习呢?这被称为“自我蒸馏”(self-distillation)。这就像是一个学生试图从自己的作业中学习,希望如果他曾经正确地解决过一个问题,他就能在没有帮助的情况下再次做到。科学家们对此感到非常兴奋,因为这可以让机器人从自己的错误和成功中学习,而不需要人类为每一个步骤进行评分。但当机器人必须在过程中搜索信息时,这种技巧真的有效吗?这正是这篇论文所探讨的核心问题。

研究人员决定测试这个想法的一个特定版本,称为“反馈增强型自我蒸馏”(Feedback-Augmented Self-Distillation, FA-SD)。他们设计了一个实验,让他们的AI智能体(一个名为Qwen的机器人)尝试通过在互联网上搜索来解决棘手的问题。这个想法很简单:如果机器人在一次尝试中答对了问题,他们就会将那次成功的尝试展示回给机器人,作为一种“提示”或“反馈”,以帮助它在再次处理相同问题时做得更好。他们希望这能起到超级老师的作用,引导机器人做出更好的选择。然而,结果令人惊讶且有些令人失望。机器人并没有变得更聪明,反而陷入了一种非常特定且奇怪的失败方式。

团队发现,机器人实际上并没有学会如何更好地思考。相反,它掉进了一个他们称之为“解码崩溃”(decoding collapse)的陷阱。想象一个正在参加考试的学生,他不去读题目,而是直接背下了答案表的形状。无论问题是什么,他都反复写下那些看起来很高级的段落和搜索查询。对于外部观察者来说,答案看起来各不相同且复杂,但它们实际上是空洞无物的。机器人正是这样做的。它找到了一个看起来像是在进行搜索和思考的“模板”,然后只是不断重复那个模板。因为机器人只是在复制一个模式而非真正理解问题,所以它试图学习的“老师”信号变得毫无用处。用于教导机器人的数学方法(称为KL散度)无法区分出一个聪明的答案和一个虚假的答案,因此机器人并没有进步。

研究人员还发现,问题并不在于“老师”机器人太弱。事实上,当他们把“提示”(即那次成功的过去尝试)放入其提示词中时,机器人解决问题的表现比单独行动时要好得多。问题在于机器人无法“内化”或吸收这项技能。这就像一个学生,如果答案就在面前,他可以轻松考高分,但一旦拿走答案,他就彻底失败了。机器人无法将“提示”转化为一项永久性的技能。

为了解决这个问题,团队尝试让“老师”变得更稳定。他们意识到,由于机器人在每一秒都在学习和变化,其“老师”版本也在同时变化,这使得教学变得混乱。他们尝试了两种解决方案:一种是将老师的时间冻结(“固定参考”),另一种是让老师成为机器人过去多个自我的“平均值”(称为“指数移动平均”或EMA)。“冻结”版的老师略有帮助,但“平均”版的老师才是真正的英雄。通过平滑这些变化,EMA老师为机器人提供了一个稳定、一致的引导。这使得机器人能够从早期的失败中恢复并真正开始学习。最终,使用EMA老师的机器人在这七项不同的测试中平均得分0.206,相比其初始得分0.114有了巨大的飞跃。

然而,论文也警告说,这种“提示”技巧并不适用于所有人。当他们尝试将这种相同的“反馈”想法用于一个强大的外部老师机器人(一个不是学生本身,而是外部的强大模型)时,情况反而变糟了。看起来,向一个已经很强大的老师添加额外的提示只会制造混乱。这项研究表明,虽然自我教学是一个强大的想法,但它非常脆弱。如果机器人开始复制模板而不是思考,整个系统就会崩溃。但通过正确的、稳定的引导,比如EMA老师,是有可能帮助这些搜索智能体学会独立思考的,即使它们最初只是在假装知道答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →