← 最新论文
🤖 machine learning

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

本文介绍了一种名为步级自蒸馏策略优化(SSPO)的新型框架,该框架通过利用网络提取的证据锚点(Evidence Anchors)和步级优势权重来增强信用分配,从而解决深度搜索智能体训练中的信息不对称问题,并在保持极低计算开销的同时超越了标准的 GRPO。

原作者: Haoze Wu, Chuqiao Kuang, Tianyi Zhuang, Xiaoguang Li

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoze Wu, Chuqiao Kuang, Tianyi Zhuang, Xiaoguang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一名名侦探。在人工智能的世界里,这个机器人被称为“智能体”(agent),它的工作是通过搜索互联网、阅读页面并连接线索来解决复杂的谜题。为了变得更优秀,机器人需要进行练习,但棘手的地方在于:通常老师只在案件结束时才给评分。如果机器人破解了谜团,它会得到一颗金星;如果失败了,则得零分。问题在于,解开谜团可能需要五十个步骤。机器人是因为最后一步没找对线索而失败的吗?还是因为在第三步时犯了一个微小的错误导致了一切崩盘?如果只有游戏结束时的得分,机器人就像是在盲目飞行,只能靠猜来判断哪些步骤是好的,哪些是坏的。这是让搜索智能体变得聪明的巨大障碍。

为了解决这个问题,科学家们尝试了一种叫做“自我蒸馏”(self-distillation)的技术。你可以把它想象成机器人试图向一个已经知道答案的“幽灵”版本的自己学习。幽灵(老师)看到了解决方案和线索,而真实的机器人(学生)必须从零开始摸索。其核心思想是让学生模仿老师的思考方式。然而,在混乱且开放的互联网世界中,这往往会适得其反。老师因为知道答案,会采取捷径在三步之内就解决案件。学生为了模仿老师,也会学会走捷径,跳过实际搜索的艰苦过程。这就像是一个学生在没看书的情况下直接抄袭老师的期末论文;他们记住了正确的词句,却没学到任何关于如何做研究的知识。

这篇论文介绍了一种训练这些侦探机器人的新方法,称为 SSPO(步级自我蒸馏策略优化)。SSPO 并没有让机器人简单地模仿老师的捷径,而是由作者创造了一个特殊的工具,叫做证据锚点(Evidence Anchors)。想象一下,这些就是老师留在桌面上的便签纸。它们不会直接给出最终答案,而是强调了调查过程中每一步所需的特定且关键的证据。例如,老师不会说“嫌疑人在巴黎”,而是一张便签可能会写着“检查周二的航班记录”。

神奇之处在于机器人如何从这些便签中学习。作者意识到,如果机器人已经在正确地解决案件,就不应该强迫它改变自己的风格。因此,SSPO 仅在机器人失败时才使用这种特殊的教学方法。当机器人失败时,系统会将机器人混乱的搜索路径与老师的“证据锚点”进行对比。如果机器人错过了老师所强调的关键证据,系统就会给那个特定的步骤更大的“惩罚”(更深刻的教训)。如果机器人绕了远路但仍然找到了有用的线索,系统则会宽容处理。

至关重要的是,论文表明这种方法不仅让机器人变得更聪明,还让它成为了一个更好的搜索者。机器人学会了提出精准、有针对性的问题来寻找正确的证据,而不是撒大网进行模糊的搜索。在三个不同的挑战性搜索基准测试(BrowseComp、GAIA 和 FRAMES)中,这种新方法帮助机器人学习得更快,表现得更好。事实上,用这种新方法训练了 100 步的机器人,表现优于用旧方法训练了 200 步的机器人。作者认为,通过关注每个搜索步骤的质量而非仅仅是最终成绩,我们可以构建出不仅仅是靠运气猜题,而是真正的、高效的调查员智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →