← 最新论文
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search 引入了一种在线策略的 hindsight 自蒸馏框架,使搜索增强型推理智能体能够通过训练一个学生模型去模仿基于 hindsight 条件的教师模型,从而在无需外部教师或额外标注的情况下,在内部生成步骤级别的监督信号,进而克服结果奖励强化学习中的信用分配局限性。

原作者: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生如何解决一个复杂的谜案。这名学生拥有一个图书馆(互联网)可供搜索,但他不知道该问图书管理员什么问题

在当前的 AI 研究中,大多数训练方法就像一位只根据最终答案给学生打分的老师。

  • 问题所在:如果学生答对了,老师会说:“干得漂亮!”但如果学生只是碰巧问了一个糟糕的问题却得到了幸运的答案,老师依然会说“干得漂亮!”学生永远无法意识到他们提出的具体问题实际上很糟糕。他们只知道结果是好的。这被称为“结果奖励”。
  • 旧有的解决方案:一些研究人员试图通过聘请一位超级聪明、昂贵的“大侦探”(一个庞大的外部 AI)来监视学生,并指出“那是一个好问题”或“那是一个坏问题”。这确实有效,但极其昂贵且缓慢,因为你需要为每一次训练会话都配备这位巨大的“大侦探”。

SD-Search 是一种新颖、巧妙的教学方法,无需依赖昂贵的“大侦探”。其工作原理如下,使用一个简单的类比:

“时间旅行”课堂

想象学生正在参加考试。

  1. 学生(“现在”的自我):学生坐在书桌前,看着题目。他必须决定此刻要搜索什么,完全不知道最终会答对还是答错。他是基于当下的所知进行猜测。
  2. 老师(“未来”的自我):现在,想象同一个学生,但这次他拥有一本魔法时间旅行笔记本。这本笔记本记录了针对同一问题的多次尝试结果。上面写着:“在尝试 A 中,我们问了‘父亲是谁?’并得到了正确答案。在尝试 B 中,我们问了‘天空是什么颜色的?’结果答错了。”

SD-Search 利用这本魔法笔记本来创建一个学生的“老师”版本。

  • 老师会看着题目阅读笔记本。因为老师知道哪些问题导致了成功,哪些问题导致了失败,他们可以说:“啊,我明白了,询问‘父亲是谁’是正确的做法。我当初就会问那个问题。”
  • 学生(此时还没有笔记本)随后被要求模仿老师的选择。目标是将学生的猜测与老师的“后见之明”智慧相匹配。

实际运作方式

论文将这种方法称为**“策略内后见之明自蒸馏”**。让我们拆解一下:

  • 自蒸馏:AI 在教自己。它不需要外部专家。它生成大量尝试(rollouts),查看结果,然后利用“成功”的模式来教导其自身的“学生”版本。
  • 后见之明:它在决策做出之后回顾发生了什么,以判断该决策是否良好。
  • 策略内:它使用自身当前的数据进行此操作,而不是依赖来自不同、更大 AI 的数据。

聚焦“搜索查询”

该论文特别关注搜索查询(AI 向搜索引擎提出的问题)。

  • 在旧方法中,如果最终答案正确,AI 写下的每一个字(包括搜索问题)都会获得“干得漂亮”的贴纸,即使搜索问题本身模糊或错误。
  • 在 SD-Search 中,AI 会针对每一个具体的搜索问题获得明确的“干得漂亮”或“干得不好”的信号。如果搜索问题导致了死胡同,拥有“时间旅行笔记本”的“老师”会向学生展示一个不同、更好的问题。学生学会模仿那个更好的问题。

结果(“记分牌”)

研究人员在七个不同的问答基准测试(类似于常识问答测试)上测试了这种方法。

  • 性能:他们的方法(SD-Search)表现与使用庞大 720 亿参数“大侦探”AI 的昂贵方法一样好,并且优于那些仅关注最终答案的方法。
  • 效率:他们无需任何外部帮助、无需昂贵的 API、也无需额外的训练阶段就完成了这一点。他们仅使用了标准的训练循环,增加了一个微小的“时间旅行”步骤,让 AI 回顾其自身的过往尝试。
  • 扩展性:随着 AI 模型变大(从 30 亿参数增加到 70 亿参数),这种自我教学方法持续变得更好,而依赖“大侦探”的方法则开始失去优势。

nutshell

SD-Search 就像一名学生在考完试后,能够查看答案键以及同时参加考试的朋友们的笔记。然后,他们重新参加考试,尝试提出那些“成功”版本的自己曾经问过的问题。他们从自己的过往错误和成功中学习,变得更为聪明,而无需人类教师或超级计算机来告诉他们该做什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →