Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
Search-E1 是一种自我演化方法,它仅利用标准 GRPO 和离线自蒸馏来增强搜索增强型推理智能体,从而在不依赖复杂外部监督或辅助模块的情况下,在问答基准测试中实现最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明但略显笨拙的学生(即人工智能),他正试图回答棘手的 trivia 问题。为了得到正确答案,这个学生被允许使用图书馆(即搜索引擎)来查找事实,但他必须决定何时查阅以及询问什么。
目前大多数方法教导这个学生的方式是:等到他完成整篇论文后再进行评判。如果最终答案正确,老师会给予一颗金星;如果错误,则打上一个红叉。问题在于:学生并不知道具体哪一步出了错。是他们问了错误的问题?还是读错了段落?亦或是分心了?他们只知道整个尝试失败了。
Search-E1 是一种教导这个学生的全新、更简单的方法。它不需要超级聪明的人类教师、一个花哨的额外机器人,或特殊的奖励系统。相反,它通过一个两步舞,采用了一种称为**“自我进化”**(Self-Evolution)的技术:
第一步:“尝试一切”阶段(GRPO)
首先,学生被要求对同一个问题尝试五次。
- 在一种尝试中,他们可能会在图书馆里漫无目的地游荡,问些愚蠢的问题,然后失败。
- 在另一种尝试中,他们可能会提出完美的问题,找到正确的书籍,并迅速得出正确答案。
系统会审视这五次尝试,并说:“好吧,那个得出正确答案的尝试就是本轮的‘黄金标准’。”但是,和之前一样,这只能告诉学生“整篇论文做得不错”,而无法指出“问那个特定问题做得很好”。
第二步:“回放并学习”阶段(离线自我蒸馏)
魔法就在这里发生。系统选取失败的尝试(即“学生”)和成功的尝试(即“教师”)。
这里有一个巧妙的技巧:
- 系统给学生原始问题。
- 系统给教师相同的问题,但同时递给他们一份作弊条:学生在另一次尝试中走过的完整成功路径。
- 教师阅读作弊条,然后说:“如果我现在回答这个问题,并且知道正确的路径,我接下来会确切地说出以下内容。”
- 随后,学生被迫聆听教师,并尝试一步步地模仿他们的措辞。
学生不仅仅被告知“你答对了/答错了”。他们被逐词(token-by-token)展示如何更好地思考。“哦,我明白了!当我问‘总统是谁?’时,教师问的是'1990 年的总统是谁?’这就是区别!”
为什么这很特别?
- 无需外部教师:通常,要获得这种级别的细节,你需要一个超级智能的 AI(例如一个 720 亿参数的模型)来评估每一个步骤。Search-E1 则利用学生自己的成功尝试作为教师。这就像学生在考完试拿到 A 后,自己研读试卷,而不是等待教授来评分。
- 无需额外机制:其他方法会添加复杂的工具来找出哪些步骤是好的。Search-E1 仅使用标准的“尝试与重试”循环,并在其中插入这个“研习自身成功”的步骤。
- 结果:当他们在七个不同的 trivia 挑战中测试这种方法时,使用 Search-E1 的学生比使用更复杂方法的其他学生取得了显著更高的分数。它特别擅长处理“多跳”问题(即需要连接多个线索的问题),因为这类问题有许多可能出错的步骤,而这种方法能修复那些具体出错的步骤。
简而言之:Search-E1 通过让学生经历失败,然后将其成功的尝试视为一本完美的教科书进行研习,从而教会 AI 变得更聪明。它让学生学习在每一个确切时刻该说什么,而无需任何外部帮助。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。