OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning
OPDSearch+ 是一个新颖的两阶段框架,它通过首先通过在策略学习(on-policy learning)从冻结的现成教师模型中蒸馏技能,随后利用强化学习对学生模型进行精炼,使小语言模型能够擅长搜索增强推理,从而克服了先前方法在数据收集成本和性能上限方面的限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界里,研究人员正不断尝试教计算机程序像人类一样思考,尤其是在面对浩如烟海的信息寻找答案时。多年来,标准的方法是训练那些记忆事实的庞大且昂贵的模型,但这些系统在需要查找新信息或跨不同主题建立联系时往往表现挣扎。一条更有前景的路径涉及“搜索增强推理”,即让模型学习如何提出问题、阅读找到的答案,然后综合出最终的回答。然而,教导更小、更高效的模型完成这项任务一直是一个棘手的难题。通常的方法需要一个已经是搜索专家的“教师”模型,但为每一个特定任务都训练这样一个教师模型的成本极高且速度极慢。此外,仅仅复制教师的答案往往会失败,因为学生模型容易陷入自身错误的循环,无法从实时搜索引擎的动态特性中学习。
一个研究团队推出了一种名为 OPDSearch+ 的新方法,通过改变学生的学习方式解决了这些问题。他们不再依赖一个经过特定任务专门训练的教师,而是使用一个强大的、预先存在的且保持“冻结”状态(即在过程中不发生变化)的模型。这个教师的作用不是给出最终答案,而是通过观察学生与实时搜索引擎的交互来进行引导。当学生提出问题并阅读结果时,教师会对学生生成的每一个词提供即时的、逐步的反馈。这种反馈帮助学生不仅理解什么是正确答案,还理解如何分解复杂问题、如何组织搜索查询语句,以及如何将找到的信息编织成逻辑严密的论证。
这一过程分为两个截然不同的阶段。首先,学生模型在积极搜索信息的同时,从教师的指导中学习。这个阶段至关重要,因为它教会了学生良好的研究习惯——如何分解问题以及如何整合证据——而在此过程中,学生甚至不需要看到教师自己的搜索历史。研究人员发现,这种初始训练重塑了学生的行为,比从零开始构建了一个更强大的基础。在第二阶段,学生通过一种奖励其获得正确最终答案的技术进行精炼。由于学生在第一阶段已经拥有了如此强大的基础,它能够学得更快,并达到其自身永远无法达到的性能水平。
该方法的结果令人瞩目。在七个不同的问答基准测试中,这种新方法让一个仅有 30 亿参数的相对较小的模型,表现优于以往所有同规模的模型。在需要连接多条信息的复杂任务上,提升尤为显著:该模型在一个主要测试中准确率提升了 13 个百分点,在另一个测试中提升了 8 个百分点。研究人员证明,这种方法不仅仅是一个微小的改进,而是关于如何教导小模型利用搜索工具进行推理的一种根本性的转变。通过使用一个冻结的、现成的教师来引导学生进行实时交互,他们创造了一个既高效又极其有效的系统,证明了小模型无需昂贵的特定任务训练,也能学会深度思考和明智搜索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。