← 最新论文
🤖 AI

Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation

本文提出了一种将指令条件探索(Instruction-Conditioned Exploration, ICE)与非对称强化学习及自蒸馏目标相结合的方法,以增强大语言模型的探索能力并将多样化行为迁移至测试时策略,从而在数学推理任务中实现了显著的性能提升。

原作者: Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jim Dilkes, Vahid Yazdanpanah, Sebastian Stein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人如何解开一个棘手的谜题。你有一个强大的工具叫做“强化学习”(Reinforcement Learning,简称 RL),它就像是一个电子游戏的教练。机器人尝试一个动作,然后得到一个“做得好!”或“再试一次”的信号,并逐渐学会如何获胜。但问题在于,在大型语言模型(LLM)的世界里——也就是那些编写文本和解决数学问题的 AI 大脑——它们的“动作”并不是像“跳跃”或“射击”这样简单的按键,而是单词。而且,它们有成千上万个单词可以从中选择。

如果你只是告诉机器人“随机尝试”,它通常只会产生胡言乱语。随机更换句子中的一个词,就像试图通过乱扔零件来修理汽车引擎一样;这很难奏效。因此,机器人往往会陷入它已经掌握的少数几种做法中,从而错失了更聪明的新方法。科学家们面临的大问题是:我们如何让这些 AI 大脑在不产生废话的前提下,去探索新的多样化的思考方式?这篇论文正是针对这个问题展开研究的,它提出了一种巧妙的方法,强迫机器人在学习过程中尝试不同的“策略”,并在提示消失后,教会它如何使用这些策略。


“秘密指令”策略

研究人员,来自南安普顿大学的 Jim Dilkes 及其团队,发明了一种他们称之为**指令调节探索(Instruction-Conditioned Exploration,简称 ICE)**的方法。你可以这样理解:想象你在训练一名国际象棋选手。你不是只说“下一局”,而是为他们练习的每一局比赛都给出一个不同的“秘密指令”。其中一张纸可能写着,“今天,只专注于进攻国王侧”;而另一张则写着,“不惜一切代价保卫你的兵”。

在论文的方法中,他们拿出一个数学题,并为其附带一个或多个不同的“行为指令”。这些不是答案,而是一些引导性的提示,比如“寻找这个问题的对称性”或者“尝试将其分解为更小的部分”。通过强迫 AI 在戴着这些不同的“帽子”时生成答案,该模型能够比自主探索时探索出更广泛的解决方案。这就像是强迫一名学生用五种不同的方法来解决同一个数学题,以此观察哪种方法最有效。

老师与学生

这里是见证奇迹的地方。AI 模型实际上同时扮演着两个角色:老师(Teacher)学生(Student)

  1. 老师: 这个版本的 AI 会获得“秘密指令”(即指令)。它尝试利用这些提示来解决问题。当它得到一个非常好的答案时,它会获得奖励。
  2. 学生: 这个版本的 AI 是我们稍后真正想要使用的那个。它永远不会看到这些指令。它看到的只是原始的数学题。

团队使用了一种特殊的训练技巧,叫做非对称强化学习/学生蒸馏(Asymmetric-RL/SD)。这有点像一位名厨使用一种秘密调料组合来烹饪美味佳肴。学生(即 Student)观察厨师烹饪的过程,品尝最终的成品,并试图学习如何烹饪,以便在仅使用基础食材、没有秘密调料的情况下,也能重现那种美味。

研究人员发现,通过让“老师”利用提示进行探索,并将这些知识“蒸馏”(转移)给“学生”,使“学生”在独立解决问题时变得更加出色。

他们的发现

团队在名为 Qwen3-1.7B(一种可以在笔记本电脑和手机上运行的“小型”模型)的特定 AI 模型上测试了这一方法,用于解决数学问题。他们将这种新方法与一种标准的训练技术——DAPO 进行了对比。

  • 结果: 当模型使用他们的“秘密指令”方法(ICE)和“老师到学生”的转移技术(Asymmetric-RL/SD)进行训练时,它在第一次尝试时正确解决数学问题的能力比标准方法提高了 5.0%
  • 证明: 这并非偶然。他们使用不同的随机种子(就像掷了五次骰子)进行了五次实验,而他们的方法在全部 5 次实验中都获胜了。这种提升非常稳定,足以让研究人员确信这是一个真实的效果,而非仅仅是运气。
  • 长期表现: 他们还测试了更长的回答(8K 上下文长度),模型依然有所提升,尽管提升幅度略小。

然而,这也存在极限。当他们在一个更大的模型(4B 参数)上尝试时,该方法并没有比标准训练法带来更好的结果。这表明,这种“指令”技巧最适合那些正处于能够解决问题边缘的小型模型,能帮助它们达到单打独斗无法达到的新高度。

为什么这很重要

最酷的部分在于,一旦训练完成,你就不再需要那些指令了。经过训练的“学生”模型已经准备就绪,可以独立解决数学问题,无需任何额外的指令。这意味着你可以在手机或笔记本电脑上获得一个更聪明、更强大的 AI,而不需要随身携带一大堆提示清单。这是一种方法,通过在“求学阶段”教 AI 变得更有创意和周全,使其在余生的学习中成为一个更好的问题解决者。

研究人员承认,他们仍在弄清楚这种方法的边界在哪里,因为在他们测试的大型模型上,该方法并未奏效。但对于那些驱动我们日常设备的、较小的日常 AI 模型来说,这种“指令调节探索”看起来是一个帮助它们打破常规思维、实现跨越式发展的极具前景的新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →