ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning
Extra 是一个兼容 GRPO 的框架,它通过结合用于多样化正确解的创新性奖励以及用于克服标准 RLVR 在简单和困难推理任务上局限性的熵引导前缀再生,增强了语言模型的强化学习,从而显著提高了准确率和推理时的覆盖率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明的学生(一个人工智能语言模型)如何解决困难的数学问题。你使用一种叫做**强化学习(Reinforcement Learning)**的方法,学生尝试解决一个问题,如果答对了,就得到一个“大拇指”;如果答错了,就得到一个“大拇指向下”。目标是帮助学生从这些“大拇指向上”和“大拇指向下”中学习,从而变得越来越好。
这篇论文介绍了一种新的教学方法,叫做 ExTra(探索性轨迹优化,Exploratory Trajectory Optimization)。它解决了在学生尝试从一组尝试中学习时会发生的两个特定问题。
ExTra 解决的两个问题
1. “太简单”的问题(无聊的课堂)
想象你给学生一个非常简单的数学题,比如 。
- 发生的情况: 学生尝试了 10 次,每一次他们都写下了“4”。
- 问题所在: 由于所有的答案都是相同的且正确的,老师(AI 系统)会感到困惑。由于尝试之间没有区别,无法从中学习。学生停止了尝试新的思考方式,只是重复同样的枯燥模式。他们陷入了“窠臼”,失去了创造性思考的能力。
- ExTra 的解决方法: 它增加了一个**“新颖性奖励”(Novelty Bonus)**。如果学生得到了正确答案(),但用了一种与之前不同的、独特的方式来解释它,他们会获得额外的分数。这鼓励学生在解决简单问题时尝试不同的风格,保持大脑活跃且多样化。
2. “太难”的问题(死胡同)
现在想象你给学生一个超级难的问题,比如一道复杂的奥林匹克数学题。
- 发生的情况: 学生尝试了 10 次,每一次他们都卡住了或者给出了错误的答案。
- 问题所在: 老师看到了 10 次失败,却不知道该怎么办。没有“大拇指向上”可以用来学习。通常情况下,系统会直接丢弃所有 10 次尝试,并从头开始,白白浪费了学生在卡住之前所做的所有工作。
- ExTra 的解决方法: ExTra 不会丢弃所有内容,而是扮演一个聪明的徒步向导的角色。
- 它观察学生失败的尝试,并问道:“他们在哪里差点就做对了?”
- 它利用一种特殊的信号,叫做熵(Entropy)(这就像是在衡量学生在每一步中的“困惑度”或“不确定性”)。它能找到学生最不困惑的那部分答案。
- 它保留这个特定的“接近正确”的部分,并说:“好吧,让我们保留这一部分,并尝试从这里完成剩下的题目。”
- 这保存了学生的进度,并引导他们从一个强大的起点开始探索新的路径,而不是从零开始。
它是如何协同工作的
把 ExTra 想象成一个同时做两件事的教练:
- 对于简单的任务: 他们告诉学生,“做得好!但下次尝试用一种完全不同的方式来解释,这样我们才能学到更多。”(这是新颖性奖励)。
- 对于困难的任务: 他们告诉学生,“你在这里卡住了,但在写到这一句之前你表现得非常好。让我们保留这一句,并尝试从这里完成这个谜题。”(这是基于熵引导的再生)。
结果
研究人员在六个不同的数学基准测试(如 AIME 和 MATH)上测试了它。他们将 ExTra 与标准方法(称为 GRPO)进行了比较。
- 更高的准确率: AI 在第一次尝试时得到了更多的正确答案。
- 更好的覆盖率: 如果你让 AI 尝试 16 次来解决一个问题,ExTra 更有可能在 16 次尝试中找到至少一个正确答案。这意味着 AI 不仅仅是在学习一种特定的思考方式,它还学会了更广泛、更多样化的解题方式。
- 高效性: 它在没有浪费额外计算时间或不需要人类对每一步进行评分的情况下,实现了这些结果。它仅仅通过观察 AI 自身的思考过程,就弄清楚了哪些部分是有效的。
简而言之,ExTra 教会了 AI 在面对简单情况时保持多样性,在面对困难挑战时保持韧性,确保它不会陷入重复的循环,也不会在面对挑战时轻易放弃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。