← 最新论文
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

本文提出了一种搜索驱动的强化学习框架,该框架通过自动化生成、验证及基于 GRPO 的筛选迭代优化奖励函数规范,证明与静态或随机奖励集成相比,基于排序反馈的循环显著提升了 GSM8K 上的数学推理性能。

原作者: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明的学生(一个大语言模型),他擅长交谈,但有时在数学方面会遇到困难。你想教他更好地解决数学问题。通常,你会聘请一位老师来批改他的作业。但在这篇论文中,作者提出了一个不同的问题:“如果我们不知道如何完美地批改作业怎么办?如果我们让 AI 帮助我们发明最佳的评分规则呢?”

以下是他们如何做到的故事,以简单的方式解释。

1. 问题:“评分标准”之谜

在 AI 世界中,要训练一个模型更好地思考,你会使用一种称为强化学习的系统。这就像训练一只狗。

  • :AI 模型。
  • 奖励:一个“奖励”(正向分数)。
  • 把戏:正确解决数学问题。

问题在于设计“奖励”(奖励函数)很难。如果你告诉 AI,“如果你得到正确答案,就做得好”,它可能会通过猜测或复制模式而不真正思考来作弊。如果你尝试奖励它采取的步骤,你就必须编写复杂的规则,而且很容易在这些规则中犯错。

2. 解决方案:“评分规则工厂”

作者构建了一个系统,将评分规则本身视为可优化的对象。他们不是手动编写规则,而是建立了一个工厂,让一个 AI(名为 Kimi K2 的“前沿”模型)充当规则发明者

以下是工厂逐步运作的方式:

  • 第 1 轮:规则发明者 AI 被给予 20 道数学题,并被要求写出 10 种新的评分方式。它将这些规则写成简单的计算机代码(就像食谱一样)。
  • 安全检查:在使用这些规则之前,它们会经过“安全扫描仪”,以确保它们没有危险或损坏。
  • 试驾:研究人员取一个小数学学生(一个 30 亿参数的 AI 模型),让它使用其中一条新规则练习解决问题一小段时间(500 步)。
  • 成绩单:他们观察学生在测试中的表现。如果新规则帮助学生提高了分数,该规则就会获得高排名。如果规则让学生感到困惑,它就会获得低排名。
  • 反馈循环:表现最好的规则会被总结并反馈给规则发明者 AI。AI 会被告知:“嘿,计算思考步骤数量的规则效果很好。只关注最终答案的规则效果较差。试着基于此发明新规则。”

他们重复了这个循环5 次,生成了50 个不同的候选规则

3. 结果:发现“黄金规则”

经过 5 轮后,他们找到了一些优胜者。

  • 最佳单一规则:一个名为 thinking_steps_count 的规则是冠军。如果 AI 至少在三个不同的行中写出其思考过程,它就会获得额外分数。它不检查答案是否正确(基础系统会做这件事);它只是鼓励 AI 展示其解题过程
  • 团队合作的力量(集成):他们意识到一条规则是不够的。因此,他们选取了最好的 5 条规则,并将它们组合成一个“超级评分团队”。
    • 结果:这个规则团队帮助 AI 的成功率从(仅使用基本规则的)60%跃升至79.5%
    • “魔法”检查:为了证明这不仅仅是运气或规则数量的原因,他们尝试从堆中随机挑选 5 条规则组成一个“随机团队”。那个随机团队崩溃了,AI 几乎在所有事情上都失败了。这证明了反馈循环(学习哪些规则有效并将这些反馈给发明者)是秘诀,而不仅仅是拥有更多规则。

4. AI 作弊了吗?(“奖励黑客”审计)

人们普遍担心,如果你告诉 AI“给我更多思考行”,它可能会用废话填满页面以获取分数。

  • 审计:作者检查了 AI 的答案。他们发现,当 AI 答时,它实际上比答时写了更多行,并使用了更多数学符号。
  • 结论:AI 并没有通过填充空白空间来作弊;它确实在更努力地思考,因为规则鼓励它这样做。

5. 为什么这很重要

  • 易于获取:你不需要超级计算机。他们在大约 40 小时内,在一块高端消费级显卡(就像游戏玩家使用的那种)上运行了整个实验。
  • 自动化:与其让人类专家花费数周时间猜测完美的评分标准是什么样子,不如让该系统自动化地发现这些规则。
  • 透明:规则不是黑盒;它们是简单的 Python 代码,人类可以阅读、理解并调整。

简而言之:这篇论文表明,如果你让 AI 帮助你为另一个 AI 设计评分系统,并根据学生的表现不断细化这些规则,你就可以教会学生比仅仅给它一套静态的、人类编写的规则更好地思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →