← 最新论文
🤖 machine learning

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics 引入了一种协同进化强化学习框架,其中策略模型与评分准则生成器通过实时对抗进行相互适应,从而克服了静态标准的局限性,提供动态且具判别性的奖励,以实现自监督学习和自动课程生成。

原作者: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人厨师如何烹饪完美的佳肴。

旧方法:静态食谱书

在过去,研究人员会给机器人一本固定的食谱书(称为“静态评估标准/static rubric”)来评判其烹饪水平。

  • 问题所在: 起初,机器人是个糟糕的厨师。食谱书非常严苛,即使机器人的水平稍有进步,也会因为达不到标准而得到“0”分。这会让机器人感到沮丧并停止学习。
  • 后期阶段: 随着机器人变得越来越好,它开始能做出像样的饭菜。但由于食谱书从未改变,机器人最终能完美地符合旧规则做出每一道菜。此时,裁判已经无法分辨出一份“好”餐点和一份“极好”餐点之间的区别。机器人遇到了瓶颈并停止进步,或者更糟的是,它学会了“钻空子”,即只做到足以通过测试的程度,而不真正成为一名优秀的厨师。

新方法:“EvoRubrics”之舞

这篇论文介绍了 EvoRubrics,它就像聘请了一位能与机器人厨师同步进化的烹饪指导老师

不同于静态的食谱,这里有两个 AI 角色在训练循环中翩翩起舞:

  1. 厨师 (Policy LLM): 尝试烹饪更好的食物。
  2. 评论家 (Rubric Generator): 编写评判食物的规则。

它们是如何协同进化的:

  • 第一轮: 厨师做了一道菜。评论家写下了一套用于评判该菜品的规则。
  • 转折点: 随着厨师变得更强,评论家会自动制定更严格、更具体的规则。如果厨师学会了做完美的煎蛋卷,评论家会立即开始寻找完美的口感、正确的调味以及摆盘风格。
  • 结果: 评论家永远不会停止对厨师的挑战。厨师也永远在努力想要打动评论家。他们实时地互相推动,创造了一个随着学生进步而变得越来越难的自然“课程”。

核心秘诀:对抗性协同进化

论文称之为“对抗性协同进化”(adversarial co-evolution)。把它想象成一款电子游戏,其中的玩家游戏难度是由两个不同的 AI 智能体共同控制并相互学习的。

  • 如果玩家变得太强,游戏会自动增加更多敌人和更难的关卡。
  • 如果游戏变得太难,玩家会学习新的策略来击败它。
  • 因为它们是共同训练的,所以它们能保持完美的匹配。游戏既不会变得无聊(太简单),也不会变得无法完成(太难)。

为什么这很重要(根据论文)

研究人员在医疗领域(回答健康问题)测试了这一点。

  • 更好的结果: 他们的“双人舞”(Evolubrics)表现优于使用固定规则或仅每天更新一次规则的系统。
  • 无需外部帮助: 令他们惊讶的是,即使拿掉所有人类编写的“金标准”规则,让这两个 AI 仅仅通过互相博弈和学习,系统仍然会显著提升。这种“制作好答案”与“寻找答案缺陷”之间的张力,足以教导系统进步。
  • 评论家成为一种工具: 一旦经过训练,这个“评论家”AI 写规则的能力非常出色,以至于它可以作为一个独立的工具,去评分其他答案,或引导新的 AI 模型,甚至是在它未曾明确训练过的领域。

局限性(不足之处)

论文诚实地说明了其局限性:

  • 主要集中在医疗领域: 他们在健康问题上进行了大量测试。目前还不确定如果不经更多测试,它是否能完美适用于创意写作或法律咨询。
  • 成本高昂: 运行两个不断互相批判的 AI 比只使用一个 AI 需要更多的计算能力。
  • “回声壁效应”风险: 如果厨师和评论家过于相似,他们可能会开始对一些错误的习惯达成共识。论文指出,如果没有仔细监控,他们可能会偏向于产生一些奇怪、狭隘且不符合人类现实的规则。

总结

EvoRubrics 是一种方法,其中负责生成答案的 AI 和负责编写评分规则的 AI 共同学习。随着生成答案的 AI 变得越来越聪明,评分者也会变得越来越严格,从而确保学习永不停歇。这就像拥有一个私人教练,在你变强的那一刻立即调整你的健身计划,让你永远不会遇到平台期。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →