← 最新论文
💬 NLP

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

Agon 引入了一种竞争性的跨模型强化学习框架,其中两个模型通过迭代地针对彼此起草并解决问题来充当相互的评分者,在无需过程标签的情况下隐式地奖励更优越的推理能力,并在复杂推理任务上显著优于标准的单模型强化学习方法。

原作者: Vladislav Beliaev

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Vladislav Beliaev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名学生如何解决极其困难的数学题。

旧方法:仅看答案的“教练”
目前的标准方法(被称为 GRPO)就像一位只看考试最终答案的教练。

  • 如果学生答对了,他们会得到一颗金星。
  • 如果答错了,他们会得到一个红色的 X。
  • 问题在于: 教练从不看学生是如何得出答案的。如果学生写了 10 页语无伦次的废话、猜测和反复回溯,最后只是偶然撞到了正确答案,他们依然会得到那颗金星。
  • 结果: 学生学会了写更多的字,而不是更好地思考。他们开始在页面上填满“嗯,让我想想……”和“等等,也许……”之类的内容,仅仅为了增加猜对的概率。他们变得啰嗦,却并没有变得更聪明。

新方法:Agon(“辩论俱乐部”)
这篇论文介绍了一种名为 Agon(希腊语意为“竞赛”)的新方法。Agon 不再是让一名学生独自解决问题,而是将两名学生放在同一个房间里共同解决同一个问题,但有一个转折:他们正在竞争,看谁能比对方思考得更出色。

以下是 “Agon” 游戏的运作方式:

  1. 起草: 学生 A 首先尝试解决问题。他们写下自己的推理过程和步骤摘要(但隐藏最终答案)。
  2. 挑战: 学生 B 阅读学生 A 的摘要。学生 B 的目标是比学生 A 更好地解决问题。
    • 如果学生 A 犯了错误(比如方程中的符号错误),学生 B 发现了它,修正了它,并得到了正确答案。学生 B 获胜。
    • 如果学生 A 是正确的,学生 B 则尝试寻找一种更短、更简洁的方式来证明它。
  3. 轮换: 在下一轮中,他们交换角色。学生 B 进行起草,学生 A 进行挑战。

为什么这行得通(“对手评分”的魔力)
在旧方法中,学生必须自己去猜测什么是“好的思考”,因为没有人告诉他们。而在 Agon 中,对手负责评分。

  • 隐性反馈: 如果学生 A 的推理漏洞百出,学生 B 会轻易击败他们。这教会了学生 A,“唠叨”和“填充词”是行不通的,因为聪明的对手会识破它们。
  • 无需标签: 我们不需要人类老师来说:“这一步很精彩,那一步是废话。” 事实是,一个学生击败了另一个学生,这本身就是推理更优越的证明。
  • “军备竞赛”: 因为两名学生都在同时变得越来越聪明,所以门槛也在不断提高。学生 A 不能再仅仅靠猜测了;他们必须进行真正的推理才能击败同样在变得更聪明的学生 B。

结果
研究人员在非常难的数学题上测试了该方法(使用名为 Qwen3 的模型)。

  • 标准方法: 模型在难题上的正确率约为 30%,但其解释写得非常冗长。
  • Agon 方法: 这两个相互竞争的模型在难题上的正确率达到了约 61%
  • 加分项: 它们的解释实际上变得更短了。因为模型在竞争中需要追求高效并发现错误,它们停止了编写不必要的废话。

“两阶段”技巧
当该系统被用于实际为用户解决问题时,它的运作方式就像一场接力赛:

  1. 模型 A 写出一个草拟方案。
  2. 模型 B 阅读该草案,检查错误,并写出最终答案。
    这是自动完成的。论文表明,通过这种方式训练两个互相竞争的模型,比让两个模型友好合作或让一个模型尝试修复自身的错误要有效得多。

简而言之
Agon 阻止了 AI 模型为了碰运气而进行的“闲聊”。相反,它通过让它们面对一个不断寻找其错误的对手,迫使它们变得敏锐、简洁且准确。它将训练过程从个人的练习赛转变为一场高风险的辩论,在这里,获胜的唯一途径就是清晰地思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →