← 最新论文
💬 NLP

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training

本文提出了 ConsistRM 框架,通过引入具备时间一致性的答案奖励和语义一致性的批判奖励,实现了无需人工标注的稳定生成式奖励模型自训练,有效解决了传统方法对昂贵数据的依赖及奖励黑客问题,并在多个基准测试中显著提升了模型性能。

原作者: Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ConsistRM 的新方法,旨在解决大语言模型(LLM)在“自我进化”过程中遇到的一个核心难题:如何在不依赖人类老师(人工标注)的情况下,让模型自己学会如何更好地评判答案?

为了让你更容易理解,我们可以把大语言模型想象成一个正在学习当“美食评论家”的学徒

1. 背景:学徒的困境

传统的“美食评论家”(奖励模型)通常只给菜打分(比如 1 到 10 分)。但现在的生成式奖励模型(GRM) 更厉害,它不仅能打分,还能写出详细的点评文章(比如:“这道菜太咸了,因为盐放多了”)。

但是,训练这种高级评论家有两个大麻烦:

  • 太贵了:以前需要人类专家(米其林评委)来写点评、打标签,这既花钱又慢,没法大规模推广。
  • 容易“走火入魔”:如果让模型自己给自己写点评(自我训练),它很容易学会“作弊”。比如,它发现只要写长一点、语气夸张一点就能拿高分,于是它就开始胡编乱造,而不是真正去评价菜好不好吃。这就叫“奖励黑客”(Reward Hacking)。

2. 核心方案:ConsistRM(一致性感知自我训练)

ConsistRM 就像给这位学徒配了一位**“时间穿越的教练”和一位“逻辑严密的审稿人”**。它不需要人类老师,而是利用模型自己产生的“一致性”来指导学习。

第一招:时间穿越的教练(一致性答案奖励 CAAR)

想象一下,学徒在做一道题(评判两个回答哪个更好)时,他可能会因为心情不同、随机性不同,今天选 A,明天选 B。

  • 在线状态(Online-State):就像学徒现在做的决定。
  • 记忆驱动(Memory-Driven):就像学徒过去做过的所有决定的记录。

ConsistRM 的做法是
如果学徒现在的决定,和他过去在类似情况下的决定高度一致,那这个决定就是靠谱的,给他发奖励(“干得漂亮,继续保持”)。
如果现在的决定和过去的记录打架(比如以前觉得 A 好,现在突然觉得 B 好,而且没有好理由),那就不给奖励,甚至扣分(“你太不稳定了,别乱猜”)。

  • 比喻:这就像考试时,如果你每次做同一道题都选同一个答案,老师就相信你是真懂了;如果你每次选都不一样,老师就认为你在蒙,不会给你分。

第二招:逻辑严密的审稿人(一致性点评奖励 CACR)

除了看选哪个答案,还要看点评文章(Critique) 写得怎么样。
如果模型生成了 5 篇点评,其中 4 篇都在说“这道菜太咸”,只有 1 篇说“这道菜太淡”,那说明“太咸”这个观点是共识
ConsistRM 的做法是
只有当模型生成的点评文章之间意思高度相似(语义一致)时,才认为这个点评是高质量的,给予奖励。如果点评五花八门、自相矛盾,就不给奖励。

  • 比喻:就像一群评委在讨论。如果 5 个评委都异口同声说“这菜咸”,那这个结论很可信;如果 5 个人吵成一团,有的说咸,有的说淡,有的说没放盐,那这个讨论就没价值,不能用来指导学习。

3. 结果:学徒变成了大师

通过这种“自我监督”的方式,ConsistRM 让模型在没有人类干预的情况下,学会了更稳定、更准确的评判能力。

实验证明:

  • 更准了:在 5 个不同的测试集上,ConsistRM 比传统的训练方法平均提升了 1.5% 的准确率。
  • 更稳了:它解决了“位置偏见”的问题。以前模型可能会因为“答案 A 写在前面”就盲目选 A,现在不管答案谁先谁后,它都能公正评判。
  • 更精简了:模型生成的点评不再啰嗦,更加精准有力。

总结

ConsistRM 就像是一个聪明的自我进化系统。它不依赖昂贵的“人类老师”,而是通过**“回顾过去的一致性”“检查当下的共识”**,让大语言模型自己学会如何成为一个公正、稳定、逻辑严密的“超级评论家”。

这就好比一个学徒,不再需要师傅天天盯着,而是通过**“自己和自己比(看是否稳定)”以及“自己和自己商量(看大家意见是否统一)”**,最终练就了一身真本事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →