← 最新论文
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

本文介绍了“基于评分准则的思考”(Think-with-Rubrics),这是一种新颖的范式,通过在训练过程中让大语言模型在生成回答的同时生成评分准则,将评分准则从外部评估者转化为内部推理指导,从而在现有基于奖励的基线方法上实现了持续的性能提升。

原作者: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人写故事、解谜题或遵循一套复杂的指令。过去,我们教这些机器人的方法是让它们先猜测,然后在它们完成后才给工作打分。如果它们做错了,我们会告诉它们:“这是分数,再试一次。”这就像老师发回试卷时,只在底部用红笔写个“不及格”,却没有注明如何修正具体错误。

论文《Think-with-Rubrics》(基于评分标准的思考)提出了一种更聪明的教学方法。它不再仅仅对最终答案进行评分,而是教导机器人在开始工作之前,先编写自己的评分标准

以下是该论文如何用简单的类比来分解这一概念:

1. 问题所在:“赛后”批评家

目前,大多数 AI 训练使用评分标准作为奖励。这就像一位只在比赛结束后才出现的体育教练。教练看着最终比分说:“你漏接了三次球。”球员从比分中学习,但在比赛过程中,他们脑海中并没有教练的检查清单。他们无法利用规则在实时中指导自己的动作。

2. 解决方案:“赛前”教练

作者引入了Think-with-Rubrics。这改变了机器人的思考过程。现在,在机器人写出答案的第一个字之前,它必须首先生成一个评分标准(规则清单)。

  • 类比:想象你在烤蛋糕。
    • 旧方法:你烤好蛋糕,尝一口,然后评委说:“太咸了,糖霜也乱七八糟。”你下次再试。
    • 新方法(Think-with-Rubrics):在打开烤箱之前,你先写一份清单:"1. 精确使用 2 杯面粉。2. 不加盐。3. 糖霜必须光滑。”然后,你在烤蛋糕的过程中不断对照自己的清单

通过迫使 AI 先写下规则,这些规则就变成了其“思考过程”的一部分,而不仅仅是一个外部评分。

3. 训练如何运作(“双重检查”系统)

论文描述了一个包含两个主要阶段的训练过程,就像学生为大型考试做准备:

  • 阶段 1:学习格式(SFT 热身)
    机器人被展示如何编写清单 followed by 答案的示例。它学习结构:<评分标准> 然后是 <答案>。这就像教学生如何正确格式化作业,以便老师能够阅读。

  • 阶段 2:强化学习(“教练”阶段)
    这是魔法发生的地方。机器人生成自己的清单和答案。然后,一个“验证器”(聪明的评委)检查两件事:

    1. 黄金检查:答案是否符合完美的、人类制作的清单?(这是外部评分)。
    2. 自我检查:答案是否真正遵循了机器人自己的清单?(这是内部一致性)。

关键洞察
论文发现,如果只使用“黄金检查”(人类评分),机器人虽然会更擅长遵循人类规则,但其自身的思考可能仍然混乱。但如果加入“自我检查”,机器人就能学会与自己保持一致。

4. 令人惊讶的发现:自我进化

论文中最令人兴奋的发现是,机器人实际上可以在完全不需要人类教师清单的情况下自学!

  • 类比:想象一个学生,他非常擅长制作自己的学习指南并严格遵守,最终成绩甚至超过了那些只依赖教师答案键的学生。
  • 结果:论文表明,一个被训练去遵循其自身生成的清单(无需人类“黄金”清单)的模型,其表现与使用人类清单训练的模型一样好,有时甚至更好。这表明 AI 可以通过更好地制定自己的规则并遵循这些规则来实现“自我进化”。

5. 为什么效果更好

作者解释说,这种方法之所以有效,是因为它解决了一个特定问题:不一致性
通常,AI 可能会想:“我需要简短”,但随后却写了一大段。这是它认为应该做的与它实际做的之间的脱节。

  • Think-with-Rubrics 迫使 AI 声明:“我会保持简短”,然后通过写一个简短的答案立即证明这一点。
  • 训练不仅奖励 AI 的正确性,还奖励其与自身计划的一致性

结果总结

该论文在多个基准测试(如 IFEval 和 IFBench)上测试了这种方法,发现:

  • 新方法始终比旧的“评分标准即奖励”方法高出约 3.87 分 的平均分。
  • 它在大型和小型 AI 模型上均表现良好。
  • 它使 AI 的思考过程更短、更高效(将“思考”压缩为结构化的清单)。

简而言之:这篇论文教导 AI 停止猜测,开始规划。通过让 AI 在开始工作前编写自己的规则手册,并奖励其遵守该手册,AI 变得更加可靠、更加一致,并且能够在没有持续人类监督的情况下自我提升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →