← 最新论文
🤖 machine learning

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

本文介绍了“Le Critique”,这是一个通过结合用于注入任务相关标记级信号的特权价值函数(PVF)以及用于在组相对基准与价值基准之间进行自适应插值的 TETHER,从而增强大语言模型强化学习的框架,该框架实现了优于标准价值函数基准的性能,并取得了与 GRPO 相当且具有竞争力的结果,同时缓解了诸如落后者展开(straggler rollouts)和高方差等问题。

原作者: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着一种如何教计算机程序更好地思考的持续斗争。想象一个正在参加考试的学生。如果他们得到了正确的最终答案,就会得到好成绩;如果错了,就会得到差成绩。许多现代人工智能系统就是这样学习的:它们尝试许多不同的方法来解决问题,然后计算机根据最终结果是成功还是失败来调整其大脑。这种方法被称为强化学习。然而,这里有一个陷阱。如果学生写了一篇长篇且复杂的文章,而最终成绩不理想,计算机并不知道是哪一个具体的句子导致了错误。它只知道整篇文章表现很差。这使得学习变得缓慢且低效,就像试图通过猜测哪个零件坏了来修理汽车引擎,却没有任何工具辅助一样。

为了解决这个问题,研究人员长期以来一直试图构建一个“评论家”(critic)来辅助人工智能。这是第二个计算机程序,它会在学生写作时观察他们,并逐句预测最终答案的表现如何。如果评论家能在早期就猜出最终成绩,它就能在学生走错路时立即告知,从而实现更快、更精准的学习。长期以来,这种方法并不受欢迎,因为构建和训练这个第二个程序非常困难且往往不可靠。最近,该领域转向了完全跳过评论家的方案,转而依赖于将不同组的答案进行相互比较。但这一篇新论文表明,使用评论家的旧想法并没有过时,它只是需要一种看待世界的新方式。

来自 Mistral AI 及其他机构的研究人员发现,评论家之所以失败,并不是因为这个想法不好,而是因为它经常被要求去做不可能完成的任务。他们发现,如果给评论家一些主 AI 学生无法看到的额外信息,评论家就会变得极其准确。他们称之为“特权价值函数”(privileged value function)。要理解这如何运作,请想象一个正在做数学测试的学生。学生正在逐步解题,而评论家在旁观察。通常情况下,评论家只能根据学生目前为止所写的内容来猜测最终得分。但在这种新设置中,评论家被秘密地递交了正确的答案解析。它并不会把答案展示给学生看,但它利用这些秘密知识来更准确地判断学生的当前进度。如果学生的当前步骤偏离了正确路径,评论家会立即察觉并给出清晰的信号以改变航向。这个信号能帮助学生比盲目猜测的评论家学得更快。

团队在几个困难的推理任务上测试了这个想法,包括解决逻辑谜题和编写计算机代码。在一个实验中,他们使用了一个数独谜题,AI 需要逐个填入网格中的数字。主 AI 只能看到它已经放置的数字。然而,特权评论家被展示了完全解出的网格。这使得评论家能够立即告诉 AI 某个动作是否正导致死胡同,即使 AI 才刚刚做了几步操作。结果令人瞩目。在他们尝试的每一个任务中,使用这种“特权”评论家都帮助 AI 学得更快,并达到了更高的分数。AI 不仅仅是运气好,它学会了做出更好的决策,因为它拥有了一张更清晰的通往目标的地图。

研究人员还意识到,有时评论家本身仍在学习阶段,并不完美。如果评论家过于自信却判断错误,它会误导 AI。为了解决这个问题,他们构建了第二个工具,称为“Tether”。这个系统就像一个智能开关。在训练开始阶段,当评论家还很新且不可靠时,系统主要依赖于对各组答案进行比较,这是一种安全但较慢的方法。随着评论家变得越来越好并开始给出准确的建议,Tether 系统会逐渐将信任转向评论家。它将两种方法融合在一起,在两者之间平滑过渡,而不需要人类工程师去调整参数。这确保了 AI 始终能获得最佳指导,无论评论家是新手还是专家。

这项研究表明,使用第二个程序来引导学习的旧想法不仅有效,而且更优越,前提是给予它正确的工具。通过允许评论家看到主 AI 看不到的信息,研究人员消除了学习过程中的猜测环节。他们还证明了这种方法可以变得稳健且自动化,能够随着评论家自身技能水平的提升而进行调整。虽然这项工作需要巨大的计算能力和精细的工程设计,但结果表明了一条清晰的前路。与其放弃评论家,教导人工智能进行推理的未来可能在于给予它一个更好的视角,让它能以一种此前无法企及的清晰度,从错误中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →