← 最新论文
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

本文介绍了 POISE,这是一种强化学习方法,它利用在策略模型内部状态上训练的一个轻量级探针,以可忽略的成本估计价值基线,从而在无需独立评论家或多轮展开所带来的计算开销的情况下,实现稳定且高效的策略优化。

原作者: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在教导一位才华横溢但费用极高的学生(一个大语言模型)如何解决复杂的数学问题。你希望他们变得更好,因此你使用了一种名为强化学习的方法。在这种方法中,学生尝试解决问题,如果他们答对了,你就给他们一个分数(奖励)。

为了有效地教导他们,你不仅需要告诉他们做对了什么,还需要告诉他们相比他们平时的表现,进步了多少。这种“差异”被称为优势(advantage)。要计算这个值,你需要一个基线(baseline)——即对学生在特定问题上通常能得多少分的预估。

问题:预估的成本

目前,获取这个基线主要有两种方法,但两者都很昂贵:

  1. “巨型导师”方法(PPO):你雇佣第二个同样庞大且昂贵的人工智能模型,仅作为评判者。这个评判者观察学生的作业并预估分数。由于你同时运行两个巨型模型,这使你的计算成本翻了一倍。
  2. “组平均”方法(GRPO):你让学生连续8次解决同一个问题。然后,你取这 8 个分数的平均值作为基线。这浪费了大量的时间和金钱,因为你为了获取基线而多生成了 7 个答案,导致尝试问题的空间变小。

解决方案:POISE(学生自身的直觉)

本文的作者提出了一种名为POISE(基于内部状态值估计的策略优化)的新方法。

核心思想是:学生在甚至完成解题之前,就已经知道这个问题有多难了。

当大型人工智能模型进行思考时,它会从问题到答案生成一系列“内部思维”(隐藏状态)。本文认为,这些内部思维包含了一个关于模型成功可能性的隐藏信号。这就像学生有一种直觉:“这一步我很吃力;我可能答不对”,或者“这感觉很简单;我有信心”。

POISE 的工作原理如下:

  1. 轻量级探针:与其雇佣第二个巨型人工智能,不如在学生的大脑上连接一个微小、廉价的“探针”(就像一个简单的计算器)。
  2. 读取信号:该探针在学生学习过程中,观察他们的内部思维(隐藏状态)和“不确定性”(熵)。
  3. 预测:探针根据这些内部信号预测分数。
  4. 公平性技巧(交叉 rollout):为了确保学生不会通过查看自己的答案来猜测分数而作弊,系统使用了一个巧妙的技巧。它让学生解决问题两次。为了评分第一次尝试,探针查看第二次尝试的内部思维,反之亦然。这确保了基线的公平性和无偏性。

为什么这很重要

  • 更便宜:你不需要第二个巨型人工智能模型。你只需利用学生已经生成的信号,使用那个微小的探针即可。
  • 更快:你不需要生成 8 个答案来获取基线。你只需要 2 个(一个用于解题,一个用于辅助评分)。这释放了你的计算预算,让你可以尝试许多不同的问题,从而帮助学生更快地学习。
  • 更稳定:因为你可以尝试更多不同的问题,学习过程变得不那么“嘈杂”,也更加稳定。

结果

研究人员在数学推理任务(如奥林匹克数学)上测试了这种方法。他们发现:

  • POISE 的表现与使用昂贵评判者或大量答案组的最先进方法(如 DAPO)一样好
  • 它使用的计算资源更少,并且训练完成得更快。
  • “直觉”是准确的:那个微小的探针预测成功率的效果几乎与全尺寸的人工智能评判模型一样好。
  • 它在其他领域也有效:他们在编程和工具使用任务上也进行了测试,结果同样良好,证明了学生的内部信号是成功的通用指标。

总结

POISE 就像让你意识到,你的学生并不需要第二位老师来告诉他们表现如何。通过简单地倾听他们内部的“思考过程”,你可以立即知道他们是否走在正确的轨道上。这节省了金钱,节省了时间,并使学习过程更加顺畅,同时毫不牺牲性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →