← 最新论文
🤖 machine learning

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

本文提出“最低质心”方法,这是一种测试时扩展技术,通过基于高熵 token 的时间聚类计算“熵质心”来筛选最佳模型响应,该方法在无需外部奖励模型的情况下,于多种任务和模型规模上均展现出相对于现有基线的一致性能提升。

原作者: Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yiren Feng

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yiren Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《作为测试时扩展的内在奖励的熵中心》的解释,用日常语言和创意类比进行了翻译。

大局观:在没有老师的情况下找到最佳答案

想象你有一个非常聪明但有时会困惑的学生(AI 模型)。你问他们一个难题,比如复杂的数学问题或编程挑战。你不是只要求一个答案,而是告诉他们:“用 64 种不同的方式思考这个问题,然后选出最好的一个。”

这被称为测试时扩展(Test-Time Scaling)。问题是:你怎么知道这 64 个答案中哪一个是最好的?

通常,你需要一位老师(外部奖励模型)来给每一个答案打分。但为每一次尝试都聘请一位老师既昂贵又缓慢。这篇论文提出了一个巧妙的技巧:倾听学生自己的“思考噪音”,以此判断他们是否走在正确的轨道上。

问题:“嘈杂”的课堂

当学生大声思考(生成文本)时,他们会产生一串词语。有些词语说得非常自信(低“熵”),而另一些则说得犹豫、怀疑,或者尝试了许多不同的选项(高“熵”)。

以前的方法试图通过观察每一个单词的置信度来判断答案。

  • 缺陷: 这就像通过看单帧画面来评判整部电影。有时,学生即使完全迷路了,也会自信地说出一个词(就像机器人背诵记忆中的事实)。有时,他们犹豫是因为正在进行深入且富有成效的思考。逐词查看置信度过于“嘈杂”且令人困惑。

解决方案:“高熵阶段”(HEP)

作者意识到,困惑不是一次发生一个词,而是以爆发的形式发生。

想象学生的思考过程就像在森林中行走:

  • 低熵: 自信地走在清晰、铺设好的小路上。
  • 高熵: 跌跌撞撞地进入一个浓密、迷雾笼罩的灌木丛,他们不确定该往哪个方向走。

作者没有查看每一步,而是将这些步骤分组为高熵阶段(HEPs)

  • 当学生踏入迷雾灌木丛(高不确定性)时,一个HEP开始。
  • 只有当他们走出迷雾,连续走几步回到清晰的小路上时,它才结束。

这将一个混乱、嘈杂的信号转化为了清晰、可管理的思考“块”。

核心思想:“熵中心”

现在,我们如何判断整个答案的质量?作者使用了一个物理概念:质心(或重心)

想象学生的整个思考过程是一根长棍。

  • 每当他们陷入“迷雾灌木丛”(一个 HEP)时,我们就在那部分棍子上放一个重物。
  • 熵中心就是如果你举起这根棍子,它会在哪里保持平衡的点。

这篇论文的“黄金法则”:

  • 好学生(低中心): 他们在早期就感到困惑(在开始时探索迷雾灌木丛),弄清楚了问题,然后在剩下的旅程中自信地走在清晰的小路上。他们的“重量”位于棍子的起点。平衡点很低(靠前)。
  • 差学生(高中心): 他们开始时很自信(以为知道答案),但在接近结束时陷入迷雾灌木丛,意识到自己犯了错。他们的“重量”位于棍子的末端。平衡点很高(靠后)。

策略: 当 AI 生成 64 个不同的答案时,论文中的方法只需选择那个“平衡点”最接近开头的答案。它假设早期困惑然后解决是正确答案的标志,而最后时刻困惑则是失败的标志。

为什么这很重要

  1. 无需老师: 它不需要外部评分员。它利用模型自身的内部“困惑信号”。
  2. 无处不在: 作者在数学、编程、逻辑谜题,甚至“智能体”任务(AI 需要使用工具)中测试了这一点。在所有这些任务中,它的表现都优于现有方法。
  3. 可扩展: 无论 AI 是小型的(140 亿参数)还是巨大的(4800 亿参数),这种方法都能一致地找到更好的答案。

总结类比

把解决问题想象成跑步比赛。

  • 旧方法: 裁判观察每一步,并根据你在那一确切时刻的移动速度大喊“好!”或“坏!”。
  • 论文的方法: 裁判观察你的配速
    • 如果你起跑冲刺,中间减速深思,然后冲刺到终点,你很可能会赢。(结尾的自信 = 好)。
    • 如果你起跑冲刺,但在最后一段绊倒并跌跌撞撞,你很可能会输。(结尾的自信 = 坏)。

论文的方法只需选择那个早期跌倒但最后冲刺强劲的跑步者,忽略每一步脚落的嘈杂细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →