← 最新论文
📊 statistics

Energy-guided Recursive Model

本文介绍了能量引导的递归模型(ERM),该模型利用显式的霍普菲尔德能量(Hopfield energies)为递归推理中的测试时扩展提供了一种原则性的选择机制,并在数独和迷宫等结构化问题解决基准测试中实现了最先进的性能。

原作者: Yifei Zhao, Ying Tang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Zhao, Ying Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个巨大的、棘手的谜题,就像数独或迷宫一样。你有一个超级聪明的机器人朋友,它非常擅长思考。但问题在于,它并不会只给你一个答案,而是会同时进入一种“思考入定”状态,一次性生成 128 个不同的可能解。

核心问题是:你应该信任这 128 个答案中的哪一个?

长期以来,科学家们试图通过询问机器人:“你有多确定?”或者通过在答案中进行投票来挑选胜出者。但 Yifei Zhao 和 Ying Tang 的论文指出,这些旧方法有点像仅仅因为选手笑得最灿烂就选出才艺表演的冠军。有时候,机器人虽然非常有信心,但却完全错了;或者,可能有一个完美的答案正躲在人群中,却无人察觉。

新思路:“能量”磁铁

作者引入了一个名为**能量引导递归模型(Energy-guided Recursive Model, ERM)**的新系统。你可以这样理解:

想象机器人生成的每一个可能的答案都是一个小金属球。现在,想象谜题的规则(比如“行内数字不能重复”或“路径必须连通”)就像放在桌上的巨大磁铁。

  • 错误的答案就像木头做的球;磁铁不会吸引它们,甚至会将它们推开。
  • 正确的答案则像是铁做的球;它们会被磁铁强烈地吸引。

在这个新系统中,“能量”只是衡量一个解被谜题规则吸引程度的一个度量。能量越低,意味着球离磁铁越近,也就越有可能是正确答案。

与其询问机器人“你确定吗?”,这个系统实际上是在问:“这个答案与谜题隐藏的磁铁契合得如何?”

在现实世界中如何运作

研究人员在三种不同类型的谜题上测试了它:

  1. 数独: 他们使用了代表行、列和宫格规则的磁铁。
  2. 铅笔谜题 (PPBench): 一系列不同的逻辑游戏,磁铁代表特定的局部线索和全局模式。
  3. 迷宫: 他们使用了一个特殊的“全局磁铁”,代表从起点到终点的最短路径。

他们让机器人生成 128 个候选解(K = 128),并让它进行 64 步思考(D = 64)。然后,他们使用这个新的“能量”系统来挑选赢家。

结果:它奏效了吗?

结果表明,当机器人已经完成了生成选项的艰苦工作后,这种“能量”方法在挑选正确答案方面是一个游戏规则的改变者。

  • 在数独上: 旧方法(如投票或检查置信度)大约能答对 98.54%98.58% 的谜题。而新的能量系统达到了 98.83%。在几乎所有存在完美答案的情况下,它都能找到那个完美的答案。
  • 在铅笔谜题上: 这是最大的胜利。旧方法表现挣扎,仅能答对约 83.39%。能量系统则跃升至 88.04%,达到了如果你拥有魔法棒能从组内选出完美答案时的绝对最高分。
  • 在迷宫上: 旧方法约为 97.30%。能量系统达到了 99.30%,这是该设置下可能达到的最高分。

作者还尝试了一种高级技巧,叫做平行回火(Parallel Tempering)。想象你有一组机器人,有些在寒冷中工作(非常严格),有些在炎热中工作(非常有探索性)。它们之间会交换想法。这有助于系统找到更多正确的答案,将数独的分数提升到了 98.97%,并将迷宫的分数提升到了 99.30%

这意味着什么(以及不意味着什么)

该论文指出,让 AI 变得更聪明推理的关键不在于生成更多的想法,而在于拥有更好的筛选方法。通过使用“能量”(本质上是一种衡量答案与规则契合程度的数学方式),该系统可以找到那些置信度评分所忽略的隐藏正确答案。

然而,作者也谨慎地指出了一些情况:

  • 它还不是魔法: 这些谜题的“磁铁”(记忆)是由人类手工设计的。对于数独,他们编写了行/列规则。对于迷宫,他们编写了最短路径规则。系统并没有从头开始学习这些规则,而是利用它们来检查答案。
  • 这是一个特定的修复方案: 这在有明确规则的谜题中效果极佳。论文并未声称这解决了所有类型的思考问题,仅限于这些具有结构性的问题。
  • 这是一个对未来的建议: 作者建议,下一步应该是教 AI 自己学习其“磁铁”,而不是由人类来构建,但这在目前尚未完全解决。

简而言之,论文表明,如果你给 AI 一堆猜测,通过检查它们与规则的契合程度(能量),你会比仅仅询问 AI 的感觉要更好地找到最佳答案。这是从“信任机器人的感觉”到“信任谜题的物理特性”的一次微小但强大的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →