← 最新论文
🤖 machine learning

Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning

本文介绍了平衡推理器(EqR),这是一个通过在潜在动力系统中学习任务条件吸引子来实现可扩展且可泛化推理的框架,该框架支持自适应的测试时计算分配,从而在 Sudoku-Extreme 等复杂任务上将准确率从 2.6% 提升至 99% 以上。

原作者: Benhao Huang, Zhengyang Geng, Zico Kolter

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Benhao Huang, Zhengyang Geng, Zico Kolter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning》(均衡推理器:学习吸引子实现可扩展推理)的解释。

核心理念:像磁铁一样思考

想象你正在尝试解决一个非常棘手的谜题,比如复杂的数独。你有一位聪明的助手(一个 AI 模型)来帮助你。

旧方法(前馈模型):
旧式的思考方式就像是一次性猜测。助手看着谜题,思考一刹那,然后立刻喊出答案。如果错了,那就错了。无论给予多少时间,它都没有第二次机会去深入思考。论文表明,对于难题,这些“一次性”助手表现极差,答对的比率不到 3%。

新方法(迭代推理):
新方法被称为均衡推理器(EqR),它就像一块磁铁
助手不会立刻喊出答案,而是先做出一个猜测,然后反复不断地进行修正。

  • 第一步: 它做出一个猜测。
  • 第二步: 它检查猜测,发现几个错误并修正它们。
  • 第三步: 它再次检查,发现更多细微的错误并修正它们。

论文认为,这个过程不仅仅是“思考更久”。它是关于让 AI 学会寻找一个"磁性吸引子"。

什么是“吸引子”?

想象一片布满山丘和山谷的地形。

  • 山丘: 这些代表糟糕的猜测或错误的答案。
  • 山谷: 这些代表良好、稳定的答案。
  • 吸引子: 这是最深、最稳定的山谷,也是“正确答案”所在的地方。

论文声称,为了让 AI 在推理方面变得非常出色,它需要学习绘制一张地图,使得“正确答案”成为一个深邃、宽阔的山谷(一个强吸引子)。当 AI 开始思考时,它会从山坡上滚落。如果地形塑造得当,它会自然地滚入正确的山谷并停在那里。

如果地形杂乱无章,AI 可能会被困在一个小而浅的坑里(错误的答案),或者永远滚动下去而无法安定。

如何实现:两个秘密配方

研究人员发现,仅仅让 AI“思考更久”是不够的。他们必须教会 AI 如何塑造自己的思维地形,以便它能找到正确的山谷。他们通过两个简单的技巧做到了这一点:

  1. 随机起点(“转瓶子”技巧):
    通常,AI 模型每次解决谜题都从完全相同的位置开始。研究人员让 AI 每次都从随机的位置开始。

    • 类比: 想象你在一个岛上寻找隐藏的宝藏。如果你总是从同一个码头出发,你可能会被困在沼泽里。如果你从随机海滩出发,你找到通往宝藏路径的机会就大得多。这有助于 AI 探索通往解决方案的不同路径。
  2. 添加一点噪声(“摇晃桌子”技巧):
    在 AI 思考的过程中,研究人员给它的思维添加了一点点随机的“抖动”或噪声。

    • 类比: 想象你正走在走廊里试图寻找一扇门。如果你笔直地走,你可能会被窗帘挡住而卡住。如果你稍微扭动一下(添加噪声),你可能会撞到窗帘,意识到那不是门,从而找到真正的门。这防止 AI 被困在一个“虚假”的山谷(看起来稳定但实际错误的答案)中。

结果:从“一无所知”到“大师”

论文在两项非常困难的任务上测试了这种方法:数独(数字谜题)和迷宫(在网格中寻找路径)。

  • 之前: 标准 AI 模型(“一次性”猜测者)几乎答错了所有题目(在困难数独上的准确率约为 2%)。
  • 之后: 通过使用带有随机起点和少量噪声的“磁铁”方法,AI 能够扩展其思考能力。
    • 如果让它们思考几步,表现就会变好。
    • 如果让它们思考极长的时间(相当于展开 40,000 层神经网络),它们就会成为大师。
    • 得分: 在最难的数独谜题上,准确率从2.6% 跃升至 99% 以上

“深度与广度”策略

论文还发现了一条关于如何分配 AI“思考时间”的有趣规则:

  • 深度(思考得更深): 这就像沿着一条路径进行一次漫长而谨慎的行走。如果路径清晰,这很有效。
  • 广度(思考得更宽): 这就像同时从不同的起点派出 100 名不同的探险家。
  • 规则: 你需要足够的“深度”首先让探险者们朝着正确的方向移动。一旦他们开始移动,增加“广度”(更多的探险家)就能帮助你更快地找到最佳路径。

“停止按钮”(自适应计算)

最后,研究人员添加了一个“停止按钮”。

  • 问题: 有时谜题很简单,AI 在 5 秒内就能解决。有时很难,需要 5 分钟。在简单谜题上浪费 5 分钟是低效的。
  • 解决方案: AI 学会了倾听自己的“磁铁”。如果它感觉到自己已经安定在一个稳定的山谷中(答案已稳固),它会立即停止思考。如果它还在摇晃,它就会继续。
  • 结果: 这节省了巨大的计算能力(能耗降低高达 11 倍),同时没有损失准确性。

总结

这篇论文告诉我们,为了让 AI 在推理方面变得更好,我们不应该仅仅让模型变得更大。相反,我们应该教会它塑造其内部思维过程,使得正确答案像深邃、稳定的磁铁一样发挥作用。通过添加一点随机性并让 AI“思考”直到它安定下来,我们可以将一个笨拙的猜测者转变为一个近乎完美的解题者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →