← 最新论文
🤖 machine learning

On the Role of Computation in Reinforcement Learning

本文通过形式化计算受限策略的概念,旨在证明通过一种最小变量计算架构将计算量与参数量解耦,强化学习智能体仅通过利用更多的计算资源,即可在长程任务中实现卓越的性能和泛化能力。

原作者: Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko, Benjamin Eysenbach

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko, Benjamin Eysenbach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解谜题。在传统的做法中(称为强化学习),我们通常将机器人的大脑视为一个静态地图。无论谜题是易是难,机器人做决策时使用的“脑力”都是完全一样的。

如果机器人需要移动脚步以避开水洼,它所使用的“脑力”与它需要思考如何把一卡车家具装满货车时所用的脑力是一样多的。旧的思维方式是:“如果机器人不够聪明,那就给它一个更大的大脑(更多的参数)。”但本文的作者认为,这是种浪费。有时候,你不需要一个更大的大脑,你只需要让大脑思考得更久一点

以下是本文主张的简单拆解,使用了日常类比:

1. “思考时间”与“大脑容量”的区别

本文提出了一种看待人工智能的新方式。与其仅仅通过增加神经元来让 AI 的大脑变得更大,我们应该让 AI 在做出单个决策时投入更多的时间去思考

  • 旧的方式: 想象一名学生正在参加考试。每道题他们都有固定的答题时间。如果题目很难,由于无法延长思考时间,他们只能靠猜。为了帮助他们,我们过去只是给了他们一本更厚的教科书(更多的参数)。
  • 新的方式: 本文建议给学生同样厚度的教科书,但允许他们在每道题上多读一遍题目,并思考 10 秒而不是 1 秒。论文从数学上证明了,对于某些极其棘手的难题,拥有更多的“思考时间”是解决问题的唯一途径,无论你的教科书有多厚。

2. “捷径”与“算法”

作者发现,当 AI 被迫快速思考(低计算量)时,它会学会捷径(启发式方法)。这些捷径在练习题中表现良好,但在测试变难时就会失效。

  • 类比: 想象一名学生背下了某份数学练习册的所有答案。他在那份练习册上拿了 A。但如果你给他一份类型相同但难度稍高的练习册,他就会失败,因为他并没有学会方法,他只是记住了答案。
  • 结果: 论文表明,当你让 AI “思考得更久”(使用更多计算步骤)时,它会停止记忆捷径,而是真正学会了通用算法。这使得它能够解决从未见过的、尤其是那些需要长时间解决的任务(长程任务)。

3. “循环式”大脑架构

为了测试这一点,研究人员构建了一个简单的、极简的机器人大脑。

  • 设计: 这个大脑不是进行一次性的计算,而是拥有一个循环。它接收输入,进行一点数学运算,将结果传回自身,再进行一点数学运算,如此循环多次后才做出最终决策。
  • 隐喻: 这就像一位厨师在品尝汤的味道。
    • 标准 AI: 厨师尝了一口汤,然后立即决定是否需要加盐。
    • 本文的 AI: 厨师尝一口,想一下,再尝一口,再想一下,可能在做决定前会尝第三次。
    • 论文显示,那位多次品尝(使用更多计算步骤)的厨师能做出更好的决策,即使他们拥有的食材(参数)与那位只尝一次的厨师一样多。

4. 他们的实际发现

研究人员在 30 多个不同的任务上进行了测试,包括:

  • 搬箱子(Box Picking): 机器人在网格中导航以将箱子移动到特定位置(类似于复杂的推箱子游戏)。
  • 关灯游戏(Lights Out): 一个通过翻转开关来关闭所有灯光的谜题。
  • 迷宫导航(Maze Navigation): 让机器人从 A 点到达 B 点。

结果如下:

  • 思考越多 = 分数越高: 当他们让 AI 使用更多的“思考步骤”(递归步骤)时,机器人在解决这些谜题方面的表现显著提升。
  • 击败更大的大脑: 一个思考时间更长(但大脑较小)的 AI,往往能击败那些拥有 5 倍参数(大脑大得多)但被迫快速思考的 AI 模型。
  • 泛化能力: “长时思考型”AI 在解决比练习时更难或更长的新版本谜题时,表现得好得多。而“快速思考型”AI 则会陷入困境。

5. “思考的价值”

论文还引入了一种衡量“思考时间”究竟有多值钱的方法。

  • 发现: 他们发现,思考时间的长短价值在任务的开始阶段是最高的。如果你因为没有充分思考而在早期犯错,你可能会陷入死胡同,从而无法挽回。一旦接近目标,思考得久一点就不那么重要了,因为路径已经显而易见了。

总结

本文认为,在强化学习中,计算时间是与记忆容量同样重要的资源。

我们不应仅仅构建更大、更昂贵的 AI 模型,而应该让现有的模型在行动之前停下来,进行更深入的思考。作者通过数学证明并在实验中展示了:一个被允许进行长时间“思考”的小型 AI,可以胜过一个被迫立即“行动”的巨型 AI,尤其是在处理复杂的长期问题时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →