想象一下,你正在教一个机器人解谜题。在传统的做法中(称为强化学习),我们通常将机器人的大脑视为一个静态地图。无论谜题是易是难,机器人做决策时使用的“脑力”都是完全一样的。
如果机器人需要移动脚步以避开水洼,它所使用的“脑力”与它需要思考如何把一卡车家具装满货车时所用的脑力是一样多的。旧的思维方式是:“如果机器人不够聪明,那就给它一个更大的大脑(更多的参数)。”但本文的作者认为,这是种浪费。有时候,你不需要一个更大的大脑,你只需要让大脑思考得更久一点。
以下是本文主张的简单拆解,使用了日常类比:
1. “思考时间”与“大脑容量”的区别
本文提出了一种看待人工智能的新方式。与其仅仅通过增加神经元来让 AI 的大脑变得更大,我们应该让 AI 在做出单个决策时投入更多的时间去思考。
- 旧的方式: 想象一名学生正在参加考试。每道题他们都有固定的答题时间。如果题目很难,由于无法延长思考时间,他们只能靠猜。为了帮助他们,我们过去只是给了他们一本更厚的教科书(更多的参数)。
- 新的方式: 本文建议给学生同样厚度的教科书,但允许他们在每道题上多读一遍题目,并思考 10 秒而不是 1 秒。论文从数学上证明了,对于某些极其棘手的难题,拥有更多的“思考时间”是解决问题的唯一途径,无论你的教科书有多厚。
2. “捷径”与“算法”
作者发现,当 AI 被迫快速思考(低计算量)时,它会学会捷径(启发式方法)。这些捷径在练习题中表现良好,但在测试变难时就会失效。
- 类比: 想象一名学生背下了某份数学练习册的所有答案。他在那份练习册上拿了 A。但如果你给他一份类型相同但难度稍高的练习册,他就会失败,因为他并没有学会方法,他只是记住了答案。
- 结果: 论文表明,当你让 AI “思考得更久”(使用更多计算步骤)时,它会停止记忆捷径,而是真正学会了通用算法。这使得它能够解决从未见过的、尤其是那些需要长时间解决的任务(长程任务)。
3. “循环式”大脑架构
为了测试这一点,研究人员构建了一个简单的、极简的机器人大脑。
- 设计: 这个大脑不是进行一次性的计算,而是拥有一个循环。它接收输入,进行一点数学运算,将结果传回自身,再进行一点数学运算,如此循环多次后才做出最终决策。
- 隐喻: 这就像一位厨师在品尝汤的味道。
- 标准 AI: 厨师尝了一口汤,然后立即决定是否需要加盐。
- 本文的 AI: 厨师尝一口,想一下,再尝一口,再想一下,可能在做决定前会尝第三次。
- 论文显示,那位多次品尝(使用更多计算步骤)的厨师能做出更好的决策,即使他们拥有的食材(参数)与那位只尝一次的厨师一样多。
4. 他们的实际发现
研究人员在 30 多个不同的任务上进行了测试,包括:
- 搬箱子(Box Picking): 机器人在网格中导航以将箱子移动到特定位置(类似于复杂的推箱子游戏)。
- 关灯游戏(Lights Out): 一个通过翻转开关来关闭所有灯光的谜题。
- 迷宫导航(Maze Navigation): 让机器人从 A 点到达 B 点。
结果如下:
- 思考越多 = 分数越高: 当他们让 AI 使用更多的“思考步骤”(递归步骤)时,机器人在解决这些谜题方面的表现显著提升。
- 击败更大的大脑: 一个思考时间更长(但大脑较小)的 AI,往往能击败那些拥有 5 倍参数(大脑大得多)但被迫快速思考的 AI 模型。
- 泛化能力: “长时思考型”AI 在解决比练习时更难或更长的新版本谜题时,表现得好得多。而“快速思考型”AI 则会陷入困境。
5. “思考的价值”
论文还引入了一种衡量“思考时间”究竟有多值钱的方法。
- 发现: 他们发现,思考时间的长短价值在任务的开始阶段是最高的。如果你因为没有充分思考而在早期犯错,你可能会陷入死胡同,从而无法挽回。一旦接近目标,思考得久一点就不那么重要了,因为路径已经显而易见了。
总结
本文认为,在强化学习中,计算时间是与记忆容量同样重要的资源。
我们不应仅仅构建更大、更昂贵的 AI 模型,而应该让现有的模型在行动之前停下来,进行更深入的思考。作者通过数学证明并在实验中展示了:一个被允许进行长时间“思考”的小型 AI,可以胜过一个被迫立即“行动”的巨型 AI,尤其是在处理复杂的长期问题时。
技术摘要:论计算在强化学习中的作用
问题陈述
强化学习(RL)的标准观点将策略视为将状态映射到动作的静态函数,无论决策复杂度如何,都会消耗固定量的计算。这种范式将参数数量(内存)与计算量(时间)混为一谈。虽然扩展参数规模(摩尔定律)一直是常见的策略,但做出最优决策所需的计算量在不同状态下可能存在数个数量级的差异。静态的大规模策略通常是低效的,而计算受限的策略可能会无法泛化到长时程任务,转而学习过度拟合训练分布的启发式规则。本文旨在解决 RL 中缺乏区分计算量与参数量的正式语言的问题,并研究具有固定参数的策略是否能从可变的、增加的计算时间中获益。
方法论
本文通过两个互补的视角来研究该问题:理论形式化与实证验证。
理论框架:
- 作者将 RL 策略形式化为使用图灵机构建的有界计算模型。
- 他们将时间受限策略(Πt)定义为能在 t(∣s∣) 步内停机的图灵机所实现的策略。
- 他们引入了策略层级定理(Policy Hierarchy Theorem),证明对于时间构造函数 g(n)∈o(t(n)/logt(n)),存在某些马尔可夫决策过程(MDPs),其中具有更高计算预算(Πt)的策略比低预算策略(Πg)表现得更好。
- 他们进一步证明了长时程泛化定理(Long Horizon Generalization Theorem),表明低计算量策略可能会对训练任务进行过拟合(匹配训练数据上的最优价值函数),但在长时程测试任务上会失败;而高计算量策略则可以解决这些扩展后的任务。
架构提案:
- 为了测试这些理论,作者提出了一种名为插值循环单元(Interpolation Recurrent Unit, IRU)的极简循环架构。
- IRU 是 LSTM/GRU 模块的简化变体,由两个线性层(遗忘层和输入层)组成,用于在先前的细胞状态与新的局部计算之间进行插值。
- 该架构在一次前向传播过程中应用此模块 N 次(循环步骤),从而允许策略在使用固定参数量的同时,使用可变的计算量(N)。
- 完整的网络(IRU-N)包括一个初始线性层、N 个带有跳跃连接的循环块以及一个最终的输出头。
实验设置:
- 实验涵盖了 31 个任务,跨越离散(Boxpick, Lightsout)和连续(OGBench)领域,包括在线和离线 RL 设置。
- 基准模型包括标准的前馈网络(MLP)和残差网络(ResNet)。至关重要的是,ResNet 基准被设计为具有相似的有效深度(计算量)但显著更多的参数(高达 5 倍);而 MLP 则具有相似的参数量但较少的计算量。
- 研究评估了在训练任务上的性能,以及更关键的——在未见的更长时程测试任务上的性能,以衡量泛化能力。
核心贡献
- 计算受限策略的形式化: 本文提供了第一个正式证明,即增加计算时间(区别于参数量)可以使策略解决那些在理论上对于低计算量策略而言无法解决的问题,并实现更好的泛化。
- 极简循环架构: 引入了 IRU,这是一种轻量级架构,能够通过循环步骤实现计算量的扩展,而无需增加参数量。
- 计算价值指标: 提出了一个数值度量——计算价值(Value of Compute, VoC),类似于 POMDP 中的信息价值。该指标估算了智能体在特定步数内暂时增加其计算预算时所获得的价值增益或损失。
- 解耦计算与参数: 通过实证证据表明,性能提升源于表达能力的增强(计算量),而非仅仅是模型容量(参数量)的增加。
结果
- 性能缩放: 在离散和连续环境中,将循环步数(N)从 1 增加到 10 显著提高了成功率。在挑战性任务(如 Boxpick 和 OGBench)中,性能提升高达 10 倍。
- 泛化能力: 与 MLP 和 ResNet 相比,经过 IRU 训练的策略在未见的长时程任务上表现出显著更好的泛化能力。值得注意的是,在长时程评估任务上,IRU 击败了拥有 5 倍参数量的 ResNet。
- 样本效率: IRU 架构展示了更高的样本效率,能以更少的环境步数收敛到更高的渐近性能。
- 提升来源: 通过“耦合”(Yoked)实验(即使用主动智能体收集的数据来训练一个被动智能体)揭示,额外计算带来的主要收益源于策略的表达能力(即从数据中学习复杂解的能力),而非改进的探索或数据质量。在由低计算量主动智能体收集的数据上训练的被动智能体表现不佳,除非它自身也使用了高计算量。
- 消融实验: IRU 架构在速度和参数效率方面优于标准的 LSTM 和循环残差网络(Recurrent ResNets),这表明特定的门控机制对于有效地利用额外计算量是必要的。
意义与主张
本文声称将 RL 的视角从静态函数逼近转向了计算视角,即将时间和内存视为不同的轴。作者认为:
- 计算是一个独立的资源: 增加计算时间可以证明可以在不增加假设空间大小(参数)的情况下提高性能和泛化能力,从而避免了与大型静态模型相关的过拟合问题。
- 通过迭代实现泛化: 迭代计算允许策略学习能够外推到更长时程的算法解,这一现象在语言模型中已被观察到,但在没有预训练或多任务课程的情况下,在 RL 中此前尚未得到充分探索。
- 静态视角的局限性: 结果表明,标准的 MDP 假设(例如存在确定性最优策略)在计算受限的情况下可能并不成立,这可能解释了为什么即使在全观测任务中,非马尔可夫策略有时也是必要的。
作者总结道,尽管其工作使用了一种极简架构来隔离这些效应,但研究结果表明,未来的 RL 系统应该考虑自适应计算策略,即根据当前状态的难度动态调整计算量。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。