想象一下,你正在教一个机器人走路或抓取物体。在现实世界中,每个机器人都略有不同,每块地板也都略有滑腻或凹凸不平。标准的 AI 训练通常将机器人和地板视为完美且不变的。当你把这个机器人放到一块略有不同的新地板上时,它往往会绊倒并失败,因为它没有学会如何适应这些“差异”。
本文介绍了一种名为 GLiBRL(带有可学习基函数的深度贝叶斯强化学习中的广义线性模型)的新方法。你可以将其视为一种“超级自适应”训练系统,它能帮助机器人精确识别新情况与以往所见情况有何不同,并立即调整其行为。
以下是其工作原理的分解,使用了简单的类比:
1. 问题:旧方法的“猜谜游戏”
以往的高级方法试图通过“黑盒”方法来解决这个问题。想象一下,你试图仅通过观察棋子来猜测一款新棋盘游戏的规则。你可能得到一个大概的想法,但你的猜测是模糊的。从技术术语来说,这些方法使用复杂的数学(称为变分推断)来近似答案。
- 缺陷:因为它们只是在猜测(近似),所以机器人对新任务的理解往往是“模糊不清”的。这就像试图在雾蒙蒙的镜子里辨认朋友;你知道那是个人,但无法分辨那是你的朋友还是陌生人。这导致机器人在面对新任务时表现不佳。
2. 解决方案:GLiBRL 的“清晰透明”方法
GLiBRL 通过使用精确数学而非模糊猜测来改变游戏规则。
- 类比:想象你是一名侦探。旧方法试图通过查看模糊的照片并“最佳猜测”谁是凶手来破案。然而,GLiBRL 拥有一台高倍显微镜。它不猜测;它根据证据计算出谁是凶手的精确概率。
- 工作原理:机器人收集数据(如采取的步数或获得的奖励)。GLiBRL 使用一种特殊的数学技巧(带有可学习基函数的广义线性模型)来处理这些数据。它将“学习”部分(找出规则)与“决策”部分(选择做什么)分离开来。这使得它能够在无需猜测的情况下完美地完成数学运算。
3. “置换不变性”的“魔力”
该论文最大的主张之一是 GLiBRL 具有置换不变性。
- 类比:想象你有一袋弹珠。如果你一个个把它们拿出来,顺序重要吗?
- 旧方法:如果你先拿出一个红色弹珠,然后拿出一个蓝色弹珠,计算机会想:“好的,先是红色,然后是蓝色。”如果你先拿出蓝色再拿出红色,它就会感到困惑。它将事件顺序视为一种秘密代码。
- GLiBRL:它观察的是这袋弹珠。它不在乎你是先拿出红色还是最后拿出红色。它只知道:“我有一个红色弹珠和一个蓝色弹珠。”
- 为何重要:这使得 GLiBRL 能够无缝地处理两种截然不同的学习算法(称为“在线策略”和“离线策略”)。这就像是一个万能适配器,可以适配任何电源插座,使该方法更加灵活和高效。
4. “指纹”发现
作者发现了一种美妙的数学联系,即机器人如何“看待”任务与其收集的实际数据之间的关系。
- 类比:想象每个任务(如“快走”与“慢走”)都有一个独特的指纹。GLiBRL 创建了一张地图,其中地图上两个指纹之间的距离,与机器人所看到的数据差异完全一致。
- 主张:这是首次有人证明此类在线学习存在这种直接的、闭式形式的联系。这意味着机器人内部的任务“地图”与现实完美对齐。如果两个任务在数据中看起来相似,机器人就知道它们相似;如果它们看起来不同,机器人就知道它们不同。
5. 结果:更快、更智能
该团队在两个著名的机器人训练场上测试了 GLiBRL:
- MuJoCo:模拟机器人学习走路(如猎豹或蚂蚁)。
- MetaWorld:模拟机器人学习操作物体(如开门或抓取积木)。
结果:
GLiBRL 不仅有效,而且彻底击败了竞争对手。
- 在走路测试中,其结果比之前的最佳方法高出多达 1.8 倍,而且通常使用的训练步数要少得多。
- 在物体操作测试中,其成功率提高了多达 1.1 倍。
- 最重要的是,它比其他方法更快、更准确地学会了区分不同任务,证明了其“精确数学”方法优于旧方法的“模糊猜测”。
总结
简而言之,GLiBRL 是一种训练 AI 智能体的新方法,它用精确的数学计算取代了模糊的近似猜测。通过将机器人的学习过程比作一名使用显微镜完美破案的侦探,它使机器人能够瞬间理解新情况,完美调整其行为,并在走路和物体操作任务中超越所有先前的方法。
技术摘要:基于可学习基函数的深度贝叶斯强化学习中的广义线性模型(GLiBRL)
问题陈述
贝叶斯强化学习(BRL)通过显式建模转移和奖励动态的不确定性,为元强化学习(Meta-RL)中的泛化提供了一个原则性框架。然而,经典的 BRL 方法受限于其对模型已知函数形式的依赖,限制了其在多样化任务中的适用性。最近的深度 BRL 方法尝试利用神经网络学习这些形式,但面临重大的理论和实践障碍:
- 推理不可行性:直接将神经网络应用于数据和任务参数的联合空间,使得精确贝叶斯推理变得不可行,迫使人们依赖变分推断(VI)。
- VI 的局限性:VI 引入了高方差蒙特卡洛估计、摊销间隙和后验崩溃等挑战,通常导致任务表征模糊,进而降低策略性能。
- 排列方差:许多深度 BRL 方法使用序列模型(如 RNN、Transformer)来总结任务历史。这些模型具有排列变异性,使其无法与样本高效的离线策略算法(如软演员 - 评论家 SAC)兼容,除非导致严重的性能下降。
- 噪声假设:现有方法通常假设已知噪声分布,或在测试时固定神经网络权重(实际上执行的是最大似然估计而非贝叶斯推理),导致在未见任务中出现预测误差。
方法论:GLiBRL
作者提出了 GLiBRL(基于可学习基函数的深度贝叶斯强化学习中的广义线性模型),这是一个能够在保持深度学习表征能力的同时,实现完全可行且精确贝叶斯推理的框架。
核心架构
GLiBRL 强制任务参数与数据特征之间建立广义线性关系。它不是直接将神经网络应用于联合参数 - 数据空间,而是将它们分离:
- 可学习基函数:神经网络(ϕT,ϕR)充当表达性强且可学习的基函数,将原始状态 - 动作数据映射到特征空间(CT,CR)。
- 线性参数化:转移和奖励模型在关于任务参数(θT,θR)的已学习特征上是线性的。
- 共轭先验:该方法对任务参数(均值和噪声协方差)采用正态 - 威沙特先验。这一选择与矩阵正态似然函数共轭,允许进行精确后验更新而无需变分近似。
关键技术组件
精确后验更新:
- 随着新样本的到来,任务参数的后验分布被顺序更新。
- 通过利用矩阵求逆引理,在线更新的计算复杂度降低为转移的 O(max(DS2,DT2)) 和奖励的 O(DR2),确保了可扩展性。
- 至关重要的是,GLiBRL 对模型噪声(协方差矩阵 Tσ,Rσ)执行精确贝叶斯推理,推广了之前假设已知噪声的工作(如 ALPaCA)。
无 ELBO 目标:
- 由于后验分布是可行的,GLiBRL 以闭式形式计算精确边缘对数似然。
- 模型参数(ϕT,ϕR)通过最大化该边缘似然(公式 19)进行优化,完全绕过了对变分推断和证据下界(ELBO)的需求。这消除了后验崩溃等问题。
排列不变性:
- 精确贝叶斯更新仅依赖于数据的充分统计量(特征矩阵和目标值),而不依赖于样本的顺序。
- 这种排列不变性使得 GLiBRL 能够无缝集成到在线策略(如 PPO)和离线策略(如 SAC)RL 算法中,这是相对于依赖序列历史编码器的方法的一大优势。
结构对应性:
- 该论文建立了一个闭式恒等式,将任务表征(源自后验均值)之间的L2 距离与学习特征空间中任务样本之间的基于核的经验对应性(具体为有符号测度余弦均值相似性和最大均值差异)联系起来。
- 这确保了任务表征不是任意的嵌入,而是与底层数据样本的差异在结构上紧密相连。
主要贡献
- 可行的深度 BRL:引入了一种框架,在深度 RL 设置中实现了对任务参数和模型噪声的精确贝叶斯推理,消除了对变分近似的需求。
- 可学习基函数:一种新颖的架构,利用神经网络学习特征基,同时保持线性贝叶斯模型的数学可行性。
- 排列不变集成:第一种能够因其固有的排列不变性而与离线策略算法(如 SAC)无缝集成的深度 BRL 方法。
- 理论结构结果:推导了在线深度 BRL/Meta-RL 中第一个闭式关系,将任务表征的几何距离与任务样本的基于核的相似性联系起来。
- 噪声推理:对模型噪声进行显式贝叶斯推理,作者证明与假设固定噪声的方法相比,这降低了转移和奖励模型的预测误差。
实验结果
GLiBRL 在 MuJoCo locomotion 基准和 MetaWorld(ML10 和 ML45)操作基准上进行了评估。
- MuJoCo:GLiBRL(结合 SAC)实现了最先进(SOTA)的性能,在回报方面比基于 PPO 的基线(RL2、TrMRL、VariBAD)高出多达 1.5 倍,同时仅使用了它们 10% 的训练步数(106 对比 107)。它也比基于 SAC 的 PEARL 方法高出多达 1.8 倍。
- MetaWorld:在具有挑战性的 ML10 和 ML45 设置中,GLiBRL(结合 PPO)达到或超过了包括 MAML、RL2 和 VariBAD 在内的强基线的性能。具体而言,它在 MetaWorld 上的成功率提高了多达 1.1 倍。
- 定性分析:任务表征的可视化(通过 PCA)显示,GLiBRL 在最少训练(5×105 步)后,成功将连续任务参数(如目标速度)解耦为结构化的潜在空间,而强基线即使在显著更大的训练预算下也无法实现有意义的分离。
- 消融研究:移除对模型噪声的推理(GLiBRL_wo_NI)导致转移和奖励的预测误差增加,验证了正态 - 威沙特先验对于准确建模的必要性。
意义与主张
该论文声称,GLiBRL 通过解决深度学习的灵活性与贝叶斯推理的严谨性之间的张力,代表了深度贝叶斯 RL 的重大进步。
- 理论严谨性:它提供了在线深度 BRL 中第一个结构结果,将表征几何与样本相似性联系起来,确保学习到的任务嵌入具有理论基础。
- 实际效率:通过避免变分推断,该方法避免了与 ELBO 最大化相关的不稳定性和优化困难,从而带来更稳定的学习和更好的样本效率。
- 算法兼容性:精确更新的排列不变性允许使用高效的离线策略算法(SAC),而这些算法此前难以与深度 BRL 方法集成。
- 泛化能力:推断模型噪声和学习基函数的能力使智能体能够有效泛化到具有未知转移和奖励动态的未见任务,在标准基准测试中优于当前的最先进 Meta-RL 方法。
作者总结道,虽然 GLiBRL 目前的策略学习是无模型的,但其学习到的转移和奖励模型使其非常适合未来与基于模型的规划集成,前提是解决从高维威沙特分布采样时的计算瓶颈。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。