想象你正在教一只机器狗如何行走。在人工智能领域,这被称为“强化学习”。机器狗尝试不同的动作,表现良好时获得“分数”(奖励),并从错误中学习。
目前大多数方法就像是一个只关注下一步的学生。如果机器狗向前迈了一步并获得了好分数,它就会学会重复这个特定动作;如果它迈了一步却得到坏分数,它就会学会避免这个特定动作。这种方法非常局部、非常谨慎,有时甚至会陷入低效小动作的循环中。
本文介绍了一种名为SAVGO(状态 - 动作值几何优化)的新方法。以下是其工作原理,通过简单的类比来说明:
1. “心智地图”(几何结构)
想象机器狗脑海中有一张巨大的、无形的三维地图。在这张地图上,机器狗可能做出的每一个动作都是一个点。
- 旧方法:机器狗只是逐个查看这些点。“点 A 给了我奖励,点 B 给了我电击。”
- SAVGO 方法:机器狗学会让分数相似的点在地图上彼此靠近,而分数差异很大的点则彼此远离。
SAVGO 教导机器狗根据动作的“好坏”来排列这些点。如果两种不同的腿部动作都能带来出色的行走效果,机器狗就会学会在它们的心智地图中将这两个点紧邻放置。如果一个动作很棒而另一个很糟糕,它就会将它们推到地图的两侧。
2. “群体投票”(策略更新)
这是最重要的一部分。当机器狗需要决定下一步做什么时,它不会只挑选一个单一动作并试图对其进行微调。
相反,它会玩一场"群体投票"的游戏:
- 它选择一个“候选”动作(随机猜测)。
- 它询问它的心智地图:“谁还站在这个候选动作附近?”
- 它聚集一组相似的动作(邻居),并问它们所有人:“我们有多好?”
- 它计算整个群体的加权平均值。
类比:
想象你正在寻找城市里最好的餐厅。
- 旧方法:你挑选一家餐厅,品尝食物,如果好吃,下次就去那里;如果难吃,就再也不去。
- SAVGO 方法:你挑选一家餐厅,但随后你会查看它所在的街区。你会问:“附近还有其他评分很高的餐厅吗?”如果整个街区都充满了五星级餐厅,你就知道身处一个“优质区域”。于是,你会将决策导向整个区域,而不仅仅是你挑选的那个单一地点。
3. 为什么这很重要
本文在非常困难的任务上测试了这种方法,例如让数字人类行走(称为“人形机器人”)或让数字蚂蚁移动。这就像在走钢丝的同时还要玩杂耍;有成千上万种微小的失败方式。
- 结果:由于 SAVGO 观察了优质动作的“形状”(几何结构),并从一整组相似的候选动作中学习,因此它比旧方法学习得更快且更稳定。
- 局限:执行这种“群体投票”需要更多的计算能力,因为它必须同时检查许多候选动作。然而,本文表明,对于最困难的任务,额外的努力是值得的,因为机器狗的学习效果要好得多。
总结
SAVGO 就像是将机器人的学习风格从“死记硬背具体答案”升级为“理解优质答案的全貌”。它不再只是朝着正确的方向迈出一小步,而是审视整个优质可能性的山丘,并更自信地向顶峰攀登。
本文并未声称:
- 它尚未声称适用于带有按钮的电子游戏(如 Atari);它专注于行走或奔跑等连续动作。
- 它并未声称能解决所有机器人问题;它专门帮助那些拥有多种不同移动方式的机器人(高维任务)。
- 它未提及医疗或临床用途;它纯粹是关于在计算机模拟中训练机器人。
以下是论文《SAVGO:利用余弦相似度学习状态 - 动作值几何以进行连续控制》的详细技术总结。
1. 问题陈述
深度强化学习(RL),特别是像 SAC 和 TD3 这样的离线策略演员 - 评论家(off-policy actor-critic)方法,已在连续控制领域取得成功,但在高维环境中仍受限于样本效率低下和不稳定性。
- 当前局限: 虽然表示学习(例如对比学习)提高了数据效率,但它通常被视为辅助任务。策略更新步骤通常依赖于局部梯度下降,忽略了所学潜在空间的全局几何结构。
- 差距所在: 现有的基于相似度的方法通常使用距离来正则化表示或塑造值目标,但它们很少将这些几何关系作为一等公民算子(first-class operators)来直接指导动作空间中的策略更新。因此,策略改进仍然是局部的,且受全局值景观的启发较弱。
2. 方法论:SAVGO
作者提出了状态 - 动作值几何优化(SAVGO),这是一种几何感知的离线策略演员 - 评论家算法,它将基于值的相似性明确地整合到策略更新机制中。
A. 值感知状态 - 动作几何学习
SAVGO 学习一个状态 - 动作对 (s,a) 的联合嵌入空间,其中几何距离(具体为余弦相似度)反映了预期效用(Q 值)的相似性。
- 编码器: 神经网络 zψ(s,a) 将状态 - 动作对映射到 d 维嵌入空间。
- 目标构建: 对于任意两个状态 - 动作元组 (si,ai) 和 (sj,aj),基于它们 Q 值的差异计算归一化值间隙 Δi,j。
- 曲率映射: 该值间隙通过有界曲率变换映射为目标余弦相似度 Yi,j:
Yi,j=1−2(Δi,j)λ
其中 λ 控制敏感度。小间隙(相似值)映射为高相似度(≈1),而大间隙映射为低/负相似度。
- 损失函数: 编码器被训练以最小化嵌入预测的余弦相似度与目标 Yi,j 之间的回归损失。这迫使嵌入空间组织成:具有相似值的动作在单位超球面上聚集在一起。
B. 几何感知策略改进
SAVGO 不执行标准的逐点梯度更新,而是对候选动作执行相似度加权聚合。
- 采样: 对于给定状态 st,从当前策略中采样一个“锚点”动作 a^t。此外,从提议分布中采样 K 个候选动作 {atk}。
- 嵌入与评分: 锚点和候选动作均通过 zψ 进行嵌入。候选动作使用保守的评论家估计(minQ)进行评分。
- 核加权: 锚点嵌入与候选嵌入之间的余弦相似度通过温度控制的 softmax 转换为概率分布(相似度核):
wk=(1−ϵ)∑exp(…)exp(cos(ζ^t,ζtk)/ρ)+Kϵ
这为每个候选动作生成了一个权重 wk,该权重基于其在值感知空间中与锚点的几何邻近度。
- 聚合更新: 策略被更新以最大化相似度加权的值估计:
Q^(st,a^t)=k=1∑KwkQ(st,atk)
这使得策略能够被拉向高值区域,这些区域在原始动作空间中可能并不直接相邻,但在所学的值几何中是“接近”的。
3. 主要贡献
- 统一目标: 提出了 SAVGO,将表示学习、值估计和策略优化统一为单一的几何一致目标,超越了将表示学习仅视为正则化器的做法。
- 新颖策略算子: 推导了一种几何感知的策略改进算子,利用学习到的余弦相似度对候选动作进行加权,使策略更新由全局值结构而非仅仅是局部梯度引导。
- 实证验证: 在 MuJoCo 基准测试上展示了相对于强基线(SAC、TD3、TQC、PPO)的一致改进,特别是在高维任务中。
4. 实验结果
该方法在 MuJoCo v5 连续控制套件上进行了评估,固定环境步数预算为 100 万步。
- 性能: SAVGO 在整个套件中实现了最高的总奖励,在具有挑战性的高维任务上取得了最显著的收益:
- Humanoid: SAVGO(7687)显著优于 TQC(6330)和 SAC(5351)。
- Walker2d: SAVGO(5626)优于 TQC(4952)和 SAC(4693)。
- Ant & HalfCheetah: 性能具有竞争力或更优,且方差降低。
- 样本效率: 与基线相比,SAVGO 展现了更快的早期学习和更平滑的收敛。
- 消融研究:
- 曲率(λ): 1.0–1.5 左右的值在稳定性和性能之间提供了最佳权衡。
- 候选数量(K): 中等值(例如 Humanoid 任务中 K=128)产生了最佳结果;候选过少会增加方差,而过多则收益递减。
- 组件必要性: 移除自适应温度、表示损失(冻结编码器)或自适应值缩放均导致性能显著下降。将相似度核替换为均匀权重会导致算法崩溃,证明了几何感知加权的必要性。
5. 意义与局限性
意义:
- 弥合差距: SAVGO 成功弥合了表示学习与策略优化之间的差距,表明潜在空间的几何结构可以直接被利用以改进决策。
- 鲁棒性: 通过对多个候选动作进行基于值 - 相似度的加权聚合,该方法比标准的基于梯度的更新对评论家噪声和局部极小值更具鲁棒性。
- 可扩展性: 它在增加可控计算开销(与 K 成线性关系)的同时,保留了离线策略演员 - 评论家方法的可扩展性。
局限性:
- 计算成本: 该方法需要为每个状态评估 K 个候选动作,使其比标准 SAC/TD3 更慢(实验中 100 万步约需 8 小时,而标准方法为 2 小时)。
- 评论家依赖性: 该方法假设评论家能提供相对一致的排序;严重的评论家噪声可能会破坏相似度权重的稳定性。
- 离散动作: 将其扩展到离散动作空间(例如 Atari)并非易事,因为难以定义连续候选提议以及不连续动作的状态 - 动作几何。
总之,SAVGO 通过将值函数的“形状”作为策略改进的直接驱动力,代表了连续控制领域的重大进步,从而在复杂的高维环境中实现了卓越的性能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。