Generalization in offline RL: The structure is more important than the amount of pessimism
本文认为,在离线强化学习中,成功的泛化取决于悲观价值函数相对于最优解对称性的结构对称性,而非悲观程度本身,并证明了通过在策略提取过程中利用一致性损失来强制执行对称性,比标准的数据增强能产生更好的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心思想:不在于你推得有多用力,而在于你如何站立
想象你正在教一个机器人玩“到达中心”的游戏。这个机器人有一个肩膀和一个肘部,它需要移动它的手去触碰一个绿色的目标。
在**离线强化学习(Offline Reinforcement Learning)**中,机器人无法实时参与游戏。相反,它只能通过研究一本由别人制作的巨大相册(数据集)来学习。问题在于,这本相册可能缺少某些动作的照片,或者照片可能是模糊的。如果机器人在面对从未见过的全新情况时试图猜测该怎么做,它可能会变得过度自信,从而犯下严重的错误。
为了防止这种情况,大多数研究人员教机器人变得悲观(Pessimistic)。在这里,把“悲观”理解为一种“安全制动”。机器人被告知:“如果你不能百分之百确定这个动作以前是否成功过,那就假设它会失败,并给它一个非常低的分数。” 这能防止机器人变得过度自信。
普遍的观点:
一段时间以来,人们一直认为:“机器人越是悲观(谨慎),它的泛化能力就越差。” 这种想法是:如果你把安全制动踩得太死,机器人就会变得过于胆小,不敢学习任何新事物,从而无法适应新环境。
论文的发现:
这篇论文指出,踩刹车的力度并没有那么重要,重要的是刹车是如何构建的。
作者说:结构比悲观的程度更重要。
结构比悲观的程度更重要。
类比:旋转桌子
为了证明这一点,研究人员使用了一个特定的环境,称为**“旋转机械臂(Rotational Reacher)”**。
想象一张圆桌,中心有一个目标。
- 对称性: 无论这张桌子旋转 90 度、180 度还是 360 度,情况都是一样的。物理规则保持不变。如果机器人知道当桌子面向北时如何到达中心,那么逻辑上它也应该知道当桌子面向东时如何到达中心。这被称为对称性(Symmetry)。
- 训练: 机器人只能看到桌子处于四个特定位置的照片:北、东、南、西(每 90 度一个步长)。
- 测试: 然后,机器人将在任何角度(比如 45 度或 13 度)旋转的桌子上接受测试。
两种类型的“悲观”
研究人员测试了将“安全制动”(悲观主义)应用于机器人学习的两种不同方式。
1. “对称型”制动(好的类型)
想象机器人有一本尊重圆桌规则的规则手册。如果机器人学到“动作 A 在桌子向北时是有风险的”,它的规则手册会自动说:“好吧,那么动作 A 在向东、向南和向西时也是有风险的。”
- 结果: 即使机器人极其悲观(它认为几乎所有动作都是危险的),它仍然能学会正确的模式。因为它的“恐惧”与世界的形状是一致的,所以它能完美地泛化。它可以处理 45 度的桌子,因为它的逻辑在旋转下依然成立。
2. “非对称型”制动(坏的类型)
现在,想象机器人有一本错误的规则手册。它学到“动作 A 在桌子向北时是有风险的”,但它却没意识到这种风险也应该适用于向东的位置。也许它认为向东的位置是安全的,尽管两者的物理特性完全相同。
- 结果: 即使机器人仅仅是轻微悲观(它几乎没有表现出谨慎),它也会失败得很惨。因为它的“恐惧”是破碎的,且不符合桌子的对称性,所以当桌子旋转到新角度时,它会感到混乱。它之所以犯错,是因为它的内部逻辑是不一致的。
主要结论
这篇论文证明了一个反直觉的事实:
- 一个极其悲观但对称(一致)的机器人将会成功。
- 一个轻微悲观但非对称(不一致)的机器人将会失败。
教训是: 机器人的恐惧程度并不重要;重要的是它的恐惧是否符合世界的规则。
解决方案:“一致性”训练
由于机器人的“恐惧”(价值函数)是从数据中学习到的,而数据可能是混乱或不完整的,机器人可能会在无意中学会一本破碎的、非对称的规则手册。
论文提出了一种名为**数据增强一致性(Data Augmentation Consistency, DAC)**的修复方法。
- 旧方法: 你把照片旋转一下,然后把它们加入相册,接着让机器人正常地学习这个更大的相册。
- 新方法(论文的建议): 你训练机器人,但在最后添加一个特殊的“一致性检查”。你给机器人看一张桌子向北的照片,然后给它看同一张照片旋转到向东后的样子。你告诉机器人:“你对向北照片的回答和对向东照片的回答必须完全一样。”
如果机器人试图给出不同的答案,你会惩罚它。这迫使机器人去学习世界的对称性,无论它有多么悲观。
实验结果
研究人员在两个流行的机器人学习算法(IQL 和 CQL)上测试了这一点。
- 他们发现,仅仅增加更多数据(旧方法)只有微小的帮助。
- 但强制机器人保持一致性(新方法)帮助最大。机器人变得能够更好地处理它从未见过的角度。
一句话总结
在离线机器人学习中,不在于你有多谨慎,而在于确保你的谨慎遵循着你试图掌握的世界的规则。如果你的“恐惧”与世界的形状保持一致,你可以尽情地保持谨慎,并且依然能取得成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。