Where Entropy Is Measured Matters: Policy Geometry in Bounded Continuous-Control PPO
本文表明,在有界连续控制的 PPO 中,熵的测量位置(潜空间与执行动作空间)的选择会通过引入截然不同的均值-方差耦合,从根本上改变学习到的策略几何结构,从而显著影响动作在边界附近的聚集频率,并最终影响任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,有一个分支专门致力于教机器如何与物理世界进行移动和交互。这个被称为“连续控制”(continuous control)的领域,要求计算机通过试错法来学习如何行走、奔跑或站立,就像孩子学习平衡一样。为了实现这一点,计算机使用一种被称为“策略”(policy)的数学指南,根据它所看到的内容来建议下一步采取什么行动。几十年来,这种指南的标准工具是一个钟形曲线,这是一种统计学上的形状,它在建议一个最可能的动作时,同时也允许一定的随机变化。然而,现实世界是有极限的。机器人的腿不能向后弯曲超过某个点,肌肉也不能产生无限大的力量。当计算机平滑且无界的建议撞上这些硬性的墙壁时,这些建议被迫被截断或压缩以适应范围。长期以来,研究人员一直假设,如果机器人表现良好,那么它如何处理这些极限的细节并不重要。他们只关心最终得分:机器人走得快吗?它站得稳吗?
一项新的研究通过观察计算机在模拟具有八十块肌肉的人类腿部进行行走学习时的内部思维过程,挑战了这一假设。研究人员发现,计算机衡量自身不确定性的方式改变了它所学习路径的形状。他们发现,当计算机被允许以一种忽略机器人物理极限的方式来表现出不确定性时,它会学习将自己的动作推向其允许范围的边缘。这就像机器人不断地将手压在盒子的边缘,即使它完全可以站在中间。这种行为并非由机器人的肌肉动作缓慢或极限过紧引起的。相反,这是由于学习算法计算其自身的“好奇心”或随机性的方式直接导致的。研究表明,如果你改变这种好奇心衡量的位置——是从计算机内部无界的思想中,还是从机器人采取的实际物理动作中进行衡量——机器人会学习到完全不同的几何结构。它不再挤压墙壁,而是学会了舒适地停留在中心,同时实现了相似甚至更好的性能。
这项调查始于一个复杂的模拟人体腿部,该腿部配备了八十块不同的肌肉,任务是行走。研究人员使用一种流行的学习方法训练了一个人工智能,使这条腿能够运动。他们观察到一个奇怪的现象:计算机正在成功学习行走,但它是通过发送几乎总是处于肌肉极限边缘的指令来实现的。大约百分之八十九的时间里,肌肉指令都处于其最大或最小极限的百分之五以内。这看起来就像行走的个体一直在与其自身的约束进行对抗。团队首先怀疑这是一个物理问题,也许是由肌肉自然激活和去激活的方式,或者是模拟器过滤信号的特定方式引起的。他们通过改变模拟器的物理特性(使激活时间对称并移除过滤器)来测试这些想法。这些改变都没有解决问题。机器人仍然在挤压墙壁。这排除了物理世界作为诱因的可能性,并将矛头指向了学习算法本身。
为了理解机器人为何会有这种行为,研究人员将问题分解为两个部分:机器人想要移动的平均方向,以及它在该方向上增加的随机性或变化量。他们提出了一个简单的问题:机器人靠近墙壁是因为它在胡乱猜测,还是因为它在刻意瞄准墙壁?通过对完全相同的时刻进行反事实测试,他们发现,即使他们移除了所有的随机性并强迫机器人完美地遵循其平均计划,它仍然想要靠近墙壁。事实上,平均计划本身经常指向运动的可能范围之外,从而迫使计算机将动作裁剪到最近的极限。机器人的“思想”是外扩的,将其预期的动作推向了边界之外,而物理极限只是捕捉到了它们。这意味着仅仅告诉机器人减少随机性并不能解决问题;机器人需要从一开始就学会瞄准中心。
解决这一问题的关键在于计算机如何衡量其自身的不确定性。在标准设置中,计算机根据其在转化为物理动作之前的内部、无界的思想来计算其随机性。在这个内部空间中,数学处理中心和边缘是等同的,没有理由远离墙壁。然而,研究人员意识到,如果计算机在动作被转化为物理世界之后再衡量其不确定性,数学将会发生变化。因为物理世界有硬性限制,空间的边缘看起来与中心不同。当计算机在物理空间中计算其不确定性时,数学会自然产生一种力量,将平均动作从墙壁拉开并向中间靠拢。这是一种视角的微妙转变:在产生噪声的地方进行测量,而不是在产生噪声的地方进行测量。
为了测试这一点,研究人员在同一个行走任务上运行了三个不同版本的学习算法。在第一个版本中,计算机在其内部思想中衡量不确定性。在第二个版本中,它不衡量任何不确定性。在第三个版本中,它在物理动作中衡量不确定性。结果令人震惊。那个在内部思想中衡量不确定性的版本学会了变得非常随机,并保持其动作挤压在墙壁上。那个不衡量不确定性的版本学会了变得非常精确,但仍然瞄准墙壁附近。只有那个在物理动作中衡量不确定性的版本,学会了让其平均动作舒适地停留在允许范围的中心。这个版本拥有最“内部”的几何结构,这意味着机器人并没有在与其极限对抗。
随后,团队在另一个完全不同的任务上重复了实验:教一只模拟狗站起来。这个任务涉及三十八个不同的关节,并使用了不同的软件代码库,以确保结果不是第一个模拟实验中的偶然现象。同样的模式出现了。在物理动作中衡量不确定性的版本学会了保持动作居中,而其他版本则向边缘漂移。这证实了该发现并非特定于行走腿或第一个软件。研究人员还测试了仅仅通过直接惩罚来告诉计算机瞄准中心是否有效。他们发现,虽然直接惩罚也可以将机器人推向中心,但它在随机性和整体性能方面创造了另一种行为。这表明,在物理空间中衡量不确定性是解决该问题的一种有效方法,但不是唯一的方法;它自然地耦合了机器人的目标与变化,然而,其产生的随机性与性能之间的平衡,与实现相同中心化目标的其他方法相比,可能会有显著差异。
该研究得出结论,对于在现实世界中学习移动的机器人来说,选择在哪里衡量不确定性是一个至关重要的设计决策。仅仅在任务中获得高分是不够的;机器人学习移动的方式对于其稳定性和安全性至关重要。如果机器人学会了不断挤压其极限,它可能会变得脆弱,或者在环境发生微小变化时容易失效。通过在物理空间中衡量不确定性,机器人学会了一种使其保持安全和居中的几何结构。这一见解表明,教导机器人移动的标准方式可能需要更新。与其在学习过程中忽略物理极限,不如让算法考虑到这些极限,从而确保机器人学会以一种自然的、居中的优雅姿态移动,而不是始终带着一种持续的、挣扎的推挤感。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。