Privileged observations enable rapid and reliable policy discovery directly in the physical world
本文表明,对混沌物理系统的特权观测对于使强化学习智能体能够在现实世界中直接快速发现高性能策略至关重要,因为缺乏此类流场数据的智能体尽管成功学习了减阻策略,却未能学习到增阻策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下一名试图在水中游泳的游泳者。如果他们能看到周围环绕的湍流,他们可能会学会如何扭转身体,从而切开阻力,或者通过某种方式捕捉水流以推动自己前进。这正是主动流动控制(active flow control)的本质:在这个领域中,工程师们试图操纵那些看不见的、混沌的流体运动,以改善物体移动或保持静止的方式。几十年来,科学家们一直知道,在流体中旋转一个圆柱体可以改变水对它的推力。有时,稳定的旋转可以减少阻力,让物体更容易滑行;而另一些时候,特定的节奏性旋转实际上会增加阻力,从而阻碍物体的移动。挑战始终在于如何确定那种旋转的精确时机和速度,以获得最佳效果,尤其是因为水流是混沌且难以预测的。
通常,当工程师想要教计算机如何控制这样一个系统时,他们会建立一个虚拟的水流模型,并让计算机在其中进行练习。但虚拟模型永远不会是完美的,它们会遗漏真实水流中那些微小而混乱的细节。因此,苏黎世联邦理工学院(ETH Zürich)的一个研究小组决定完全跳过模拟过程。他们建造了一个物理水槽,并教会一个计算机智能体直接从真实的、翻腾的水流中学习。他们提出的问题既简单又深刻:为了学会如何控制水流,计算机是否需要在学习过程中看到物体周围旋转的水流?还是说,它仅仅通过感受物体受到的推力和拉力就能掌握其中的奥秘?
研究人员搭建了一个桌面级水槽,这是一个水流循环流动的透明水箱。圆柱体位于流场之中,电机可以使其以任何速度或方向旋转。为了测量水对圆柱体的推力大小,他们使用了一个灵敏的扭矩传感器。为了观察水流,他们使用了一种称为粒子图像测速技术(PIV)的方法。这涉及将一层激光片射入含有微小漂浮颗粒的水中,并拍摄快速照片。通过追踪这些颗粒在照片之间的移动,计算机可以构建出圆柱体后方水流速度和方向的详细实时图谱。这张图谱就是“特权观测”(privileged observation)——即在训练期间可以提供给计算机的额外信息,但在稍后阶段可能并不需要。
他们训练了一个通用型学习智能体(一种人工智能)来控制圆柱体。在其中一组实验中,智能体同时获得了阻力的“感觉”和水流的详细图谱。而在另一组实验中,智能体仅获得了阻力的“感觉”,水流图谱被隐藏了起来。目标有两个方面:首先,寻找一种旋转圆柱体的方法,以尽可能地减少阻力;其次,寻找一种旋转圆柱体的方法,以尽可能地增加阻力。
结果令人震惊,并揭示了一种出人意料的不对称性。当智能体能够获取水流的详细图谱时,它学得非常快。在与真实水流交互后的几分钟内,它就发现了一种能将阻力降低约32%的策略。它也迅速找到了一种增加阻力约25%的策略。这些数字匹配甚至略微超过了人类设计的最佳已知策略,而那些策略是经过数十年的研究才发展出来的。
然而,当研究人员隐藏了水流图谱,迫使智能体仅利用阻力测量值进行学习时,情况发生了变化。智能体仍然能够学会如何减少阻力,最终实现了约31%的减阻。只是它花费的时间更长,且表现出更大的波动性。但当目标是增加阻力时,智能体失败了。在没有看到水流的情况下,所有的训练运行都未能学会一种能显著增加阻力的策略。即使存在这种最优策略且在物理上是可行的,智能体也无法弄清楚如何让水产生更大的推力。
为了理解为什么会发生这种情况,研究人员仔细观察了水的运动状态。他们发现,每当圆柱体开始旋转时,无论目标是增加阻力还是减少阻力,水流几乎总是首先做出减小对圆柱体推力的反应。这种初始阻力的下降是自然的物理响应。对于试图减少阻力的智能体来说,这种初始下降是一个有用的信号,表明它正朝着正确的方向前进。但对于试图增加阻力的智能体来说,这种初始下降却令人困惑;它感觉像是朝着目标相反的方向在移动。如果没有详细的图谱来观察水流并理解阻力最终会上升,智能体就会陷入这种初始下降的陷阱中,从而无法学会正确的策略。
随后,研究人员测试了在拥有水流图谱时学到的策略是否可以在没有图谱的情况下使用。他们记录了智能体在拥有图谱时使用的精确旋转模式,然后将这些模式作为固定的序列重新播放,而不进行新的观察。令人惊讶的是,这些固定序列的表现与实时思考的智能体一样出色。智能体已经学会了一套极其有效的运动模式,以至于它不需要持续观察水流也能执行这些动作。这证明了水流图谱对于“执行”任务并非必需,但对于“发现”任务却是至关重要的。
这一发现强调了学习中的一个关键区别:你寻找解决方案时所需的信息,往往与你使用该方案时所需的信息不同。在这种情况下,丰富且详细的水流视图充当了老师的角色,引导智能体度过流体最初那段令人困惑的反应期。一旦智能体找到了正确的路径,它就可以在“蒙眼”的情况下行走。这项研究表明,在复杂的物理系统中,在学习阶段获取额外信息可能是成功与失败之间的决定性因素,即便这些信息在系统实际运行时是无法获得的。它表明,为了让人工智能掌握混乱且混沌的现实世界,它可能需要被允许看到比它实际使用时更多的信息。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。