← 最新论文
🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

本文提出了采样引导策略搜索(Sampling-Guided Policy Search, SGPS),这是一个将基于采样的模型预测控制与一阶策略优化相结合的框架,旨在高效训练用于复杂机器人运动与操纵任务的视觉策略,并实现向真实世界硬件的零样本迁移。

原作者: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够在崎岖地面行走、推动重物或在杂乱房间中穿行的机器人已不再是科幻小说中的情节,但教它们如何做到这一点却是一个艰巨的挑战。对于机器而言,要实现有效的移动,必须不断将其肢体与物理世界进行协调,精确决定何时以及何处放置脚或手。传统上,工程师们试图通过手动编程每一种可能的动作来解决这个问题,这是一个乏味的过程,且当机器人遇到意外情况时往往会失效。近来,科学家们转向了一种称为“强化学习”的方法,在这种方法中,机器人通过试错来学习,就像孩子学习走路一样。机器人尝试一种动作,观察自己是摔倒了还是成功了,然后调整其内部规则以在下次做得更好。然而,这种学习过程极其昂贵。它需要大量的计算能力和时间,尤其是当机器人必须学会通过摄像头而非仅仅依赖内部传感器来观察世界时。机器人必须学会将所见转化为物理动作,如果训练引导不当,这项任务往往会导致笨拙且非预期的动作。

耶鲁大学和悉尼大学的研究团队开发出一种新方法来解决这一问题,使机器人能够比以前更快、更可靠地学习复杂的视觉行为。他们创建了一个名为“采样引导策略搜索”(Sampling-Guided Policy Search)的系统。该系统并非让机器人在数百万次随机尝试中盲目徘徊,而是使用一种智能规划工具先生成一个正确动作的粗略草图。可以将这个规划工具想象成一位教练,他在脑海中进行快速模拟,以确定完成特定任务(如跨越障碍或推动板条箱)的最佳步骤序列。然后,机器人将此草图作为起点。研究人员发现,通过将这种初始引导与一种允许机器人直接从摄像头图像中学习的方法相结合,他们可以用以往所需时间的极小部分,训练出高能力的机器人。

他们发现的核心在于如何处理学习过程。在许多先前的尝试中,研究人员使用关于自身身体和环境的完美内部数据来训练机器人,然后尝试教第二个版本的机器人仅根据摄像头所见进行学习。这个两步走的过程很慢,且往往导致机器人无法应对现实世界的缺陷。这种新方法跳过了中间环节。它训练机器人直接从深度图像(显示物体距离远近的视觉数据)中学习,同时利用规划工具来优化机器人的目标。该系统以循环方式工作:生成一个目标动作,让机器人尝试跟随,然后利用规划工具在机器人稍微偏离轨道时纠正目标。这种不断的往复确保了机器人不仅学会模仿一条完美的路径,还学会了从错误中恢复并适应地形或所携带物体的重量变化。

研究人员在两种不同类型的机器人上测试了该系统:一种是四足狗形机器人,另一种是双足类人机器人。在模拟中,四足机器人学会了在平地上小跑、在低梁下爬行以及跳过障碍物。类人机器人学会了在地面上推动沉重的板条箱,并在慢跑时搬运箱子。令这些结果显得尤为出色的,是这些机器人仅使用一张显卡(一种在许多游戏电脑中都能找到的标准计算机硬件)就学会了这些技能。在过去,训练此类复杂行为可能需要庞大的超级计算机或数周不间断的模拟。而在这里,该系统在短短几小时内就学会了执行这些任务。研究人员还展示了规划工具不仅仅是提供一个起点,它在整个训练过程中都在积极改进学习过程,帮助机器人发现更高效的移动方式并避免陷入坏习惯。

为了证明这种方法在现实世界中有效,研究人员将训练好的软件安装在一个物理四足机器人上,而没有进行任何进一步的调整。这被称为“零样本迁移”(zero-shot transfer),意味着机器人从未见过真实世界,却能立即执行它在模拟中学到的任务。该机器人成功地在房间里小跑、在障碍物下爬行并在箱子上攀爬,同时仅依靠其车载摄像头来观察前进方向。它不需要外部传感器、动作捕捉相机或人工引导来导航。机器人自行决定何时降低身体以爬行,或何时抬起腿部以跳跃,能够对眼前的障碍物做出即时反应。这证明了学习过程创造了一种稳健的运动理解力,能够经受住现实世界混乱且不可预测的本质。

该研究还强调了以往方法为何失败。当研究人员尝试在没有规划工具引导的情况下训练机器人时,机器人经常会出现奇怪且不协调的动作。例如,当被要求小跑时,未经此类引导训练的机器人可能会以一种看起来完全不像正常步态的方式挪动脚步。规划工具充当了稳定器的角色,确保机器人在从一开始就学会正确的节奏和协调。这对于涉及与环境接触的任务(如推动重物)尤为重要。如果没有引导,机器人可能会向错误的方向推挤或失去平衡。有了引导,它学会了协调身体和手臂,从而平稳且高效地移动物体。

这项工作的显著之处之一在于如何处理视觉信息。机器人往往难以从摄像头图像中学习,因为将图像转化为物理指令的过程在数学上非常困难。研究人员通过将视觉处理与物理计算分离解决了这个问题。这使得机器人可以在不被摄像头运作方式的复杂数学问题困扰的情况下,从图像中学习。相反,它专注于学习观察内容与如何移动之间的关系。这种分离使训练过程更加快速且稳定,使机器人能够在慢跑时搬运箱子而不至于摔倒。

研究人员还探索了如何将不同的技能组合到单个机器人中。他们分别为小跑、爬行和跳跃训练了不同的“专家”,然后教导单个机器人如何自主切换这些行为。当机器人看到低梁时,它知道要爬行;当它看到障碍物时,它知道要跳跃。它不需要人类告诉它使用哪种模式,它只需观察世界并选择正确的行动。这种将不同行为组合成单一灵活系统的能力,是机器人技术迈出的重要一步。这意味着机器人未来可以潜在地在复杂环境中导航,在平地与障碍物之间切换,而无需为每种新情况编写新程序。

这种方法的成功预示了机器人技术的未来之路。通过使用规划工具来引导学习过程,研究人员可以比以前更快地教机器人执行复杂的物理任务。这种方法减少了对大规模计算能力的需求,并允许机器人直接从所见之物中学习。虽然目前的实验是在模拟环境和单个物理机器人上进行的,但结果表明,这种方法可以扩展到教导机器人执行更困难的任务,例如操作工具或在拥挤空间中导航。核心洞察在于,学习不必是对正确答案的盲目搜寻,它可以是一段由智能规划器引导寻找路径的旅程。

最终,这项工作证明了模拟与现实之间的差距可以比此前认为的更有效地被弥合。机器人不仅仅学会了模仿一条完美的路径;它们学会了适应、恢复并根据所见做出决策。那台曾经存在于模拟中的四足机器人,变成了一台能够在物理空间内自主移动的真实机器。它爬行、小跑和跳跃,展现出的流畅度表明它对自身身体及周围世界有着深刻的理解。这不仅仅是一项技术成就;它是迈向一个未来——在这个未来中,机器人可以自由且安全地在人类身边活动,处理那些既需要力量又需要灵巧度的任务。研究人员已经证明,只要有正确的引导,机器可以像我们在自然界中所习以为常的那样,拥有优雅与适应力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →