← 最新论文
💻 computer science

Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy

本文提出了双重潜在空间强化学习(Dual-Latent Space Reinforcement Learning, DLSRL),这是一种通过结合初始噪声引导与通过冻结生成器进行的中间特征调制来增强预训练生成式机器人策略的新型框架,从而在无需更新基础策略的情况下实现高效的在线自适应。

原作者: Pengfei Zhang, Teng Sun, Xianchao Xiu

发布于 2026-09-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengfei Zhang, Teng Sun, Xianchao Xiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够通过观察人类执行任务来学习的机器人不再是科幻小说中的情节,而是人工智能领域中一个快速增长的现实。这些系统通常被称为视觉-语言-动作模型(vision-language-action models),它们就像是在动手接触任何工具之前,就已经阅读了大量教学视频和手册的学生。通过研究数百万个案例,它们学习了如何移动手臂、抓取物体以及遵循指令的一般规律。然而,正如一名学生在被要求在略微不同的房间或使用新工具执行熟悉任务时可能会感到吃力一样,当现实世界与它们训练时的数据不完全匹配时,这些机器人往往会出错。当机器人遇到从未见过的场景时,它需要快速适应。科学家面临的挑战在于,如何教导这些庞大的、预训练好的系统去适应新环境,而无需从头开始重新训练——因为重新训练的过程对于实际应用来说太慢且计算成本过高。

一段时间以来,研究人员一直试图通过微调决策过程的最开始部分来引导这些机器人。想象一下,一个机器人通过从随机的噪声模式开始,逐渐将其细化为平滑运动的过程来生成一系列动作。现有的方法专注于改变那个初始的随机模式,以引导机器人获得更好的结果。虽然这有所帮助,但有点像仅仅通过调整车轮的初始位置来驾驶汽车;一旦汽车开始行驶,驾驶员就没有直接的方法来纠正车辆偏离航线的情况。机器人的运动“思维”保持不变,初始的调整无法轻易纠正随后发生的微小、精确的误差。这种局限性意味着,即使经过引导,机器人可能仍然无法胜任需要高精度的任务,例如将杯子放在茶托上或拧紧螺栓。

为了解决这个问题,上海大学的一个研究小组开发了一种名为“双潜空间强化学习”(Dual-Latent Space Reinforcement Learning)的新方法。该系统不再仅仅调整机器人运动计划的起点,而是学习在计划创建的过程中“轻推”机器人的内部思维。研究人员构建了一个轻量级的控制模块,与机器人冻结的、预训练好的大脑协同工作。这个模块同时做两件事:它既像之前的方法那样选择初始起始模式,又生成第二个信号,直接注入到机器人处理网络的中间层。这可以想象成拥有一位副驾驶,他不仅帮助设定目的地,还能在汽车行驶过程中,伸手对方向盘和踏板进行细微的实时调整,确保车辆始终保持在所需的精确路径上。

研究人员在各种机器人任务中测试了这种方法,包括在模拟环境中提升物体、移动罐子和堆叠积木。他们将这一新系统与仅调整起始点的现有最佳方法进行了对比。结果显示,这种双重控制系统让机器人学习得更快。在需要高精度的任务中(例如将罐子移至特定位置),新方法达到了接近99%的成功率,而旧方法则难以突破90%。机器人能以更少的尝试来适应新的挑战,这意味着它们能更高效地从错误中学习。研究还表明,这种方法适用于不同类型的机器人大脑,而不仅仅是一种特定的设计,这表明它是一个提高机器人性能的通用工具。

这项发现的一个关键部分在于理解这种内部“轻推”应该产生多大的影响。研究人员发现,如果他们过度推动机器人的内部思维,动作会变得不稳定且紊乱。然而,如果施加恰到好处的、温柔的压力,机器人的表现就会稳步且平滑地提升。这种平衡让机器人能够保留已经学到的通用技能,同时进行针对新任务所需的特定、精细的修正。该系统在没有改变庞大的预训练模型本身的情况下实现了这些结果,保持了核心机器人大脑的完整性,仅更新了这个小型、轻量级的控制模块。这意味着机器人可以在新场景中部署,并能够即时学习适应,而无需对其底层智能进行彻底的改造。

这项工作的意义对于机器人的未来具有重大影响。通过允许机器人在生成运动的过程中进行精确调整,这种方法弥合了广泛的通用知识与现实世界所需的特定、细腻动作之间的鸿沟。研究人员通过广泛的模拟证实了他们的发现,表明该方法在多个任务中始终优于以往的技术。虽然这项工作是在计算机模拟中进行的,但其适应的速度和效率表明,这些机器人很快就能部署在现实世界的环境中,以一种此前难以实现的灵巧度来处理新的物体和环境。研究结论指出,通过赋予机器人一种引导其内部表征的方式,我们可以创造出不仅聪明而且灵活、并能应对物理世界不可预测性的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →