← 最新论文
💻 computer science

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

该论文介绍了 StructRL,这是一种针对基于流(flow-based)的视觉-语言-动作模型的强化学习框架,它通过将结构化随机性通过确定性 ODE 解码器和最后一步重放直接重新定位到动作空间,克服了现有方法存在的“结构化噪声稀释”问题,从而显著提高了机器人在操控任务中的探索效率和分布外性能。

原作者: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够理解人类语言并遵循复杂指令的机器人不再仅仅是科幻小说中的梦想;它们正在世界各地的实验室中成为现实。这些被称为“视觉-语言-动作”(Vision-Language-Action)模型的系统,充当了机器人的大脑,接收机器人所看到的画面和人类所说的话,然后决定如何精确地移动其手臂和双手以完成任务。为了使这些动作平滑且精准,研究人员通常使用一种类似于雕塑家精雕细琢一块粘土的技术。计算机从一个关于机器人应该如何行动的粗糙、带有噪声的猜测开始,然后逐步进行清理,直到产生一个完美、流畅的动作。这个过程非常强大,但当机器人试图自主学习新任务时,它会遇到障碍。为了学习,机器人必须进行探索,尝试不同的动作以观察哪些有效,哪些失败。然而,如果机器人试图通过在其动作的清理过程中加入随机抖动来进行学习,那么清理这些动作的行为本身可能会在机器人尝试这些动作之前,就意外地将这些抖动抹平。结果,机器人的探索要么过于随机而毫无用处,要么过于混乱而不安全。

一组研究人员发现了一种更好的方法,来教这些机器人如何从自身的错误中学习。他们发现,问题不在于添加噪声以鼓励探索的想法本身,而在于添加噪声的“位置”。在以往的方法中,随机变化是在清理过程的早期阶段注入的,结果在随后的动作精炼步骤中被部分抵消了。研究人员将这种现象称为“结构化噪声稀释”(structured noise dilution),即那些特定的、有益的探索模式在能够影响机器人的实际行为之前,就被洗刷掉了。为了解决这个问题,他们开发了一种名为 StructRL 的新方法。与其在计算机还在构思动作的过程中添加噪声,不如让计算机先完成它的工作,生成一个干净、完美的运动计划。只有在那个计划完成后,他们才直接向最终的运动中添加必要的变量。这确保了机器人实际上尝试了新的、略有不同的动作,而不是这些动作被计算机的内部计算给平滑掉了。

使这一方法奏效的关键在于意识到机器人的运动具有一种经常被随机噪声忽略的特定结构。机器人的手臂以三种截然不同的方式运动:它在空间中移动位置,它旋转方向,以及它开合抓取器。这三种运动类型是相互独立的:一次微小的位置偏移可能是安全的,而类似规模的旋转可能就很危险,且抓取器需要完全不同种类的控制。研究人员设计了他们的新方法,以尊重这些差异。他们添加了随时间平滑变化的噪声,这样机器人就不会前后剧烈抖动,并且他们针对运动的每个部分采用了不同的噪声比例。这意味着机器人可以在保持旋转和抓取器动作更加谨慎和受控的同时,拥有更宽广的探索位置范围。通过保持计算机内部的清理过程是确定且可预测的,并且仅在最后阶段引入必要的随机性,研究人员确保了机器人的探索既安全又有效。

该团队在多种模拟任务以及实验室中的真实机器人手臂上测试了这种新方法。在模拟实验中,机器人被要求执行复杂的操纵任务,例如拿起物体、将物体移动到特定位置以及组装零件。结果显示,新方法具有明显的优势。在一系列具有挑战性的长程任务(long-horizon tasks)中,使用新方法的机器人实现了接近 99% 的成功率,显著优于那些在清理过程中添加噪声的旧方法。当机器人面临从未见过的场景,例如物体被放置在新的位置或处于不同的光照条件下时,这种进步更为显著。使用新方法训练的机器人能够更快地适应,以更少的尝试学会应对这些突发变化。这表明,保留探索的结构对于帮助机器人将技能泛化到混乱、不可预测的现实世界中至关重要。

为了证明这在计算机之外同样有效,研究人员将他们表现最好的模型安装在实验室的一个物理机器人手臂上。他们给了机器人两个具体的挑战:拿起一根香蕉并将充电器插入墙上的插座。最初,机器人只见过这些任务的几次演示,在被要求独立完成时完全失败了。研究人员随后让机器人通过试错法进行学习,使用了这种新的结构化探索方法。对于香蕉任务,在经过仅一小时的在线学习后,机器人在拿起水果任务上的成功率达到了 84%,而使用旧的、缺乏结构的探索方法的机器人成功率仅为 56%。对于需要精细动作来对准插头与插座的充电器任务,新方法使机器人达到稳定成功状态的时间比旧方法快了大约五分钟。这些现实世界的结果证实,理论上的改进直接转化为物理机器更快速、更可靠的学习。

这项工作的成功凸显了我们教机器人学习方式的一个根本转变。它表明,机器人如何探索其环境与其用于决策的智能同样重要。通过理解机器人的内部“思考”过程应当保持稳定和可预测,而“行动”过程才是进行实验的地方,研究人员可以创造出学习效率更高、更安全的系统。研究结果表明,为了让机器人真正掌握现实世界任务所需的复杂、连续的运动,我们不能再将它们的动作视为一系列随机的猜测,而应将其视为结构化的、有目的性的实验。这种方法不仅让机器人更好地遵循指令,还赋予了它们自主理解新指令的能力,这是迈向能够真正协助我们日常生活的机器的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →