← 最新论文
🤖 machine learning

Reinforcement Learning for Real-Time Vision-Language-Action Policies

本文介绍了 Real-Time EXPO-FT,这是一个强化学习框架,它通过将缓慢且具有表现力的动作生成与快速且反应式的动作编辑解耦,使得大型视觉-语言-动作模型能够在存在推理延迟的情况下,实现针对现实世界动力学的样本高效且高性能的适应。

原作者: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直难以像生物那样灵活地运动。虽然它们可以被编程为在工厂中遵循一套僵化的指令,但现实世界是混乱、不可预测且瞬息万变的。为了应对这一挑战,研究人员转向了一种被称为“视觉-语言-动作模型”(vision-language-action model)的类型的人工智能。这些是基于海量数据训练的庞大计算机程序,使它们能够通过摄像头理解所见之物,阅读文本指令,并决定如何移动机械臂。它们之所以强大,是因为它们见过许多关于世界运作方式的例子,就像一座庞大的经验图书馆。然而,这里有一个显著的问题:由于这些模型如此庞大且复杂,它们需要花费明显的时间来“思考”。在计算机处理图像并决定动作的短短一瞬间,物理世界已经发生了变化。如果机器人试图接住一个球或平衡一个物体,等到它实际做出动作时,它用来做决策的信息已经过时了,这往往导致行动失败。

斯坦福大学的一个研究小组开发出一种新方法,教导这些大型模型如何在实时环境中行动,即使它们的思考速度较慢。他们的方法被称为 Real-Time EXPO-FT,通过将机器人的决策过程拆分为两个截然不同的部分,解决了延迟问题。他们并没有强迫这个庞大且缓慢的模型去做出每一个细微的瞬间调整,而是让它负责完成规划大致路径的繁重任务,同时由一个更小、更快的计算机程序来处理即时的修正。想象一下指挥家带领管弦乐队:指挥家设定整体的节奏和旋律,但每位乐手必须立即调整自己的演奏以保持同步。在这个系统中,大型模型充当指挥家,根据它刚才看到的景象提出一系列动作方案。然后,一个轻量级的助手观察世界的当前状态,并对这些提议的动作进行快速、微小的编辑,以确保这些动作在机器人需要行动的精确时刻仍然是正确的。这使得机器人能够利用大型模型的深厚知识,而不受其缓慢思考速度的限制。

研究人员在两种完全不同的环境中测试了这种方法:一个物理模拟世界和一个真实的物理世界。在模拟中,他们向机器人提出了十个不同的动态任务,例如在盘子上平衡一个球、在避开防守队员的同时踢足球,以及接住一个移动的物体。他们将这种新方法与几种试图处理延迟的现有技术进行了对比。结果非常明确:新方法让机器人在几乎每一次尝试中都取得了成功,表现优于所有其他方法,包括那些甚至不需要处理延迟的方法。这是一个重要的发现,因为它表明,通过显式地教导系统去应对自身的迟缓性,机器人可以变得比那些理论上更快但适应性较差的系统更加可靠。

为了证明这在现实世界中有效,团队将机器人移至实验室环境,并给了它四个需要持续、快速反应的挑战性任务。这些任务包括:在旋转盘上保持乒乓球平衡、从旋转表面拿起一个方块、接住另一个机械臂传过来的物体,以及在防守队员移动时将球踢进球门。研究人员将训练时间限制在仅为机器人与环境交互的十分钟内,确保系统可以快速学习,而无需进行无休止的练习。在使用该方法之前,机器人在这些任务上的成功率相当低,平均约为 42%。在使用这种新的实时训练框架后,成功率跃升至 97%。机器人学会了适应物体的混乱运动和任务的时间限制,且在整个训练过程中无需任何人工干预。

该研究还探讨了系统在不同条件下的表现。当研究人员人为增加了机器人思考过程中的延迟时,新方法保持了其高水平的表现,而其他方法则随着延迟的增加而失败。同样,当移动物体的速度增加时,使用该新框架的机器人继续取得成功,而其他方法则难以跟上。这表明该系统不仅仅适用于特定的速度或延迟,而且足够鲁棒,能够处理动态环境中的不可预测性。研究人员指出,虽然他们的系统非常有效,但它仍然依赖于人类在任务结束后重置机器人,并且需要为每个任务定义特定的成功标准。然而,核心成就在于展示了大型、强大的 AI 模型可以被应用于实时环境,从而弥合了人工智能缓慢、深思熟虑的规划能力与物理世界快速、反应式需求之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →