← 最新论文
🤖 machine learning

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP 引入了一种无需训练的机器人操控策略,该策略保持视觉语言模型冻结状态,并通过根据多视图观测在每 KK 步动态重写其自身的 Python 控制代码来实现闭环控制,通过过程中的失败恢复,实现了相比开环基准模型十倍的成功率提升。

原作者: Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器人领域,计算机能理解的内容与它实际能做到的事情之间存在着持久的差距。多年来,科学家们一直试图通过教机器人学习运动语言来弥补这一差距,强迫强大的人工智能模型去学习一套全新的、专门的运动指令词汇。这种方法需要海量的训练数据,并且往往会剥夺机器人的推理能力,使其沦为仅仅记忆特定动作而非理解情境的工具。最近的一个想法建议,与其教机器人一种新语言,不如让它说它最擅长的语言:计算机代码。通过要求人工智能编写一段简短的程序来告诉机器人如何移动,研究人员可以保持人工智能的推理能力完好无损。然而,这种方法的一个主要缺陷在于,程序是在机器人开始移动之前一次性编写完成的。如果机器人抓取失败或撞到了物体,程序仍会盲目运行,将错误延续到任务结束,且无法进行修正。

一项新的研究介绍了一个名为 VLCP 的系统,它通过允许机器人在工作过程中重写自己的指令,改变了游戏规则。研究人员构建了一个框架,其中一个冻结的、预训练的人工智能模型充当监督者。该系统并非在开始时发送一组单一的指令,而是每隔五十步暂停一次,通过摄像头和传感器观察机器人的当前状况。然后,它会要求人工智能根据刚才看到的景象,编写一个新的、简短的 Python 函数来处理接下来的五十步。如果机器人在前一个阶段未能拿起物体,人工智能会在图像中察觉到失败,编写一段新的代码来纠正操作方式,并在同一次尝试中再次尝试。这创造了一个闭环,即控制软件本身在实时被编辑,而不仅仅是调整机器人的动作。

研究人员在一个包含五十七种不同任务的模拟环境中测试了这个系统,任务范围从简单的物体抓取到厨房和客厅环境中的复杂序列。他们将该方法与一个仅在开始时编写一次代码且不再回头查看的相同系统进行了对比。差异非常显著。那个在过程中重写代码的系统在百分之三十五的任务中取得了成功,而那个坚持原定计划的系统仅成功了百分之三。这种十倍的提升在他们测试的每种场景中都成立。成功的关键不仅在于机器人能够看到自己的错误,还在于它能够修改导致错误的指令本身。在机器人最初抓取物体失败的近百分之三十的案例中,系统捕捉到了错误,重写了操作方式,并在同一次尝试中成功举起了物品。如果没有这种在中途编辑代码的能力,这些失败将会是永久性的。

为了确保这一过程具有实用性,团队测量了它所需的计算能力。由于人工智能在每次检查时都在重复利用大部分相同的背景信息,因此系统每次只需要处理少量的全新数据。这使得机器人可以在单次任务中暂停、思考并重写指令大约十次,而不会变得过于缓慢或昂贵。研究还表明,这种方法并不依赖于机器人记忆特定的短语或指令。当研究人员更改任务描述的措辞时,系统的表现保持稳定,而其他依赖训练数据的模型在语言稍作改变时就会表现得非常吃力。这表明该系统真正理解了目标,而不仅仅是在匹配模式。

研究人员谨慎地指出,他们的结果来自计算机模拟,而非真实房间里的物理机器人。该系统目前依赖于关于物体位置的完美数字信息,而现实世界的摄像头并不总能以如此确定的方式提供此类信息。此外,人工智能生成新代码所需的时间意味着这种方法更适用于不需要分秒间反应的任务。尽管存在这些局限性,该研究展示了一条清晰的前行之路:通过让人工智能保持在代码语言中,并允许它在错误发生时自行修复,机器人可以在无需针对数千次人类演示进行重新训练的情况下变得更加强大。这项工作表明,机器人控制的未来可能不在于教机器新的运动方式,而在于给予它们在学习过程中编辑自身计划的自由。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →