← 最新论文
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

本文提出了一种跨视角动作一致性方法,该方法通过正则化基于流的视觉-语言-动作策略,仅利用 RGB 图像和本体感受,实现了对场景-相机视角变化的鲁棒性,在无需相机标签或深度输入的情况下,显著提升了在模拟和真实世界机器人任务中的性能。

原作者: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

通过人类演示进行学习的机器人正变得越来越强大,但它们往往面临着一种奇特的脆弱性:它们受限于教导它们时的特定视角。想象一下,一个机器人在训练时,摄像头位于桌子上方架子上的位置,它正在学习如何拿起一个杯子。如果这个摄像头被碰撞、移动到侧面或升高,机器人可能会突然失败,尽管杯子、桌子和机器人自身的身体都没有移动。这是因为机器人的“大脑”——一种将所见与应做之事相联系的人工智能——已经学会了基于原始摄像头的精确角度来识别任务。在现实世界中,摄像头会被碰撞,机器人会移动,光照也会变化,因此,一个无法适应视角偏移的系统并不是真正有用的。研究人员曾尝试通过给机器人提供更复杂的传感器(例如能看到3D效果的深度摄像头)或教它们理解房间的几何结构来解决这个问题,但这些解决方案通常需要昂贵的硬件或难以维护的复杂校准。

来自清华大学和阿姆斯特丹大学的一个研究小组发现了一种方法,可以在不增加任何新传感器或改变机器人在现实世界中操作方式的情况下,使这些机器人策略对摄像头移动具有鲁棒性。他们专注于一种特定的机器人控制器,这种控制器通过预测动作的“流”(flow)来学习,类似于水流向目的地,而不是仅仅猜测下一步动作。他们发现的核心在于一种强迫机器人与其自身保持一致的训练方法。他们创建了成对的训练图像,展示从两个不同角度观察的完全相同的物理场景:一个是来自原始摄像头位置,另一个是来自稍微移动后的位置。至关重要的是,他们确保机器人被告知对这两幅图像执行完全相同的动作。通过训练机器人为这两个视角预测相同的运动流,他们教会了机器人忽略摄像头位置的变化,而只关注任务本身。

研究人员在名为 LIBERO-Plus 的模拟环境中测试了这个想法,该基准测试专门用于观察机器人处理摄像头偏移的能力。他们将这种新方法与标准的训练技术进行了对比。当摄像头移动时,使用标准方法训练的机器人仅在约 17% 的尝试中成功。使用多种不同摄像头角度但没有采用其特殊一致性规则进行训练的机器人,成功率提高到了约 75%。然而,使用他们这种新的跨视图一致性规则训练的机器人,成功率达到了 87.2%。这种提升是显著的,并且在不同的随机训练起点下都保持一致。研究人员还证明了这种成功完全取决于两幅图像展示了相同的物理状态。当他们打乱训练数据,让机器人尝试将一个视角的杯子与针对另一种状态的动作相匹配时,性能骤降至 25.8%,这表明机器人不仅仅是在平滑它的答案,而是真正学会了将不同视角的同一现实与同一个动作联系起来。

为了确保这不仅仅是计算机模拟的结果,团队将他们的方法应用到了实验室中的真实机械臂上。他们利用三个同步观察同一张桌子的摄像头收集训练数据,从而能够创建现实世界中必要的视图对。随后,他们使用一个放置在训练期间从未见过的位置的单个摄像头对机器人进行了测试。使用他们的新方法训练的机器人在这些未见过的摄像头测试中成功率为 74.4%,而标准方法仅为 53.3%。这种改进在困难任务中最为显著,例如从支架上取下耳机,在新的摄像头位置下,标准方法完全失败,但新方法却成功了近一半。这项研究证实,通过教导机器人识别其动作在不同角度下的连贯性,它可以变得更加可靠,且无需额外的摄像头、深度传感器或复杂的几何图谱。机器人只需学习到,即使画面发生了变化,任务本身依然如故。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →