← 最新论文
🤖 AI

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

本文提出了一种用于杂乱便利店环境下机器人取放任务的感知-动作流水线,该流水线结合了用于识别目标的注释引导视觉提示技术,以及用于从人类演示中生成自适应、数据驱动抓取序列的动作分块 Transformer(ACT)。

原作者: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于注释引导与 ACT 的视觉提示机器人抓取与放置技术

问题陈述
便利店环境中的机器人抓取与放置任务面临着显著的障碍,包括物体排列密集、频繁的遮挡以及物体属性(颜色、形状、尺寸、纹理)的高度多样性。依赖于预定义启发式规则、结构化环境或详尽场景分割的传统方法,往往缺乏应对新颖物品和动态布局所需的适应性。此外,传统的逐步规划方法在长程任务中容易出错,会导致误差累积并导致失败。

方法论
作者提出了一种结合**注释引导视觉提示(annotation-guided visual prompting)**与 ACT(Action Chunking with Transformers)——一种模仿学习算法——的感知-动作流水线。

  • 视觉提示: 系统并非要求机器人执行复杂的、穷举式的场景解析,而是利用边界框(bounding box)注释来提供结构化的空间引导。这些注释明确标识了用于抓取的目标物体和用于放置的目的地。系统采用两个 Intel RealSense 相机(腕部安装的 D435i 和桌面安装的 D415)来捕获 RGB 和深度数据。通过视觉提示(边界框)增强后的 RGB 图像作为神经网络的直接输入。
  • Action Chunking with Transformers (ACT): 核心控制算法是 ACT,它取代了僵化的逐步规划,转而预测“块状”(chunked)动作序列。
    • 架构: 该模型使用基于 Transformer 的架构。CVAE 编码器处理人类演示数据(动作和观测值,但不含图像)以生成潜变量 (zz)。随后,Transformer 解码器根据当前状态、潜变量和视觉输入(带有边界框的 RGB 图像)预测未来的动作序列(一个“动作块”)。
    • 训练: 系统通过模仿学习进行训练,学习数据是通过 3D 空间鼠标进行的远程操作(teleoperation)收集的人类演示。训练目标是最小化预测动作块与实际动作块之间的重构误差,并辅以 KL 散度项进行正则化。
  • 实验设置: 该系统实现在配备 Robotiq 两指夹持器的 Universal Robots UR5e 机械臂上。实验在模拟及真实的便利店场景中进行,使用了六种不同的产品类别(如面碗、巧克力盒、茶瓶),代表了多样化的形状、纹理和材质。

核心贡献

  1. 注释引导视觉提示: 引入了基于边界框的视觉提示来引导机器人操作。这种方法降低了场景理解的复杂度,同时通过提供轻量且有效的空间线索确保了任务执行。
  2. 基于 ACT 的自适应系统: 实现 ACT 以使机械臂能够执行从人类演示中提取的平滑、块状动作序列,而非依赖于僵化的增量规划。
  3. 系统化评估框架: 通过三个递进的任务复杂度水平(简单、复杂、更复杂场景)进行结构化实验分析,以评估视觉提示和物体多样性如何影响机器人性能。

结果
系统在涉及 3x3 产品排列的三种场景下进行了评估:

  • 简单场景: 九个相似的盒子,带有一个注释目标。系统实现了 90% 的成功率,展示了在均匀环境中的可靠性。
  • 复杂场景: 九种不同的产品,带有一个注释目标。由于物体属性(反射性、光滑度)的变化,初始成功率降至 70%。在针对失败案例增加了 20% 的特定演示数据后,系统性能显著提升,在该场景下的所有物体类别中达到了 100% 的成功率
  • 更复杂场景: 九种不同位置的多种产品,同时注释了抓取和放置位置。初始成功率为 70%。由于难度增加,研究人员为每种产品收集了两倍量的人类注释数据。在数据增加后,性能有所提升,但特定物体类别(如反光茶瓶、光滑罐子)的成功率(8属 80%)仍低于刚性盒子(90%)。

失效分析
研究识别了特定的失效模式,包括手指对齐偏差、抓取力过弱导致的滑动(特别是在光滑表面上)以及放置对齐偏差。注意力热图显示,ACT 模型能够成功地将注意力从抓取位置转移到放置位置,并根据视觉提示调整其策略。然而,具有反射表面的物体或柔软纹理的物体仍然构成了持续的挑战,导致了对齐错误和抓取失败。

意义与主张
论文声称,将视觉提示与动作分块相结合,可以使机器人高效地解释并根据极简且信息丰富的注释进行现实世界的操作任务。所提出的方法代表了向创建能够处理复杂物体变化、具有更高自主性和鲁棒性的自适应机器人系统迈出的重要一步。

作者对其工作的局限性保持了谦逊的态度。他们明确承认该系统是**数据驱动型(data-demanding)**的,严重依赖于多样且高质量的人类演示数据。因此,论文并未声称在没有足够训练数据的情况下具有通用泛化能力。未来的工作被确定为通过数据增强来人工扩大数据集,而不是声称能立即解决数据稀缺问题。研究结论认为,虽然该方法增强了抓取稳定性和放置精度,但其有效性仍取决于训练演示数据的质量和数量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →