💻 computer science
From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting
本文介绍了首个用于评估预训练视觉语言模型在多臂机器人采摘水果任务中表现的全面零样本基准测试,展示了它们生成有效采摘方案的潜力,同时也凸显了当前在三维航点精度和避障协调方面的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:从愿景到收获
问题定义
本文探讨了在非结构化果园环境中部署多臂机器人系统进行水果采摘所面临的挑战。虽然多臂系统通过并发采摘提供了比单臂系统更高的吞吐量,但它们面临两个主要障碍:
- 泛化能力: 传统的系统依赖于专门的感知流水线(如 YOLO),这些系统在多变的光照、遮挡和环境条件下性能会下降,且通常需要针对目标数据进行大量的重新训练。
- 协调复杂度: 在共享工作空间内为多个机械臂规划无碰撞轨迹是一个 NP 难问题。现有的解决方案通常通过在机械臂之间划分工作空间来简化这一过程,但这可能会降低规划质量和整体吞吐量。
作者提出评估视觉语言模型 (VLMs) 作为一种零样本(zero-shot)替代方案。其动机在于,人类工人通过对空间关系进行视觉推理并执行任务序列,无需显式重训即可成功采摘。本文研究了预训练的 VLM 是否能够复制这种高层推理能力,直接从原始 RGB-D 图像生成有效的、无碰撞的多臂采摘计划。
方法论
作者引入了一个全面的基准测试,用于评估 VLM 相对于传统“专家(oracle)”流水线的表现。
专家流水线(基准): 一个代表性能上限的三阶段最先进流水线:
- 感知: 使用 GroundingDINO 进行开放词汇检测,并使用 SAM2 进行像素级分割以分离水果。
- 定位: 使用针孔相机模型将分割后的深度像素投影到 3D 坐标中,并通过 DBSCAN 进行聚类,以估计水果位置和脱离时间。
- 规划: 利用双层混合整数规划 (MIP) 框架,将水果分配给特定的机械臂,并生成同步且无碰撞的轨迹。
零样本 VLM 流水线:
- 输入: 原始果园 RGB-D 图像和结构化提示词(prompt)。
- 提示词设计: 提示词为 VLM 提供特定角色(农业机器人专家)、物理尺度参考(例如水果直径)、坐标系定义以及机器人约束(例如在共享导轨上的机械臂顺序)。它明确要求模型识别水果、推理空间关系,并输出包含采摘序列和以米为单位的 3D 航路点(waypoints)的 JSON 对象。
- 安全性验证: 由于 VLM 输出的航路点不包含时间信息,因此使用轻量级轨迹校验器检查“顺序违规”。如果被分配到较大 X 坐标水果的机械臂必须经过被分配到较小 X 坐标水果的机械臂(违反了导轨上机械臂固定的物理顺序),则该计划会被标记为碰撞。
实验设置:
- 数据集: 来自苹果园和柑橘园的真实世界图像。
- 模型: 评估了五种闭源模型(如 GPT-4o, GPT-5.5-Pro, Claude Sonnet 3.5)和两种开源 VLM。
- 指标: 检测率、收获率(在不同空间阈值下:1.0m, 0.5m, 0.25m)、碰撞率、轨迹距离和 Token 使用量。
核心贡献
- 首个综合基准测试: 本文提出了第一个专门用于评估预训练 VLM 在真实作物(苹果和柑橘)上进行零样本多臂水果采摘规划的基准测试。
- VLM 规划流水线: 开发了一种直接从原始图像生成多臂航路点的流水线,并结合了基于运动学约束验证可行性的碰撞检查机制。
- 实证分析: 通过系统性评估揭示了虽然前沿 VLM 可以生成计划,但其性能对物理尺度先验、空间阈值和场景复杂度高度敏感。
- 开源: 作者承诺开源该基准测试,以促进未来的研究。
结果
- 能力: 前沿 VLM(如 GPT-5.5-Pro, Claude Opus 4.7)可以在零样本场景下生成覆盖大多数水果的完整采摘计划。
- 精度与召回率: 在检测水果与精确定位之间存在显著差距。模型通常能实现较高的检测率(例如在 1.0m 阈值下 >90%),但在更严格的阈值下(例如在柑橘类作物上,某些模型在 0.25m 阈值下 <10%)收获率会大幅下降。
- 安全与协调: 许多模型的碰撞率很高(例如 Claude Sonnet 3.5 在柑橘类作物上 >80%),这表明如果没有显式的几何约束,VLM 在处理多臂系统所需的复杂空间协调方面表现挣扎。
- 提示词敏感性: 消融实验表明,物理尺度先验至关重要;移除这些先验会导致定位精度急剧下降。然而,结构化输出(JSON)是必不可少的;如果没有它,尽管模型能检测到水果,却无法生成可执行的计划。
- 可扩展性: 随着水果数量增加(场景复杂度提高)以及机械臂数量增加,性能会发生退化,凸显了扩展协调逻辑的难度。
意义与主张
本文声称这项工作既强调了 VLM 在农业机器人领域的潜力,也指出了其目前的局限性。
- 潜力: VLM 展示了在无需特定任务训练的情况下跨作物和环境进行泛化的能力,为减少对人工和专门数据收集的依赖提供了一条潜在路径。
- 局限性: 目前的实际部署受限于 VLM 无法生成精确的 3D 航路点(特别是深度方向)以及无法进行多臂的感知碰撞协调。
- 结论: 作者得出结论,虽然 VLM 在高层任务规划方面是有效的,但它们尚未成为多臂采摘的完整解决方案。未来的工作需要解决语义推理与精确度量定位及安全性验证之间的差距。该基准测试为开发更具泛化性和高效的规划系统奠定了基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。