想象一下,你正在教一只机械手如何拿起一个咖啡杯。你不能只告诉它“抓起杯子”;你必须告诉它应该抓哪里。如果它抓住了把手,杯子可能会翻倒;如果它抓住了底部,杯子可能会滑落。这就是“示能分割”(affordance segmentation)的工作——一个高级术语,指的是教计算机观察一个物体,并高亮显示哪些部分是可以安全触摸的,哪些部分是不可以的。
长期以来,机器人一直依赖标准摄像头(RGB)来完成这项工作,即通过颜色来观察世界。但颜色可能会带来干扰。如果一个蓝色的杯子放在一张蓝色的桌子上,彩色摄像头可能会产生混淆,认为杯子是桌子的一部分。这就是深度传感器发挥作用的地方。把深度传感器想象成一双不仅能看,还能测量距离的眼睛,它能创建一个世界的3D地图。它不在乎杯子是蓝色的还是桌子是蓝色的;它知道杯子离摄像头更近。然而,面临的大挑战是,机器人通常需要是小型化、便携式且由电池驱动的。在微小的芯片上运行复杂的3D视觉软件,就像试图在智能手表里运行一台超级计算机一样——它通常会过热或瞬间耗尽电池。科学家们一直试图研究如何让这些“具备3D感知能力”的大脑变得足够小,以便安装在可穿戴机器人上,而不会耗尽所有的能量。
这篇论文正是在解决这个难题。研究人员想要看看他们是否可以构建一个微型、高效的机器人大脑,该大脑既能利用颜色(RGB)数据,又能利用深度(D)数据来判断如何抓取物体,同时还能在便携式设备上运行。他们不仅仅是靠直觉,而是构建了两种不同的“架构师”来设计这些大脑。第一种方法是“硬件感知神经架构搜索”(HW-NAS)。想象一下这是一个超级快速、自动化的机器人架构师,它尝试数千种不同的脑部设计,测试每一种设计是否最适合特定的微型芯片,同时仍具备足够高的智能来抓取杯子。第二种方法是“微调”法,这就像是拿一个已经非常擅长2D(仅限颜色)视觉的大脑,然后温柔地教它如何理解3D深度,而不是从头开始构建一个新大脑。
团队在包含数千张日常物品(如勺子、锤子和杯子)图像的真实世界数据集上测试了这些想法。他们发现,加入深度信息几乎总是会让机器人变得更聪明。例如,在尝试识别“勺柄”时,使用深度数据的模型比仅使用颜色的模型准确度高出31.6%。这在光照较差或物体颜色与背景融合时尤其有效。研究人员还证明了他们的新设计位于“帕累托最优前沿”(Pareto optimal front)上。用通俗的话说,这意味着他们找到了完美的平衡点:这些模型在所消耗的能量和内存范围内,达到了其智能度的极限。你无法在不让模型变得更大或更慢的情况下让它更聪明,也无法在不让它变笨的情况下让它变得更小。
最后,他们将最好的模型应用于一个真实的原型机上:一个连接着RealSense RGB-D摄像头的Jetson Nano板(一种常用于机器人技术的微型计算机)。他们测量了系统的思考速度和耗电量。结果令人振奋。即使增加了处理3D深度数据的额外工作量,该系统仍能实现实时处理图像(通过优化可达每秒16帧),并且其功耗预算与标准智能手机电池兼容。论文表明,通过使用这些智能的、具备深度感知能力的设计,我们可以制造出不仅抓取物体更准确,而且轻便且节能、足以让人们在日常生活中佩戴的可穿戴机器人。
技术摘要:填补嵌入式设备上示能性分割的帕累托最优前沿
问题陈述
穿戴式机器人需要半自主控制能力,特别是针对抓取和操作任务,以减轻用户从事繁重或危险家务的负担。该控制流水线的关键组成部分是示能性分割(Affordance Segmentation, AS),它能够识别物体的功能部分以实现精细化控制。虽然深度神经网络(DNN)是 AS 的标准方法,但在便携式、能量受限的嵌入式设备上部署这些模型面临着巨大挑战。现有的解决方案通常依赖于要么针对微控制器优化的“微型”模型(可能缺乏鲁棒性),要么是高性能的非受限模型(对于便携式硬件而言过于沉重)。此外,深度(D)传感器提供了接触式抓取所需的几何信息,但如何将其集成到用于 AS 的轻量级 DNN 中仍是一个尚未得到充分探索的领域。简单地集成 RGB 和深度数据往往只能带来微小的性能提升,或者会过高地增加计算成本。核心问题在于设计一个能够有效利用 RGB-D 数据来提高泛化能力,同时严格遵守嵌入式硬件的能量、尺寸和实时性约束的系统。
方法论
本文提出了两种不同的设计策略,旨在生成用于 RGB-D 示能性分割的高硬件效率 DNN,目标是寻找位于帕累托最优前沿(平衡精度与 FLOPs 及参数量等硬件需求)的解决方案。
硬件感知神经架构搜索 (HW-NAS):
- 作者重新构建了 HW-NAS,提出了一种专门为 RGB-D 输入设计的创新搜索空间。
- 该架构采用双分支结构,通过独立的编码器分别处理 RGB 和深度流,然后合并到一个共享的主干网络中。
- 一个**聚合器(Aggregator)**网络将主干网络的输出与来自多个编码器层的中间表示相结合,从而实现多分辨率特征提取。
- 搜索空间允许灵活的连接,包括从早期层到聚合器的跳跃连接,并优化了卷积核大小、扩展因子和步长等参数。
- 优化过程使用进化算法来选择在满足推理时间和内存约束的同时,使验证损失最小化的架构。
微调方法:
- 作为一种计算成本更低的替代方案,本文提出将预训练的仅 RGB 网络(特别是 MobileNetV3)适配以处理 RGB-D 输入。
- 在输入端插入了一个专门的预处理层,用于将深度通道与 RGB 通道合并,创建一个 4 通道张量 (W×H×4)。
- 一个单卷积层(3 个滤波器,步长为 1)将该张量还原为 3 通道张量,从而允许剩余的预训练架构“按原样”处理数据。
- 该方法利用了深度图与 RGB 图像之间的结构相似性,使得网络能够在不显著改变现有权重配置的情况下调整低级特征。
实验设置
所提方法在两个真实世界数据集上进行了评估:
- UMD: 包含 7 个不同构图类别的 28,843 幅 RGB-D 图像。
- IIT: 包含 8,835 幅具有光照、遮挡和分辨率变化的图像。
任务被定义为三类像素级分类:“抓取”、“不抓取”和“背景”。模型与包括微型模型(HW-0.5s, HW-1s)、定制 MobileNetV3 变体、基于 Transformer 的模型(SegFormer)以及大型 CNN(EfficientNet, VGG16)在内的最先进基准模型进行了对比。部署测试是在连接了 RealSense RGB-D 相机的 Jetson Nano 开发板上进行的。
关键结果
- 性能提升: 两种提出的方法均证明,集成深度信息可以提高泛化性能,特别是在“抓取”和“不抓取”类别上。在 UMD 数据集上,采用 RGB-D 的 HW-NAS 方法比仅使用 RGB 的对应版本实现了高达 2.8% 的精度增益。
- 帕累托最优性: 在绘制泛化性能与模型大小及 FLOPs 的关系图时,生成的模型始终位于帕雷托最优前沿。它们在保持显著低于大型非受限模型资源需求的同时,性能优于现有的硬件高效型方法(微型模型)。
- 硬件效率:
- 推理时间: 经过优化(使用 TensorRT float16 量化)的模型在 Jetson Nano 上实现了实时性能,帧率根据模型和功率模式(5W vs. 10W)在 8–16 FPS 之间波动。
- 能耗: 系统运行在与标准智能手机电池兼容的能量预算内(总系统功率约为 7–11W),允许在 5000 mAh 电池上运行约 3.5 小时。
- 内存: NAS 生成的模型比基于 MobileNetV3 的模型更具内存效率,使用的 RAM 约为 300 MB,而后者约为 400 MB。
- 鲁棒性: 深度信息在光照不佳或物体颜色与背景匹配(例如,蓝色勺子在蓝色背景前)的情况下被证明至关重要,显著增强了分割精度。
意义与主张
本文声称其主要贡献在于提供了一种设计策略,成功填补了“微型”模型与高性能加速器之间的空白,特别是针对穿戴式机器人领域。通过引入专门用于 RGB-D 数据的 HW-NAS 搜索空间和轻量级微调机制,作者证明了以下几点是可行的:
- 直接从具有有限功率的智能设备上的 RGB-D 相机提取高层语义信息。
- 生成帕累托最优的架构,提供精度与硬件约束之间的最佳权衡。
- 在便携式硬件(Jetson Nano)上实现实时推理,且能量特性适用于电池驱动的穿戴式机器人。
作者强调,尽管深度处理增加了计算复杂度,但其方法可以有效地进行扩展以管理这些成本,证明了中等规模、特定应用的 DNN 是半自主穿戴式控制流水线中可行且有效的解决方案。未来的工作确定为引入物体定位以实现自动构图,并将这些技术扩展到基于 Transformer 的模型。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。