← 最新论文
🤖 machine learning

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras

本文提出了两种硬件感知方法,旨在将 RGB-D 数据集成到用于嵌入式设备上示能分割(affordance segmentation)的紧凑型深度网络中,成功在智能手机兼容的能量预算内实现了实时性能,并识别出了平衡泛化精度与硬件约束的帕累托最优解。

原作者: Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一只机械手如何拿起一个咖啡杯。你不能只告诉它“抓起杯子”;你必须告诉它应该抓哪里。如果它抓住了把手,杯子可能会翻倒;如果它抓住了底部,杯子可能会滑落。这就是“示能分割”(affordance segmentation)的工作——一个高级术语,指的是教计算机观察一个物体,并高亮显示哪些部分是可以安全触摸的,哪些部分是不可以的。

长期以来,机器人一直依赖标准摄像头(RGB)来完成这项工作,即通过颜色来观察世界。但颜色可能会带来干扰。如果一个蓝色的杯子放在一张蓝色的桌子上,彩色摄像头可能会产生混淆,认为杯子是桌子的一部分。这就是深度传感器发挥作用的地方。把深度传感器想象成一双不仅能看,还能测量距离的眼睛,它能创建一个世界的3D地图。它不在乎杯子是蓝色的还是桌子是蓝色的;它知道杯子离摄像头更近。然而,面临的大挑战是,机器人通常需要是小型化、便携式且由电池驱动的。在微小的芯片上运行复杂的3D视觉软件,就像试图在智能手表里运行一台超级计算机一样——它通常会过热或瞬间耗尽电池。科学家们一直试图研究如何让这些“具备3D感知能力”的大脑变得足够小,以便安装在可穿戴机器人上,而不会耗尽所有的能量。

这篇论文正是在解决这个难题。研究人员想要看看他们是否可以构建一个微型、高效的机器人大脑,该大脑既能利用颜色(RGB)数据,又能利用深度(D)数据来判断如何抓取物体,同时还能在便携式设备上运行。他们不仅仅是靠直觉,而是构建了两种不同的“架构师”来设计这些大脑。第一种方法是“硬件感知神经架构搜索”(HW-NAS)。想象一下这是一个超级快速、自动化的机器人架构师,它尝试数千种不同的脑部设计,测试每一种设计是否最适合特定的微型芯片,同时仍具备足够高的智能来抓取杯子。第二种方法是“微调”法,这就像是拿一个已经非常擅长2D(仅限颜色)视觉的大脑,然后温柔地教它如何理解3D深度,而不是从头开始构建一个新大脑。

团队在包含数千张日常物品(如勺子、锤子和杯子)图像的真实世界数据集上测试了这些想法。他们发现,加入深度信息几乎总是会让机器人变得更聪明。例如,在尝试识别“勺柄”时,使用深度数据的模型比仅使用颜色的模型准确度高出31.6%。这在光照较差或物体颜色与背景融合时尤其有效。研究人员还证明了他们的新设计位于“帕累托最优前沿”(Pareto optimal front)上。用通俗的话说,这意味着他们找到了完美的平衡点:这些模型在所消耗的能量和内存范围内,达到了其智能度的极限。你无法在不让模型变得更大或更慢的情况下让它更聪明,也无法在不让它变笨的情况下让它变得更小。

最后,他们将最好的模型应用于一个真实的原型机上:一个连接着RealSense RGB-D摄像头的Jetson Nano板(一种常用于机器人技术的微型计算机)。他们测量了系统的思考速度和耗电量。结果令人振奋。即使增加了处理3D深度数据的额外工作量,该系统仍能实现实时处理图像(通过优化可达每秒16帧),并且其功耗预算与标准智能手机电池兼容。论文表明,通过使用这些智能的、具备深度感知能力的设计,我们可以制造出不仅抓取物体更准确,而且轻便且节能、足以让人们在日常生活中佩戴的可穿戴机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →