← 最新论文
💻 computer science

Human-Centric Grasp State Assessment: Toward Transferring Subjective Evaluation to Robots

本文提出了一个通过使用视觉语言模型来半自动化生成训练数据,从而弥合人类主观预期与机器人测量之间差距的框架,使机器人能够基于极少的人类标注实验,快速调整其对形变物体的抓取力。

原作者: Ryohei Kobayashi, Kosei Isomoto, Yuga Yano, Yuichiro Tanaka, Hakaru Tamukoh

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryohei Kobayashi, Kosei Isomoto, Yuga Yano, Yuichiro Tanaka, Hakaru Tamukoh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在家庭中静谧且杂乱的角落,或是便利店狭窄的货架间,机器人正面临着一个对人类而言简单、对机器而言却令人困惑的挑战:如何在拿起三明治时既不将其压碎,又能在提起纸杯时既不让其滑落。几十年来,工程师们一直通过测量数值来教机器人抓取物体——施加了多少力、存在多少摩擦力,以及物体是否发生了移动。这些测量是精确且可靠的,但它们忽略了方程中最重要的一部分:人类那种“恰到好处”的感觉。机器人可能会施加足以稳固握住物体的物理力量,但在人类观察者看来,物体却略显凹陷或变形,这标志着抓取力度过大。这种机器人所测量的数值与人类预期之间的脱节,为真正的协作制造了障碍。如果机器人无法理解即使没有掉落但被压扁的三明治也是一种失败,那么它永远无法在精细的日常任务中获得信任。

日本九州工业大学的一个研究小组开发了一种新方法来弥补这一差距。他们创建了一个系统,使机器人能够学习人类抓取的感性视觉标准,并仅利用自身的机械传感器来应用这些标准。研究人员并没有为每种可能的物体编写死板的规则(考虑到世界上事物的无限多样性,这是不可能实现的),而是构建了一个将人类直觉传递给机器的框架。该系统的运作方式是:首先向人类展示如何判断抓取,然后利用这种判断来教机器人去观察其自身数据中的特征。其结果是,机器人可以在仅看到几个示例后,就能适应一种新的、未知的物体,并在人类认为抓取完美的瞬间精准地停止挤压。

研究人员在非结构化环境中常见的三个物品上测试了这一想法:饭团、三明治和纸杯。选择这些物体是因为它们柔软、易变形,且在压力下的表现各不相同。为了教导机器人,团队首先记录了机器人以微小且精确的步长增加力量并抓取这些物品的视频。一名人类观察者观看这些视频,并标记了两个关键时刻:夹持器牢牢抓住物体的确切秒数,以及物体开始出现可见损伤(如凹陷或形状改变)的第一瞬间。这些时刻为机器人定义了三种状态:滑动(抓得不够紧)、合适(抓得恰到好处)以及过度(挤压过重)。

核心创新在于机器人如何在不需要成千上上万个带有人类标签的样本的情况下学习这些定义。研究人员使用了一个大型语言和视觉模型(一种能够理解图像和文本的人工智能)作为桥梁。他们向这个人工智能展示了几个关于人类判断的示例——即两三个由人类已经标记好完美时刻的视频。随后,该人工智能利用这些示例作为引导,自动对剩余的视频数据进行标注。这个过程被团队称为“半自动化监督生成器”,它使得他们能够以极少的人力投入,为每个物体创建一个完整的训练数据集。该人工智能学会了识别人类会注意到的细微变形视觉线索,有效地将人类的“眼力”转化为机器人可以理解的一组标签。

一旦机器人拥有了这些标注数据,它就能利用自身的内部传感器实时预测抓取状态。机器人没有眼睛去观察凹陷;相反,它依赖于指尖的触觉传感器以及对施加力量的测量。研究人员训练了一个轻量级的预测模型,通过观察这些传感器读数的历史记录,来预测下一分秒内会发生什么。如果压力和触觉的模式表明物体即将发生变形,机器人就会知道停止增加力量。这种预测在瞬间完成,使机器人能够在拿起并移动物体的过程中持续调整其抓取动作。

实验表明,这种方法效果显著。当研究人员在三个物体上测试该系统时,随着看到的数据增多,机器人的正确状态预测能力迅速提升。仅凭一个人类判断的示例,机器人就能开始理解任务,但其预测有时并不稳定。当给予两个示例时,机器人的表现变得高度准确,几乎完美地匹配了人类的判断。在机器人实际拿起并移动物体的测试中,它几乎在每次尝试中都成功保持了“合适”的抓取力。对于纸杯和三明治,机器人在保持物体稳固且无损方面达到了完美得分。对于形状更不规则、密度更不均匀的饭团,机器人的反应略显谨慎,停止挤压的时机比人类稍早一点,但它仍成功地运送了物品而没有掉落或压碎。

为了确认机器人是否真正达到了人类的预期,研究人员请二十五个人观看机器人执行这些任务的视频。参与者被要求判断机器人的抓取是属于滑动、合适还是过度。在几乎所有情况下,超过百分之九十的人都认为机器人的抓取是正确的。唯一的例外是三明治的一次测试,当时机器人抓取位置略偏中心,导致了视觉上的变形,一些人将其解读为力量过大。这一结果表明,该系统成功地将机器人的机械动作与人类的视觉预期对齐,创造出一种在观察者看来“感觉对了”的抓取感。

这项研究也指出了当前方法的局限性。研究人员指出,当物体与机器人已见过的物体相似时,该系统表现最佳。如果引入一种具有完全不同质地或硬度的全新类型三明治,机器人可能需要更多的示例来学习新规则。团队还指出,他们目前的方法依赖于简单的三状态分类,这虽然是一个良好的起点,但并未捕捉到人类偏好的全部复杂性。未来的工作旨在通过在任务过程中引入人类反馈,并扩大可处理的物体范围,来增强系统的鲁棒性。

最终,这项研究展示了机器人在混乱、不可预测的环境中与人协作的前行路径。通过教导机器去重视人类视角——不仅是物体的物理安全性,还有其外观和完整性——研究人员在实现能真正理解日常生活细微差别的机器人方面迈出了重要一步。机器人不需要被告知要对特定物品施加多大的压力;它只需要学习“过度”看起来是什么样子的,然后就可以将这一经验应用到它遇到的任何事物上。这种将主观人类标准转化为客观机器控制的能力,预示着一个机器人可以像我们一样细心地处理最脆弱之物的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →