← 最新论文
💻 computer science

Zero-shot 2D Grounding with Novel Affordance Types

本文引入了针对新颖示能类型(affordance types)的零样本 2D 定位任务,并提出了利用分割线索实现性能显著提升的无需训练的方法 AffordAnything 及其可训练变体 AffordAnything+,这两者在新的 NAT 基准测试上均取得了显著的性能改进。

原作者: Haomeng Zhang, Raymond A. Yeh

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Haomeng Zhang, Raymond A. Yeh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人如何与世界互动。你可以告诉机器人一把“刀”长什么样,然后它能在图片中找到它。但知道一把刀“是什么”并不等同于知道你可以用它“做什么”。这就是物体识别(object recognition)与“示能性”(affordance)之间的区别。示能性是一个高级词汇,指的是物体向我们展示的关于如何使用它的隐藏线索。杯子的把手“示能”抓握;刀的平坦一侧“示能”切割;橘子的皮“示能”剥皮。为了让机器人能在我们凌乱的现实厨房和客厅里真正发挥作用,它们需要理解这些动作,而不仅仅是理解物体本身。

一个巨大的挑战在于,大多数机器人的大脑训练起来就像只为特定考试而学习的学生。如果一个机器人学习了如何“切”苹果,当被要求“切”西红柿时,它可能会感到困惑;或者如果它从未见过特定的这种动作,它可能不知道如何“剥”香蕉。这就像一个学生背下了数学练习题的答案,但当老师用不同的数字提问类似问题时,却不知所措。科学家们一直试图构建能够处理这些新的、未见过的指令的机器人,但直到现在,研究重点主要集中在教它们认识新的“物体”,而不是新的“动作”。

这篇论文介绍了一种教机器人处理“新颖示能类型”(novel affordance types)的新方法——基本上就是指那些它们从未被明确教过如何使用的东西。来自普渡大学的研究人员张浩猛(Haomeng Zhang)和 Raymond A. Yeh 注意到,现有的 AI 模型擅长寻找新物体,但在弄清楚新动作方面表现糟糕。他们创建了一套新的挑战(称为基准测试)来测试这项特定技能。他们发现,目前最先进的模型虽然非常聪明,擅长识别物体,但当被要求寻找“剥”或“坐”某物的正确位置时,它们会完全失败,如果这些特定动作不在它们的训练数据中。

为了解决这个问题,团队构建了一个名为 AffordAnything 的新系统。把它想象成一个侦探,它不只是观察整幅画面,而是缩放并聚焦于微小的线索。该系统意识到,你与物体进行交互的位置通常是物体的某个特定部分(比如杯子的把手或书的边缘)。该系统不再试图记忆每一种可能的动作,而是使用一个强大的预训练 AI(视觉语言模型)将物体分解成小的补丁(patches),并找出哪个补丁与动作词相匹配。例如,如果你要求“切”,它会寻找锋利的边缘;如果你要求“拿”,它会寻找把手。

研究人员测试了两个版本。第一个版本 AffordAnything 是一个“无需训练”的版本,这意味着它无需重新学习即可直接使用。它已经表现得比现有方法显著更好。第二个版本 AffordAnything+ 是一个“可训练”的升级版,它通过极少量的练习就能更好地学习如何将这些线索组合在一起。在他们的新测试集上,这个升级后的模型在寻找正确位置的准确度上(以 IoU@0.4 的绝对增量衡量),比之前最好的方法提高了 12.3%

论文明确反对仅仅使用更大、更智能的 AI 模型或仅仅识别物体就足够了的观点。他们证明了即使是最先进的模型,在面对新动作时也会失败。他们还展示了虽然这些模型可以识别出“刀”,但除非它们被专门设计用来寻找动作与物体形状之间的关系,否则它们并不会自动知道如何用它来“剥”。结果表明,要让机器人具有真正的适应性,我们不能仅仅教它们一组固定的动作列表,而要开始教它们如何对使动作成为可能的物体部分进行推理。作者希望这种测试和构建系统的新方法能帮助机器人变得更加灵活,并为变化不断的现实世界做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →