← 最新论文
💻 computer science

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

该论文介绍了 EgoAfford,这是一个用于第一视角下面向任务的示能性落地(affordance grounding)的基准测试和数据集,以及 EgoLens,一个专门用于在多步桌面任务中联合执行下一步规划和特定角色分割的多模态模型。

原作者: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做三明治。你不仅希望机器人知道“刀”长什么样;你还需要它理解如何用这把刀来抹黄油、要把黄油抹在什么上面,以及最后要把切好的那一片放在哪里。这就是*可操作性(affordance)*的世界,一个高级词汇,意为“一个物体允许你做什么”。想想门把手:它的形状赋予了*旋转的操作可能。杯子赋予了*盛装液体的功能。长期以来,机器人在识别这些简单的、单一动作方面表现得相当出色,比如“抓取把手”。但现实生活是混乱且多步骤的。做三明治不仅仅是一个抓取动作,它是一个涉及规划、拿起正确的工具并准确知道下一步该把东西放在哪里的完整故事。科学家们正在问的一个大问题是:我们能否教会机器人不仅能看到物体,还能理解一个任务的“故事”,推断出下一步该做什么,并指出物体上用于该动作的微小且特定的部分?

于是有了 EgoAfford,这是一个试图通过赋予机器人一个类似于我们视觉的“第一人称”视角来解决这个谜题的新项目。研究人员构建了一个巨大的数字游乐场,包含约 15,500 张桌面场景图像,涵盖了 2,000 种不同的多步骤任务。他们还创建了一个包含 102 张由人类拍摄的照片组成的“真实世界”测试集,以观察机器人是否能应对真实厨房的混乱现实。目标是什么?看看计算机能否看一张图片,阅读一个类似“泡茶”的目标,然后同时完成两件事:1)写下剩余的食谱(计划),以及 2)在茶壶上需要倾倒出的精确部位、勺子上需要搅拌的部位以及杯子里需要倒入的部位上画出掩码(mask)。

为了解决这个问题,团队推出了 EgoLens,这是一个专门为此类工作设计的智能 AI 模型。把 EgoLens 想象成一个正在学习“阅读”场景的机器人厨师学徒。与其他可能会猜测整个物体或在复杂指令中感到困惑的模型不同,EgoLens 经过训练,能够将任务分解为最小的功能单元。它不只是说“那是一个锅”;它会说,“我需要抓取那个锅的壶嘴来进行倾倒,并且我需要握住勺子的来进行搅拌。”论文显示,EgoLens 目前在这一特定类型的思维方式上表现最佳,超越了其他大型 AI 模型以及试图结合规划与视觉的商业工具。

然而,研究人员谨慎地指出,这还不是一个完美的解决方案。虽然 EgoLens 在他们生成的“数字”图像方面表现出色,但在面对真实世界的照片时仍然存在差距,这表明机器人仍需更多练习以应对现实生活中不可预测的特性。这项研究表明,通过将规划下一步的能力与精准定位物体特定功能部分的能力相结合,我们可以让机器人更接近成为我们日常生活中的得力助手。这是在教机器不仅理解事物“是什么”,更理解如何使用它们来完成工作的道路上迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →