Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation
该论文介绍了 Afford-X,这是一个由大规模 LVIS-Aff 数据集增强的紧凑且高效的端到端可训练模型,它在面向任务的机器人操控中实现了卓越的泛化示能性推理,同时显著优于非大语言模型方法,并提供了比 GPT-4V 更快的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一个充满随机物品的房间里:一个灯笼椒、一只鞋、一盏灯和一个中空的石头。人类并不仅仅看到“红色的东西”或“闪亮的东西”。你会瞬间明白,灯笼椒可以盛水,鞋子可以当作锤子,而石头可以作为座位。这种超能力被称为示能性推理(Affordance Reasoning)。它是指通过观察物体的外观和触感,理解“你可以用它做什么”的能力。为了让机器人在我们混乱的现实世界中完成任何有用的工作——比如做三明治或打扫房间——它们也需要这种超能力。它们不能仅仅被告知“拿起杯子”,它们需要能够理解:“哦,那边那个东西是个杯子,所以我可以用它来喝水”,即使那个杯子只露出一半或者看起来有点奇怪。
目前的一个大问题是,现有的机器人大脑要么太笨,无法自主理解这些,要么过于庞大且复杂(比如巨大的 AI 模型),以至于无法装进机器人的脑袋里快速运行。它们要么会被词汇搞混,要么思考得太慢。这篇论文介绍了一种新的解决方案,叫做 Afford-X。可以把它想象成一个“聪明且精简的机器人大脑”,它经过专门训练,能够通过观察一张图片和一项任务(例如“擦干身体”)来瞬间指向最佳工具(如毛巾),并忽略干扰项。它的设计目标是足够小,可以在本地计算机上运行;足够快,可以实时工作;并且足够聪明,能够处理从未见过的全新情况。
问题所在:机器人被名词分心
要理解为什么这篇论文意义重大,想象你在和机器人玩“老师说”的游戏。你说:“用某种东西清洁瓶子。”一个标准的机器人可能会看着图像,看到一个闪亮的瓶子,然后立刻抓起瓶子。它失败了,因为它被“瓶子”这个名词困住了,而没有理解“清洁”这个动作。它误以为瓶子是工具,而不是被清洁的对象。这就像一个学生在关于水果沙拉的数学题里读到了“苹果”这个词,却忘了去解真正的数学题。
目前的 AI 模型通常太大,无法在机器人的本地计算机上运行(它们需要庞大的服务器),而较小的模型则往往太笨,无法理解工具与目标之间的区别。它们缺乏“常识”,不知道毛巾可以用来清洁瓶子,但瓶子本身无法实现自我清洁。
解决方案:Afford-X 与“教师-学生”技巧
作者构建了一个名为 Afford-X 的新系统。它就像是一个“精简版”的 AI 模型,可以安装在本地设备上,但却出奇地聪明。为了在不增加体积的情况下提升智能,他们使用了一种巧妙的训练技巧,叫做知识蒸馏(Knowledge Distillation)。
想象一位知道如何烹饪完美佳肴的名厨(教师)。这位名厨知道每种食材的具体名称(比如“沙发”或“杯子”)。现在,想象一位正在学习但还不能知道具体食材名称的学徒(学生);他们只知道指令,比如“舒服地坐在某物上”。
论文中的方法如下:
- 教师使用具体的名称进行学习(例如:“坐在沙发上”)。
- 学生使用模糊的词汇进行学习(例如:“坐在某物上”)。
- 教师不仅仅是告诉学生答案,它还会展示给学生如何思考。它会说:“当你看到这种形状并听到‘坐’时,即使你还不知道这个词,也要联想到‘沙发 worth'。”
这使得学生(最终的机器人模型)能够理解工具的“概念”,而不需要一个巨大的所有物体名称数据库。它学习的是正确物体的“感觉”。
核心秘诀:动词注意力与双向融合
为了确保机器人专注于“动作”而非仅仅是“物体”,作者在 AI 的大脑中加入了两个特殊的工具:
- 动词注意力 (Verb Attention, VA): 这就像是动作词的荧光笔。当机器人读到“清洁瓶子”时,VA 模块会在“清洁”这个词上投射强光。它告诉机器人:“嘿,别只盯着瓶子看!去找寻找能‘清洁’的东西!”这防止了机器人被图片中最显眼的物体所分心。
- 双向融合 (Bi-Fusion, BF): 这是机器人的眼睛(视觉)与大脑(语言)之间的双向对话。该模块并非简单地将图片和文字粘合在一起,而是让它们进行反复交流。眼睛说:“我看到一个柔软的矩形物体”,大脑说:“那听起来像是用来擦干的毛巾”。它们通过交换信息来做出完美的决策。
训练场:LVIS-Aff 与 COCO-Aff
要教机器人变得聪明,必须给它一个庞大的案例库。作者创建了两个全新的大型数据集,分别称为 COCO-Aff 和 LVIS-Aff。
把这些看作是机器人的大规模“模拟考试”。这些数据集不仅仅是展示一张杯子的图片并询问“这是什么?”,而是展示一张图片并给出一个任务,如“用……喝水”,然后要求机器人找到杯子。
- COCO-激 包含约 112,000 张图像和 1,144 个不同任务。
- LVIS-Aff 则规模更大,拥有 119,000 张图像和 1,496 个任务,涵盖了超过 1,000 种不同类型的物体。
他们利用一个庞大的 AI(GPT-4)来自动编写这些练习题,并检查答案是否合理。这为机器人提供了更广泛的学习经验,帮助它比以往更好地处理新奇情况。
结果:快速、精简且准确
作者在模拟机器人世界(使用一个看起来像真实房间的虚拟环境)中测试了 Afford-X。以下是他们的发现:
- 速度: Afford-X 速度极快。它可以以 2.38 帧每秒 (FPS) 的速度处理图像。换句话说,它比询问像 GPT-4V 这样庞大的云端 AI 来完成同样的工作要快近 50 倍。
- 体积: 该模型非常小巧,仅有 1.87 亿个参数。这意味着它可以在本地计算机上运行,而不需要庞大的服务器集群。
- 准确度: 在测试中,与未使用大型 AI 模型的现有最佳方法相比,Afford-X 的性能提升了 12.1%。它也比作者之前的工作提高了 1.2%。
- 泛化能力: 当机器人面对从未见过的任务(使用它不认识的物体)时,它依然表现出色。例如,在处理新任务时,其准确率比使用较小数据集的模型提高了约 24%。
机器人的日常生活
为了证明其有效性,作者将 Afford-X 应用于一个模拟机器人手臂。他们给它一个任务,比如“用……喝水”。
- 机器人观察了一张杂乱的桌子,上面有一个瓶子、一个玻璃杯、一个杯子和一个勺子。
- Afford-X 瞬间识别出杯子是最佳工具,忽略了瓶子(因为瓶子是用来盛水的,而不是直接用来饮用的)和勺子。
- 随后,机器人规划了动作并成功抓取了杯子。
在一个复杂的测试中,机器人必须“搭建工作空间”,该系统将大任务分解为小步骤(找桌子、找椅子、找灯),并逐一执行。在这些模拟中,机器人成功找到正确物体的概率为 86%,成功抓取物体的概率为 45%。(失败通常是因为机器人的手臂在抓取像勺子这样又薄又平的物体时遇到了困难,而不是因为它选错了物体)。
为什么这很重要
这篇论文表明,你并不需要一个庞大、缓慢且基于云端的 AI 来赋予机器人常识。通过使用一个经过正确数据训练的精简、智能的模型,机器人可以快速高效地理解如何在现实世界中使用工具。这是迈向能真正协助我们在家庭和工作场所,而非仅仅困在实验室等待超级计算机指令的机器人的关键一步。
作者承认,机器人目前在处理一些极其棘手的情况时仍有困难,例如区分外观完全相同的杯子和牙刷架,或者处理被其他物体遮挡的物体。但就目前而言,Afford-X 证明了拥有一个小巧、快速且聪明的机器人大脑是完全可能的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。