想象一下,一个名叫 NICOL 的机器人正坐在桌边,准备为你提供帮助。但问题在于:NICOL 从未见过“烤面包机”、“登山扣”或“果冻模具”。大多数机器人就像那些只知道背诵预习答案的学生。如果你要求它们寻找从未学过的东西,它们就会陷入僵局或开始胡乱猜测。
这篇论文介绍了一种名为 AnomNOVIC 的新系统,它教会了机器人一种不同的思考方式。它不是通过记忆一个“寻找清单”来学习,而是通过学习“空无一物”是什么样子,从而在出现“某种东西”时能够立刻察觉。
以下是它的工作原理,分为两个简单的阶段:
第一阶段:“空白画布”侦探
首先,机器人要学习当桌面完全空置时是什么样子的。
- 类比: 想象你有一张空餐桌的照片。你记住了桌子的确切位置、木头的颜色以及阴影。
- 窍门: 该系统使用一种特殊的 AI(称为掩码自编码器,Masked Autoencoder),它试图“重建”那张空桌子的图像。为了让它变得聪明,研究人员在训练过程中通过秘密地将随机物体粘贴到桌面上,并告诉 AI:“忽略这些!重建一张仿佛它们不存在的桌子。”
- 结果: 当机器人稍后看到真实的桌子时,如果上面有一个杯子或一个玩具,AI 会尝试重建那张“空桌子”。因为杯子的存在,AI 在那个特定位置的重建会失败。它会产生一个“故障”或误差图。
- 输出: 这个故障就像是一个聚光灯。它不知道那个物体是什么,但它准确地知道“不属于这里的东西”正坐在哪里。它会在未知物体周围画出一个框。
第二阶段:“字典大师”
现在机器人已经知道物体在哪里了,接下来它需要知道物体是什么。
- 类比: 想象你有一个侦探,他虽然找嫌疑人很笨,但却是阅读庞大且无限的字典中名字的天才。
- 工具: 这就是 NOVIC 发挥作用的地方。它是一个强大的分类器,不需要预先写好的嫌疑人名单。它可以观察一张图片并说:“那看起来像是一个‘银质奖牌’或一把‘细齿梳’。”
- 过程: “侦探”(第一阶段)将从故障区域裁剪出的物体图片交给“字典大师”(第二阶段)。随后,NOVIC 会识别该物体并给它起一个名字,即使是一个机器人从未见过的奇怪、罕见的物体。
为什么这很重要?
目前大多数先进的机器人视觉系统就像是在做选择题。你必须给机器人一个答案列表(例如:“寻找杯子、勺子或叉子”)。如果机器人看到一个“铲子”,而“铲子”不在你的名单上,机器人可能会忽略它,或者错误地将其称为“勺子”。
AnomNOVIC 则像是自由作文题。
- 它不需要候选名单。
- 它能发现任何打破空房间模式的东西。
- 它能识别并命名它能认出的任何事物(基于广博的英语词汇量)。
实验结果
研究人员在 NICOL 机器人上针对各种棘手的物体进行了测试,包括音频放大器和登山扣等稀有物品,甚至是在杂乱、真实的照明环境下。
- 得分: 当机器人在没有任何帮助(没有名称列表)的情况下进行猜测时,AnomNOVIC 的正确率达到了约 82.6%。
- 竞争对手: 在同样的“不允许使用名单”的情景下,现有的最佳机器人(如 YOLOE 或 OWLv2)仅能达到约 14% 的正确率。
- “提示”测试: 即使研究人员确实给了机器人一个可以供其选择的名称列表(降低了难度),AnomNOVIC 仍然显著优于竞争对手。
总结
该论文声称,通过将“故障检测器”(通过观察不协调之处来发现未知物体)与“字典大师”(自由命名物体)相结合,机器人终于可以在开放世界中运行,而无需预先编程去记忆可能遇到的每一种物体。它让机器人能够说:“我看到桌子上有一个奇怪的东西,我觉得它是一个‘果冻模具’”,即便它从未被明确告知要去寻找果冻模具。
技术摘要:AnomNOVIC —— 无需提示词的开放词汇异常识别
问题陈述
在现实世界、非结构化环境中运行的机器人代理面临着一个关键瓶颈:无法实时视觉感知和识别此前未见的物体。虽然大语言模型(LLMs)在高级推理方面取得了进展,但它们依赖的视觉感知系统往往受到限制。现有的开放词汇目标检测器通常分为两类,且存在显著局限性:
- 受提示词驱动的模型: 如 ViLD、OWLv2 和 YOLO-World 等系统,在推理时需要预定义的候选目标类别列表。这种“提示词”约束严重限制了实际应用价值,因为机器人无法检测到那些它未被明确指示去寻找的物体,且这些模型在遇到新颖物体时往往表现不佳(产生误报)。
- 有限的开放性: 即使是“无需提示词”的模型,也往往由于在受限概念覆盖的数据集(例如 YOLOE 依赖于约 4,585 个标签的固定词汇表)上进行训练,而导致活跃词汇量有限。此外,许多现有模型无法同时实现多个物体的定位并分配细粒度的自由形式标签,而这对于机器人操作至关重要。
方法论:AnomNOVIC 框架
作者提出了 AnomNOVIC,这是一个针对已知工作空间(例如机器人的桌面)设计的两阶段、无需提示词的框架。该系统将物体定位与分类解耦,以实现对任何新颖物体的无偏检测。
第一阶段:通过异常检测进行类别无关的定位
- 架构: 一个视觉 Transformer (ViT) 掩码自编码器 (MAE) 被专门用于重建机器人空置工作空间的图像(即“规范基准”)。
- 训练策略: 该 MAE 被训练用于重建场景。为了教会模型将物体识别为异常,采用了“物体粘贴”增强策略:合成的异常物体被粘贴到训练图像中,但在目标重建过程中被忽略。因此,MAE 学习重建背景,同时忽略(并从而标记)所粘贴的物体。
- 输出: 解码器被扩展以生成三个对齐的输出:重建的 RGB 图像、一个二值桌面掩码和一个异常掩码。
- 推理: 在推理过程中,桌面上存在的物体被视为异常,因为它们不在训练分布中。系统计算重建误差图和异常掩码。这些结果会被合并、过滤,并进行处理(可选地通过 SAM 2.1 进行精细化),以生成所有检测到的物体的类别无关边界框。
第二阶段:通过 NOVIC 进行无需提示词的分类
- 架构: 第一阶段识别出的感兴趣区域 (RoI) 被传递给 NOVIC,这是一个实时的、开放词汇的图像分类器。
- 机制: 与受提示词驱动的模型不同,NOVIC 可以生成自由形式的物体名词标签,而无需候选类别列表。它利用预训练的 CLIP 模型和一个在海量、内容可控的合成文本数据集(覆盖了近乎不受限的约 43K 个物体名词分类法)上训练的分类解码器。
- 评分: 最终置信度分数结合了 NOVIC 的预测概率以及源自 MAE 重建误差和掩码输出的异常置信度。
核心贡献
- 无需提示词的开放词汇检测: AnomNOVIC 是第一个成功将强大的无需提示词分类器 (NOVIC) 与类别无关定位流水线相结合的框架,实现了在无需任何预定义类别列表的情况下检测并标记物体。
- 基于异常的定位: 通过将物体检测建模为已知工作空间内的异常检测任务,该系统避免了词汇偏差。它利用“任何不属于此处的东西”即为物体的原则,从而实现了对任何形状、纹理或新颖物体的发现。
- 数据集与基准测试: 作者引入了一个针对 NICOL 人形机器人的具有挑战性的数据集收集方案,包括“纯净”和“干扰物”桌面场景,以及包含 48 种独特野外物体的“野外 (Wild)”测试集。
- 模型适配: 本研究详细介绍了针对机器人实验室环境进行的 NOVIC 变体(N-FT0, N-FT2)的重训练和频率阈值化处理,证明了数据集重加权可以提高在特定开放集场景下的性能。
实验结果
在 NICOL 桌面环境和 Wild 数据集上的评估显示,AnomNOVIC 显著优于包括 YOLOE(唯一可用的无需提示词基准模型)在内的现有先进模型,以及 OWLv2 和 YOLO-World-v2。
- 无需提示词的性能: 在纯净数据集上,AnomNOVIC-S(配合 SAM 精细化)实现了 47.1% AP 和 57.5% AP50 的表现,而 YOLOE 仅为 20.4% AP。在 Wild 数据集上,它达到了高达 82.6% 的检测与分类准确率,远超 YOLOE 的 14.2%。
- 受提示词驱动的性能: 当提供类别候选列表时,AnomNOVIC 达到了 59.0% AP 和 72.5% AP50,再次实现了比最强提示词驱动竞争对手(如 YOLO-World-v2-X)高出一倍的性能。
- 定性优势: 该系统能够提供细粒度且正确的分类(例如“银牌”、“音频放大器”),而提示词驱动的基准模型在这些情况下经常产生高置信度的误报或无法检测到新颖项目。
意义与主张
论文声称 AnomNOVIC 解决了提示词驱动模型的“强约束”问题,这种约束通过限制机器人仅能识别已知类别,削弱了开放词汇检测的核心优势。通过将定位与分类解耦并利用异常检测,该系统使机器人能够“在运行时与完全陌生的物体进行交互”。
作者将这项工作定位为迈向“具有语义感知能力的机器人”的一步,使其能够感知并与开放式环境进行交互。他们强调,该方法对于具有规范基准(如机器人的桌面)的已知工作空间特别有效,这使得在无需任务特定微调或类别提示的情况下,实现无偏且实时的未知物体发现成为可能。结果表明,将基于重建的异常检测与不受限的分类相结合,是实现机器人真正开放世界自主性的可行路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。