Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale
本文介绍了 Affogato,这是一个包含全自动流水线的框架,用于生成大规模、开放词汇的 3D 可操作性数据集(Affogato-750K),以及能够显著提升对未见物体和可操作性类别泛化能力的简单统一模型(Espresso)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个全新的、长相奇特的装置。你不知道它有什么用,但你需要弄清楚应该在哪里触摸它才能使其工作。也许你需要按下一个按钮,抓取一个把手,或者滑动一个开关。在机器人和人工智能领域,弄清楚“在哪里触摸”被称为示能性落地(affordance grounding)。
长期以来,教计算机掌握这项技能就像是通过只看开水沸腾的照片来教孩子烹饪一样。这太局限了。现有的数据集只包含一些特定的物体(比如椅子或杯子)和一些特定的动作(比如“坐”或“喝”)。如果计算机看到一个奇怪的新物体,它就会不知所措。
这篇论文介绍了一个名为 Affogato 的新系统,旨在教计算机如何理解任何物体以及如何与任何物体进行交互,而无需人类为每一个单品绘制地图。
以下是他们是如何实现的,其中用到了一些创意类比:
1. 问题所在:“人工地图”的瓶颈
想象一下,你想建立一个庞大的图书馆,里面记录着世界上每种物体的精确触摸位置图。
- 旧方法: 你雇佣一个团队的人员,让他们观察 3D 模型,然后在把手、按钮或座位周围画个圈。这既慢又贵,而且你只能针对几千种物体这样做。
- 结果: 计算机只学习了那几千种东西。如果你给它展示一种它从未见过的全新类型的烤面包机,它就不知道该按哪里。
2. 解决方案:“AI 组装线”(Affogato)
作者构建了一个全自动化的工厂(流水线),可以自主生成这些地图。他们没有雇佣人类来画图,而是雇佣了一个 AI“专家团队”来协同工作。
你可以把它想象成一个三人的建筑施工队在盖房子:
- 工人 1(创意生成器 - Gemma): 这个 AI 观察一个 3D 物体(例如一张椅子的渲染图像),并构思如何使用它的创意想法。它不仅仅是说“坐”,它可能会说,“按下这个杠杆以调节靠背”或“握住这个扶手以抬起它”。它生成了 750,000 个这类独特的交互想法。
- 工人 2(指向的手指 - Molmo): 一旦工人 1 说“握住这个扶手”,工人 2 就会观察图像并用数字手指精准地指向扶手。它非常擅长寻找位置,但有时可能会指得稍微偏一点。
- 工人 3(涂色师 - MobileSAM): 工人 2 的点仅仅是一个点。工人 3 会接过这个点,并在整个扶手上涂抹出一张“热力图”(一个发光的红色区域),以展示这个把手到底有多大。
神奇的技巧(多视角投票):
由于物体是 3D 的,施工队会从 25 个不同的角度观察它。如果工人 2 在 20 个角度下都指向了扶手,但在 5 个角度下指错了,系统就会进行投票。那 20 个正确的投票胜出,最终生成的地图就是扶手上一个完美的、发光的红色区域。
这个过程创造了 Affogato-750K:一个包含 150,000 个不同 3D 物体的 750,000 个交互地图的海量数据集。它涵盖的物体类型和动作种类远超以往任何数据集。
3. 测试:“Espresso”模型
为了证明这个海量数据集确实有效,作者构建了两个简单且高效的模型,分别命名为 Espresso-3D(针对 3D 物体)和 Espresso-2D(针对 2D 图像)。
你可以把这些模型想象成学生。
- 旧学生: 他们学习的是规模小、过时的教科书(旧数据集)。他们擅长识别椅子,但在面对奇怪的新物体时却失败了。
- Espresso 学生: 他们被给予了 Affogato-750K 数据集作为他们的教科书。
结果:
当 Espresso 学生被测试从未见过的物体(比如一种奇怪的新型灯具或复杂的机械零件)时,他们的表现明显优于旧学生。
- 他们具备泛化能力: 因为看到了如此多的例子,他们学习的是“抓取”或“按压”的概念,而不是仅仅死记硬背特定的形状。
- 他们在现实世界中有效: 尽管训练数据是由干净的计算机生成 3D 模型组成的,但 Espresso 模型在观察杂乱的、真实的机器人工作空间照片时,仍然能够找到正确的触摸位置。
4. 为什么这很重要(根据论文所述)
论文声称,最大的突破不仅在于新的模型,更在于数据集本身。
- 规模: 他们生成数据的规模是人类无法匹配的(750k 个标注)。
- 开放词汇: 该系统不限于一个包含 20 个单词的列表。它可以理解“向其中倒入液体”、“向下移动”或“戴在头上”,因为其 AI 能自然地生成这些描述。
- 可迁移性: 在这个海量数据集上进行预训练,也让其他现有的 AI 模型变得更好了,而不仅仅是作者自己的新模型。
总结
Affogato 是一个利用一系列 AI 模型自动为数十万个 3D 物体绘制“触摸地图”的系统。通过将这些海量、多样化的数据喂给简单的 AI 模型(Espresso),作者展示了计算机终于可以学习如何与几乎任何物体进行交互,即使是它们从未见过的物体,而且无需人类绘制一张地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。