Token-Based Affordance Grounding with Large Vision-Language Models
本文提出了 TokAG,这是一个零样本示能性定位(affordance grounding)框架,它利用空间感知型标记选择机制从大型视觉语言模型中提取以物体为中心的注意力图,从而在无需外部监督的情况下,在定位动作相关区域方面实现了优于以往弱监督方法的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何与世界互动。你不仅希望机器人知道一个物体“是什么”(例如,“那是一把椅子”),你还希望它知道“如何使用”它(例如,“坐在这里”、“推这里”或“用这个切割”)。这种理解动作发生位置的能力被称为示能性定位(Affordance Grounding)。
本文介绍了一种名为 TokAG 的新方法,它能帮助计算机精确找出人类应该在物体的哪个部位执行动作,而无需通过成千上万个标注好的示例进行人工教学。
以下是其工作原理的简单类比说明:
问题所在:“盲目”的向导
以往的方法就像是一个试图通过看一张模糊的照片和一段极短的笔记(仅写着“坐”)来猜测摩托车上哪里可以坐的学生。
- 困惑: 如果照片显示的是一辆摩托车,而笔记只说“坐”,计算机可能会感到困惑。是坐垫?是车把?还是油箱?
- 局限性: 旧的方法通常依赖于简短、模糊的指令。当一张图片中同时发生多件事时(比如有人拿着牙刷的同时正在用它刷牙),或者两个动作看起来很相似时(比如“骑”自行车和“坐在”自行车上),它们会表现得非常吃力。它们往往指向整个物体,而不是执行动作所需的特定部分。
解决方案: “超级阅读者” (LVLM)
作者意识到,大型视觉语言模型(LVLMs)——即这类能够观察图片并撰写详细故事的 AI——即使不直接说出来,其实对于事物“在哪里”也非常聪明。
可以将 LVLM 想象成一位超级阅读者,它观察一张图片并阅读一个问题(例如,“牙刷的哪个部分是用来刷牙的?”)。
- 超级阅读者不仅仅是吐出答案“刷毛”。
- 当它正在逐字逐句生成答案时,它实际上也在秘密地将它的内部“手指”(注意力)指向图像的不同部分。
- 有时,它会指向背景(洗手池);有时,它会指向整个牙刷。但当它想到“刷毛”这个词时,它的内部手指会非常强烈地指向刷毛部分。
创新点: “聚光灯选择器” (TokAG)
棘手的部分在于,超级阅读者会生成整个句子,并且对于它说的每一个词,它都会指向许多不同的地方。如果你只看整个句子,这种“指向”会变得混乱且模糊。
TokAG 就像是一个聚光灯选择器,它解决了这个混乱问题:
- 提问: 它向超级阅读者询问一个关于动作的具体问题(例如,“人们坐在床上时,使用的是哪个部分?”)。
- 逐词扫描: 当 AI 生成答案(例如,“床垫”)时,Tok vai 观察生成的每一个词的“注意力图”(内部指向)。
- 过滤: 它忽略那些指向背景或整个房间的词。它寻找的是 AI 的内部指向最集中在物体上的那个特定词汇。
- 例子: 当 AI 说“床垫”时,它的注意力紧紧聚焦在床的表面。当它说“床”时,注意力可能会分散开来。TokAG 会捕捉“床垫”这一瞬间。
- 结果: 它将那个特定的“聚焦时刻”转化为一张清晰的热力图,展示出准确的坐下位置。
为什么它更好
- 无需训练: 与需要对数百万张标注照片进行“训练”(就像学生背诵教科书)的以往方法不同,TokAG 是**零样本(zero-shot)**工作的。它只是利用了 AI 已有的知识,就像一个聪明的人在不需要说明书的情况下就能理解新情况一样。
- 精准度: 它可以区分“坐在”摩托车上(坐垫)和“推”摩托车(车把),尽管它们是同一个物体。
- 性能: 论文表明,TokAG 的表现显著优于以往的方法。在标准测试中,即使没有使用任何训练数据,它的准确率也比现有的最佳技术提高了约 10% 到 30%。
缺陷(局限性)
论文指出,这种方法依赖于 AI 生成一个指向正确位置的“关键词”。
- 复杂动作: 如果一个动作需要两只手或两个不同的部分同时配合(比如“打开罐子”,需要一只手按住盖子,另一只手握住罐身),目前的这种方法可能会遇到困难,因为它正在寻找一个单一的“最佳”词汇来进行指向。
- 干扰因素: 如果物体上有醒目的 Logo 或文字,AI 可能会被分散注意力,转而指向 Logo 而不是功能部分。
总结
TokAG 是一个巧妙的技巧,它将一个“聊天机器人”式的 AI 变成了一个精准的“指针”。它不是要求 AI 画一个框或写下坐标,而是要求 AI 描述动作,然后通过监听哪一个词会导致 AI 最专注地看向物体的正确部分。它将 AI 的“思考过程”转化为了一个精准的地图,供机器人和计算机遵循。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。