Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
本文提出了一种分解式视觉 - 语言对齐框架,通过将文本提示分解为概念和属性令牌,并采用特征门控交叉注意力模块来强制实施组合语义,从而增强细粒度开放词汇分割,显著提升了模型对未见过的属性 - 类别组合的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人在杂乱的仓库中寻找特定物品。你希望它能找到一座“红色的、平顶的、工业建筑”。
目前大多数人工智能模型就像死记硬背闪卡的学生。如果它们分别见过“红色工业建筑”和“平顶建筑”的图片,当你要求它们寻找这种特定组合时,它们可能会感到困惑。它们倾向于将这些概念混合成一个模糊的整体,比如“红色 - 工业 - 平顶”,如果之前从未见过确切的这个短语,它们就会失败。它们无法轻易地将这个概念拆解,说出:“好的,我需要的是既红色、又平顶、且属于工业类型的建筑。”
本文提出了一种教机器人的新方法,称为“分解式视觉 - 语言对齐”。以下是其工作原理,使用简单的类比来说明:
1. 将句子拆解为成分(提示词分解)
作者不是将整个句子“红色平顶工业建筑”作为一个大文本块喂给机器人,而是将其拆解为独立的成分:
- 概念:“建筑”
- 属性 1:“红色”(具体指红色的建筑)
- 属性 2:“平顶”(具体指平顶的建筑)
- 属性 3:“工业”(具体指工业建筑)
通过将它们分离,机器人学会了“红色”对建筑意味着什么,“平顶”对建筑意味着什么,以及“工业”对建筑意味着什么,而不会将它们混淆。
2. “保安”系统(特征门控交叉注意力)
一旦机器人拥有了这些独立的成分,它就需要检查仓库。作者引入了一种称为特征门控交叉注意力的特殊机制。
将机器人的视觉想象成一道在仓库中扫描的聚光灯。
- “概念”(建筑)会打开聚光灯,以找到所有建筑。
- “属性”则像站在聚光灯前的保安。
- “红色”保安只有在建筑是红色时才会让光线通过。如果是蓝色,保安就会挡住光线。
- “平顶”保安只有在屋顶是平顶时才会让光线通过。
- “工业”保安只有在建筑属于工业类型时才会让光线通过。
机器人使用乘法滤波器(即“与”门)。这意味着只有当所有保安都说“是”时,光线才会保持开启。即使只有一名保安说“不”(例如,建筑是红色的但屋顶是尖顶的),光线也会被完全阻挡。这确保了机器人不会因为喜欢颜色而意外选中一座红色但屋顶是尖顶的建筑。
3. “确定性数学”(对数空间评分)
最后,机器人需要决定它对找到正确目标有多大的把握。
- 旧方法:如果你将小概率相乘(例如,0.5 的红色概率 × 0.5 的平顶概率),数字会迅速变得极小,导致数学计算不稳定且难以学习。
- 新方法:作者使用对数空间评分。想象一下,你不是在将概率相乘,而是在一本特殊的日志中累加“信心分数”。
- 如果机器人对颜色有 90% 的把握,它会获得高分。
- 如果它对屋顶有 90% 的把握,它会再获得一个高分。
- 它们将这些分数相加。
这种方法就像保持一个稳定的累计总数,而不是试图将微小的分数相乘。它使学习过程更加平滑,并防止机器人在需要检查许多属性时感到困惑。
结果
作者在两个数据集(建筑和一般物体)上测试了这种方法。他们发现,他们的方法在寻找从未见过的新组合方面要出色得多。
- 之前:如果机器人在训练期间见过“红色房子”和“蓝色房子”,如果它没见过特定的“绿色房子”组合,它就很难找到它。
- 之后:因为它分别学习了“红色”、“蓝色”和“绿色”的规则,以及它们如何与“房子”结合,所以即使它从未见过“绿色房子”,也能立即识别出来。
简而言之,这篇论文教会人工智能停止死记硬背整个短语,开始理解游戏的独立规则,使其能够应对它从未遇到过的各种新组合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。