想象一下,你正在教一个机器人在一个乱糟糟的房间里数东西。如果你只是说“数数椅子”,机器人可能会把每一把椅子都数进去,甚至是坏掉的或者颜色不同的椅子。但如果你的要求是“数数那些带轮子的红椅子”呢?这是一个被称为**指代性表达计数(Referring Expression Counting)**的棘手任务。这就像是在人群中让朋友找“那个戴蓝帽子的家伙”。挑战在于,机器人需要理解图片中的微小细节(蓝帽子),并将它们与你所说的词语完美匹配。
为了实现这一点,计算机通常使用一种叫做**对比学习(Contrastive Learning)**的技术。你可以把它想象成一场“找不同”的游戏。计算机通过观察一张图片和一句话,然后尝试弄清楚图片的哪些部分与句子相匹配,哪些部分不匹配。通常,计算机会将图片与文字进行并排比较,试图让它们在脑海中“契合”在一起。但有时,计算机理解图片的方式与理解文字的方式并不完全一致,就像试图把方榫头塞进圆孔里一样。这篇论文提出了一个简单而重大的一问:是否有一个更好的地方,可以让计算机玩这场“找不同”的游戏?
这篇论文的作者科斯塔斯·特里亚里迪斯(Kostas Triaridis)及其团队认为,计算机一直是在错误的房间里玩游戏。他们建议,与其将图片与文字进行比较(这既混乱又容易造成困惑),不如让计算机只将图片与其他的图片进行比较。他们将这种新方法称为 C-REX。
以下是 C-REX 的工作原理,我们用一个有趣的类比来解释:想象你是一位老师,正试图整理一堆混杂在一起的动物照片。
- 旧方法(图文对比): 你举起一张狗的照片,然后展示一张写着“狗”的卡片。接着,你举起一张猫的照片,再展示一张写着“狗”的卡片。你试图教学生将照片与卡片进行匹配。但有时学生会感到困惑,因为卡片和照片看起来完全不像。此外,你展示给他们的卡片数量有限,所以学生无法获得足够的练习。
- 新方法(C-REX): 你把卡片扔掉。相反,你只是展示一大堆照片。你说:“看这张狗的照片。现在,看看其他这些照片。哪些也属于狗?哪些肯定不是狗?”因为你有一百多张照片在这一堆里,学生可以反复练习如何发现差异。他们学会了观察让一只狗成为狗的细微特征,而不会被令人困惑的文字所干扰。
研究发现,这种“仅限图片”的方法效果要好得多。通过完全专注于图像内部的视觉细节,计算机能够更准确地分辨出非常相似的事物——比如骑自行车的人和骑摩托车的人。作者在三种不同的计算机模型上进行了测试,发现 C-REX 让它们变得明显更加聪明。事实上,这些模型在正确计数方面的表现(以名为 MAE 的得分衡量)提升了高达 28%,在处理重大错误方面的表现(以 RMSE 衡量)提升了 24.5%。
研究人员还展示了这种技巧不仅适用于针对特定词汇进行计数,它也适用于对任何类型的物体进行计数。他们甚至在一种非常先进的通用型机器人大脑(大语言模型)上进行了测试,发现专门的 C-REX 方法在工作中依然表现得更好。
简而言之,这篇论文表明,在教计算机在人群中计数特定事物时,我们不应该依赖它们将文字与图片进行匹配。相反,我们应该让它们通过图片与图片进行比较,为它们提供一个巨大的视觉示例游乐场来学习。这种简单的转变使它们变得更加精准、稳定,并为现实世界做好准备。
技术摘要:用于指代性表达计数(Referring Expression Counting)的 C-REX
问题陈述
指代性表达计数(REC)要求模型根据细粒度的文本描述(例如,“骑摩托车的行人”与“走路的行人”)来统计图像中特定类别的物体。其核心挑战在于如何区分那些仅在细微上下文或属性层面存在差异、但在视觉上高度相似的物体。
现有的最先进 REC 方法通过**图文对比学习(CL)**来解决这一问题。这些方法训练模型将视觉 Token 与正向文本提示对齐,同时将它们从负向文本提示中推开。然而,作者指出该策略存在两个关键局型:
- 负样本稀缺性: 对于单张图像,可用的负向指代表达数量非常有限(通常少于 5 个),而对比学习在理论上受益于具有多样性的庞大负样本批次,以学习鲁棒的表示。
- 嵌入对齐偏差: 图文对比学习的有效性高度依赖于图像和文本嵌入空间之间的对齐程度。作者认为,这种对齐往往是不完美的,导致视觉嵌入将语义不同但视觉相似的物体纠缠在一起,从而阻碍了细粒度的判别能力。
方法论:C-REX
为了克服这些局限性,作者提出了 C-REX(用于指代性表达计数的对比学习),该框架将对比学习完全转移到了视觉嵌入空间,消除了对文本嵌入进行对比目标的依赖。
核心机制
C-REX 不再将图像 Token 与文本 Token 进行对比,而是将图像 Token 与同一图像内的其他图像 Token 进行对比。
- 样本定义: 对于给定的图像和指代表达(RE),模型预测物体位置。利用二分匹配(Bipartite Matching),预测的 Token 被匹配到地面真值(ground-truth)点。
- 正样本 (I+): 与特定 RE 对应的地面真值物体相匹配的图像 Token。
- 负样本 (I−): 图像中的所有其他图像 Token(包括具有不同属性的同类物体、不同类别的物体或背景 Token)。
- 损失函数修改: 作者改编了标准的监督对比损失 [35]。一个关键的修改是仅使用正样本作为锚点(anchors)。
- 标准的监督对比学习通常将同类别的所有样本拉近。然而在 C-REX 中,负样本集 (I−) 是异构的(包含汽车、行人、背景等)。将这些多样化的负样本聚类在一起会适得其反。
- 因此,损失函数的公式化旨在将正向 Token 拉近彼此,同时将它们推离所有负向 Token,而不强制要求负样本聚类。
- 目标函数定义为:
Lsup∗=i∈I+∑−log∣I+∣−11p∈I+−{i}∑∑α∈I−{i}exp(zi⋅zα/τ)exp(zi⋅zp/τ)
- 集成方式: C-REX 作为一个插件模块。它可以替换现有 REC 架构(如 GroundingREC、CAD-GD)中的图文对比损失,或者作为标准计数损失的补充添加到基于检测的基线模型(如 GroundingDINO)中。文本输入仍通过交叉注意力机制用于约束视觉骨干网络,但判别性的监督信号完全来自于视觉空间。
向类别无关计数(Class-Agnostic Counting)的扩展
该框架通过基于目标类别而非特定 RE 来定义正样本,从而被适配用于类别无关计数。虽然其改进程度不如 REC 显著(因为类别层面的区分已经更容易学习),但它仍然带来了性能提升。
核心贡献
- 转向图像空间对比学习: 论文证明,在 REC 任务中,完全在图像嵌入空间内进行对比学习优于图文对比学习,因为它提供了更稳定的信号并避免了对齐问题。
- 可扩展的负采样: 通过利用未匹配的视觉 Token 作为负样本,C-REX 将负样本池从区区几个文本提示增加到了每张图像数百个视觉 Token,显著增强了监督的稳定性。
- 即插即用框架: C-REX 被设计为与架构无关,能够无缝集成到现有的 REC 模型中,无需改变结构。
- 达到最先进性能(SOTA): 该方法在多个骨干网络和架构下,在 REC-8K 数据集上取得了新的 SOTA 结果。
实验结果
作者在 REC-8K 和 FSC-147 数据集上使用三种架构评估了 C-REX:GroundingREC、CAD-GD 和 GroundingDINO。
- 性能增益: 在 REC-8K 数据集上,与基线相比,C-REX 的性能提升最高达 28% 的平均绝对误差(MAE)(在采用 Swin-T 骨干网络的 GroundingREC 验证集上观察到)以及 24.5% 的均方根误差(RMSE)(在采用 Swin-T 骨干网络的 GroundingDINO 测试集上观察到)。
- 一致性: 在所有物体密度范围(0–20, 21–50, 51–100, 100+)内均观察到改进,尤其是在细粒度判别任务(例如,区分“蓝色汽车”与“黑色汽车”或“骑自行车的人”与“骑摩托车的人”)中表现出显著增益。
- 消融实验:
- 图像空间 vs. 图文空间: 纯图像空间的对比学习优于图文对比学习以及两者的结合,这表明当图像空间信号得到优化时,图文信号是次优或冗余的。
- 正样本选择: 使用二分匹配来选择正样本优于基于文本提示相似度的策略。
- 损失函数修改: 修改后的损失函数(仅使用正样本作为锚点)显著优于标准的监督对比损失公式。
- 鲁棒性: 与基线相比,C-REX 对改写后的指代表达展现出了更强的鲁棒性。
- 与视觉语言模型(VLMs)的比较: 配备 C-REX 的专门化 REC 模型在零样本(zero-shot)和少样本(few-shot)设置下,性能显著优于通用视觉语言模型(如 Molmo2-4B),凸显了针对特定任务进行训练的必要性。
意义与主张
论文声称,在 REC 任务中,进行对比学习的“正确嵌入空间”是视觉嵌入空间,而非图文空间。通过将对比目标与文本模态解耦,模型可以学习到更丰富、更稳定的细粒度视觉表示。作者强调,这种方法解决了负样本稀缺和跨模态对齐不稳定的问题,从而在开放世界计数场景中实现了卓越的泛化能力。该框架被呈现为一个通用的工具,不仅可以增强 REC,还可以增强其他需要细粒度判别能力的计数任务,例如类别无关计数。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。