← 最新论文
💻 computer science

What is the Right Embedding Space for Contrastive Learning in REC?

本文介绍了 C-REX,这是一个插件式的监督对比学习框架,它通过将负采样从文本转向图像内的视觉标记,从而提升了指代性表达计数(Referring Expression Counting)的任务性能,进而通过增强细粒度的视觉判别能力和泛化能力实现了最先进的性能。

原作者: Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人在一个乱糟糟的房间里数东西。如果你只是说“数数椅子”,机器人可能会把每一把椅子都数进去,甚至是坏掉的或者颜色不同的椅子。但如果你的要求是“数数那些带轮子的红椅子”呢?这是一个被称为**指代性表达计数(Referring Expression Counting)**的棘手任务。这就像是在人群中让朋友找“那个戴蓝帽子的家伙”。挑战在于,机器人需要理解图片中的微小细节(蓝帽子),并将它们与你所说的词语完美匹配。

为了实现这一点,计算机通常使用一种叫做**对比学习(Contrastive Learning)**的技术。你可以把它想象成一场“找不同”的游戏。计算机通过观察一张图片和一句话,然后尝试弄清楚图片的哪些部分与句子相匹配,哪些部分不匹配。通常,计算机会将图片与文字进行并排比较,试图让它们在脑海中“契合”在一起。但有时,计算机理解图片的方式与理解文字的方式并不完全一致,就像试图把方榫头塞进圆孔里一样。这篇论文提出了一个简单而重大的一问:是否有一个更好的地方,可以让计算机玩这场“找不同”的游戏?

这篇论文的作者科斯塔斯·特里亚里迪斯(Kostas Triaridis)及其团队认为,计算机一直是在错误的房间里玩游戏。他们建议,与其将图片与文字进行比较(这既混乱又容易造成困惑),不如让计算机只将图片与其他的图片进行比较。他们将这种新方法称为 C-REX

以下是 C-REX 的工作原理,我们用一个有趣的类比来解释:想象你是一位老师,正试图整理一堆混杂在一起的动物照片。

  • 旧方法(图文对比): 你举起一张狗的照片,然后展示一张写着“狗”的卡片。接着,你举起一张猫的照片,再展示一张写着“狗”的卡片。你试图教学生将照片与卡片进行匹配。但有时学生会感到困惑,因为卡片和照片看起来完全不像。此外,你展示给他们的卡片数量有限,所以学生无法获得足够的练习。
  • 新方法(C-REX): 你把卡片扔掉。相反,你只是展示一大堆照片。你说:“看这张狗的照片。现在,看看其他这些照片。哪些也属于狗?哪些肯定不是狗?”因为你有一百多张照片在这一堆里,学生可以反复练习如何发现差异。他们学会了观察让一只狗成为狗的细微特征,而不会被令人困惑的文字所干扰。

研究发现,这种“仅限图片”的方法效果要好得多。通过完全专注于图像内部的视觉细节,计算机能够更准确地分辨出非常相似的事物——比如骑自行车的人和骑摩托车的人。作者在三种不同的计算机模型上进行了测试,发现 C-REX 让它们变得明显更加聪明。事实上,这些模型在正确计数方面的表现(以名为 MAE 的得分衡量)提升了高达 28%,在处理重大错误方面的表现(以 RMSE 衡量)提升了 24.5%

研究人员还展示了这种技巧不仅适用于针对特定词汇进行计数,它也适用于对任何类型的物体进行计数。他们甚至在一种非常先进的通用型机器人大脑(大语言模型)上进行了测试,发现专门的 C-REX 方法在工作中依然表现得更好。

简而言之,这篇论文表明,在教计算机在人群中计数特定事物时,我们不应该依赖它们将文字与图片进行匹配。相反,我们应该让它们通过图片与图片进行比较,为它们提供一个巨大的视觉示例游乐场来学习。这种简单的转变使它们变得更加精准、稳定,并为现实世界做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →