← 最新论文
💻 computer science

PPSNet: Perceptual Prior Similarity-guided Network for Class-agnostic Counting

本文介绍了 PPSNet,一种类无关计数框架,该框架在理论上验证了“提取与匹配”(Extract-and-Match)范式,并通过采用感知先验构建模块来优化尺度分布,以及利用相似度引导权重模块来增强特征匹配,从而解决了基于边界框的视觉样本的局限性,进而实现在视觉、文本及零样本提示场景下的卓越性能。

原作者: Shengwei Jia, Junhui Liu, Jiahao Wang, Yongqiang Cui, Shihui Zhang

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengwei Jia, Junhui Liu, Jiahao Wang, Yongqiang Cui, Shihui Zhang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正试图在一个拥挤的房间里破解谜题的侦探。你的任务是数出有多少人戴着红色的帽子。在过去,如果你想数蓝色的帽子,你必须雇佣一整支只知道识别蓝色的新侦探团队。但如果ed你可以通过展示一个例子,就教会一名侦探如何计数任何种类的帽子呢?这就是“类无关计数”(class-agnostic counting)的世界——它是计算机视觉的一个分支,让机器能够学习计数任何类型的物体——无论是鸟类、汽车还是饼干——而无需为每种新类型都准备一份专门的训练手册。

为了做到这一点,侦探通常需要一个“提示”(prompt),即一个小小的暗示来告诉他们要寻找什么。有时这个暗示是一个句子,比如“数数海鸥”,或者有时只是由机器自行猜测。但目前最准确的方法一直是“视觉引导”计数:向计算机展示几个关于目标物体的微型图片(范例),这些图片通常被画在一个方框内。你可以把它想象成递给侦探一张海鸥的照片,并说:“找出所有长得像这个的东西。”问题在于,这个方框有点笨拙。它经常会连同鸟儿一起抓取一大块海洋或天空。随着计算机思考的深入,它会开始被这些额外的背景噪声所迷惑,认为海水也是鸟的一部分,从而导致错误的计数。

这篇论文介绍了一个名为 PPSNet(感知先验相似度引导网络,Perceptual Prior Similarity-guided Network)的新型侦探团队,它修复了这些笨拙的错误。研究人员认为,旧的工作方式——即计算机先分别研究照片和范例,然后再尝试进行匹配——就像是在试图解开一个拼图,手里拿着碎片,另一只手拿着图画,却从未让两只手接触在一起。他们提出了一种新的方式,让计算机从一开始就将照片和范例放在一起观察,使它们能够实时进行交流并完善理解。

但 PPSNet 不仅仅改变了它们“如何”观察,还改变了它们“看到什么”。团队注意到,以前用来抓取范例的方框太乱了。因此,他们构建了一个特殊的工具,称为感知先验构建模块(Perceptual Prior Construction Module)。想象一下,如果不再是仅仅递给侦探一张模糊且被拉伸的海鸟照片,而是同时给了他们一张心理地图——一个发光的“热力图”——显示出在那个混乱的方框中,鸟的具体位置在哪里,以及海洋从哪里开始。这张地图告诉计算机:“忽略海水;专注于鸟。”这阻止了计算机被通常会误导它的背景噪声所干扰。

此外,团队还添加了一个相似度引导权重模块(Similarity-guided Weighting Module)。它就像一个聚光灯。一旦计算机在大图中找到了一个看起来像范例的地方,这个模块就会调高该处的亮度并调暗其他地方。这就像侦探在说:“啊哈!这看起来和我看到的鸟完全一样!”并忽略房间里的其他部分。他们还证明了,当他们训练计算机去关注鸟与背景之间的差异时,这种“聚光灯”效果最好,这种技术类似于人类通过比较来学习区分事物的方式。

结果令人印象深刻。在包含从停车场到人群等数千张图像的海量数据集上进行测试时,PPSNet 比以往任何方法都犯更少的错误。例如,在一个包含 6,135 张图像的测试集上,这种新方法显著降低了平均计数误差。即使研究人员完全移除视觉范例,让计算机仅根据文本描述或在没有任何提示的情况下进行计数,它依然有效,尽管在能够看到几个范例时表现最为出色。

作者谨慎地指出,虽然他们的方法是一个重大进步,但它并非魔法;它仍然依赖于计算机观察图像和范例。他们还指出,以前使用方框抓取范例的方法本质上是有缺陷的,因为这种方法强行将不规则的形状放入僵硬的框架中,从而丢失了重要的细节。PPSNet 不仅仅是修补了这个漏洞;它建立了一个新的基础,能够比方框更好地理解物体的形状和分布。通过将物体的“心理地图”与突出匹配项的“聚光灯”相结合,这个新网络帮助计算机以一种此前无法企及的精度来计数这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →