这篇论文介绍了一种名为 WS-COC 的新方法,它的核心目标是教人工智能(AI)像人类一样数数,而且不需要人类老师手把手地教它每一个物体在哪里(即“弱监督”),只需要告诉它“这张图里大概有多少个东西”就够了。
为了让你更容易理解,我们可以把这项技术想象成教一个刚入学的小学生(AI)去数操场上的人群。
1. 背景:为什么现在的 AI 数数很笨?
- 传统方法(全监督): 以前的 AI 数数,需要人类老师拿着红笔,在每一张图片里把每一个人、每一辆车都圈出来,并标上数字。这就像让老师给几千张图里的几百万个物体逐个画圈,既累又贵,而且一旦物体挤在一起(比如早高峰的地铁),老师根本数不清,AI 也就学不会。
- 大模型(MLLM)的尴尬: 现在的 AI 大模型(比如 LLaVA)很聪明,能看懂图、能聊天。但如果你直接问它:“图里有多少人?”,它通常只能猜个大概。在稀疏的场景(比如只有 5 个人)它数得挺准,但一旦面对密密麻麻的人群(比如几百人),它就会“晕头转向”,严重低估人数。这就像让一个平时只见过几个人在公园散步的孩子,突然去数春运火车站的人流,他肯定会数错。
2. 核心方案:WS-COC 的“三步走”策略
作者没有让 AI 直接硬背答案,而是设计了三个巧妙的“教学策略”,把“数数”这个难题拆解开来:
策略一:分而治之的“对话游戏” (Divide-and-Discern)
- 比喻: 想象你在玩一个猜数字的游戏。如果直接问“图里有多少人?”,AI 很难猜。
- 做法: 我们引导 AI 玩“二分法”游戏。
- 老师问:“人数超过 1000 吗?”AI 答:“不。”
- 老师问:“那超过 500 吗?”AI 答:“不。”
- 老师问:“那超过 250 吗?”AI 答:“是。”
- 就这样,通过多轮对话,把范围从"0-2000"一步步缩小到"100-150",最后再问具体数字。
- 效果: 这就像把一座大山(巨大的数字)拆成一个个小土坡,让 AI 一步步爬上去,大大降低了难度。
策略二:比大小排排坐 (Compare-and-Rank)
- 比喻: 直接让 AI 说出“这张图有 123 个人”很难,因为“数字”和“图片”是两种完全不同的语言。但让 AI 比较“哪张图人更多”就容易多了。
- 做法: 老师给 AI 看四张图,问:“请按人数从少到多给这四张图排个队。”
- 效果: 这就像让小学生先学会“谁高谁矮”,而不是直接背身高数据。通过这种“排序训练”,AI 对数量的相对感觉变得非常敏锐,不再容易把 100 人看成 10 人。
策略三:全局与局部的“拼图法” (Global-and-Local)
- 比喻: 当人群太密集时,AI 看整张图就像看一团黑雾,容易数漏(低估)。
- 做法:
- 先看整张图,猜个大概(全局)。
- 如果人太多,就把图切成 4 块小拼图(局部),分别数每一块,再加起来。
- 关键点: 切块数的时候,因为边缘的人可能被切开了,容易数多(高估);而看整图容易数少(低估)。作者发现这两个错误正好互补,所以把两个结果取个平均值,就能得到最准的数字。
- 效果: 就像用“广角镜头”看整体,再用“微距镜头”看细节,最后把两个视角结合起来,既不漏数也不重复。
3. 成果:用“弱监督”打败“强监督”
- 惊人的效率: 以前的方法需要给每个物体画圈(点级标注),WS-COC 只需要给整张图一个总数(图像级标注)。这就像以前教学生数数要一个个点苹果,现在只需要告诉学生“这篮苹果大概有 50 个”,学生自己就能学会。
- 性能强大: 实验证明,WS-COC 虽然只用了简单的“总数”作为老师,但在数数准确度上,竟然追平甚至超越了很多需要昂贵“画圈标注”的顶级方法。特别是在人山人海(密集场景)的情况下,它的表现提升巨大。
总结
这篇论文就像是在教 AI 一个聪明的数数技巧:
- 别硬猜,先猜范围(对话游戏);
- 别死记数字,先比大小(排序游戏);
- 别只看一眼,切块再拼合(拼图法)。
通过这三招,AI 不再需要人类老师拿着放大镜一个个数,就能学会在复杂的场景中准确数数。这不仅省下了巨大的标注成本,也让 AI 在拥挤、混乱的场景中变得真正“眼明手快”。
这是一篇发表于 ICLR 2026 的论文《BOOTSTRAPPING MLLM FOR WEAKLY-SUPERVISED CLASS-AGNOSTIC OBJECT COUNTING》(利用多模态大模型进行弱监督类无关目标计数)的技术总结。
1. 研究问题 (Problem)
- 核心任务:目标计数(Object Counting),即估计图像中特定目标实例的数量。
- 现有挑战:
- 全监督方法成本高:传统的全监督方法(如密度图回归)需要昂贵的像素级或点级标注(Point-level annotations),在密集场景(如人群、车辆)中,由于目标遮挡和数量巨大,标注极其耗时。
- 弱监督方法的局限性:现有的弱监督方法仅利用图像级计数(Image-level counts)作为监督信号,但通常局限于单一类别(如仅计数“人”),缺乏**类无关(Class-agnostic)**的通用性。
- 多模态大模型(MLLM)的不足:虽然 MLLM 具备强大的视觉 - 语言理解能力,但在零样本(Zero-shot)设置下,其在稀疏场景表现尚可,但在密集场景中往往严重低估目标数量。这主要是因为 MLLM 预训练数据中稀疏分布居多,且直接让 MLLM 回归具体数值存在模态鸿沟(Modality Gap)。
2. 方法论 (Methodology)
作者提出了 WS-COC(Weakly-Supervised Class-agnostic Object Counting),这是首个基于 MLLM 驱动的弱监督类无关目标计数框架。该方法仅使用图像级计数标签,通过三种简单而有效的策略来“启动”(Bootstrap)MLLM 的计数能力:
A. 分而治之的对话微调 (Divide-and-Discern Dialogue Tuning, D3T)
- 动机:直接让 MLLM 一次性预测精确数值很难。
- 策略:将计数任务转化为一系列范围判断任务。
- 通过多轮对话,引导模型判断目标数量是否落在特定区间(例如:“图中是否有超过 100 个苹果?”)。
- 采用“分治”思想,根据上一轮的判断结果(是/否),逐步缩小搜索区间(从粗粒度到细粒度)。
- 当区间足够小时,再让模型预测具体数值。
- 效果:将复杂的回归问题转化为简单的分类/判断问题,降低了学习难度,使模型能循序渐进地学习计数。
B. 比较与排序计数优化 (Compare-and-Rank Count Optimization, CRCO)
- 动机:直接优化预测值与真实值的差距受限于视觉特征与文本 token 之间的模态鸿沟。相比之下,判断图像间的相对数量关系更符合视觉直觉。
- 策略:
- 采样:针对长尾分布,将训练集中的图像按数量聚类(如分为 4 组),确保每组采样一张图,构成包含不同数量密度的图像集。
- 训练:构造指令让 MLLM 对多张图像按数量进行排序(例如:“按数量升序排列这四张图”)。
- 优化:使用语言模型损失函数优化排序结果。
- 效果:通过相对排序任务,增强了模型对不同密度场景的感知能力,避免了直接回归的模态不匹配问题。
C. 全局与局部计数增强 (Global-and-Local Counting Enhancement, GLCE)
- 动机:即使在微调后,MLLM 在极密集场景下仍倾向于低估(Underestimation)。
- 策略:在推理阶段采用“分块聚合”策略。
- 全局预测:先对整图进行全局计数预测 (cg)。
- 局部预测:如果 cg 超过阈值(判定为密集场景),将图像划分为 L×L 的子图,分别对每个子图进行独立计数,得到局部预测值之和 (cl)。
- 融合:由于全局预测倾向于低估,而局部聚合受边缘效应影响倾向于高估,最终结果取两者的平均值。
- 效果:利用全局和局部预测的互补性,显著降低了密集场景下的计数误差。
3. 关键贡献 (Key Contributions)
- 首个 MLLM 驱动的弱监督框架:提出了 WS-COC,首次实现了仅凭图像级标签即可进行通用的、类无关的目标计数。
- 三种创新策略:
- D3T:通过多轮对话将回归问题转化为范围判断,解决了直接预测难的问题。
- CRCO:引入相对排序优化,利用视觉直觉克服模态鸿沟。
- GLCE:通过全局 - 局部融合机制,专门解决密集场景下的低估问题。
- 性能突破:在多个基准测试中,WS-COC 的表现媲美甚至超越了许多需要点级标注的全监督SOTA 方法,同时大幅降低了标注成本。
4. 实验结果 (Results)
- 数据集:在 FSC-147(主要基准)、CARPK、PUCPR+ 和 ShanghaiTech 四个广泛使用的数据集上进行了评估。
- 主要发现:
- FSC-147 测试集:WS-COC 的 MAE 为 13.91,优于全监督方法 CountGD (14.76) 和 T2ICount (11.76 虽略低但在弱监督下极具竞争力),且显著优于零样本 MLLM-Zero (38.19) 和基线 WS-COC-Base (21.08)。
- 密集场景表现:在每图超过 100 个目标的密集场景中,WS-COC 将 MAE 从 MLLM-Zero 的 149.69 大幅降低至 54.37。
- 跨域泛化:在 CARPK、PUCPR+ 和 ShanghaiTech 等未见过的数据集上,WS-COC 展现了极强的泛化能力,性能优于大多数全监督方法。
- 效率:采用 LoRA 微调,训练时间仅需 3.44 小时,远低于其他全监督方法。
5. 意义与价值 (Significance)
- 降低标注门槛:证明了仅需图像级计数标签(极易获取)即可训练出高性能的通用计数模型,极大地降低了计算机视觉任务的数据标注成本。
- 解锁 MLLM 潜力:揭示了通过特定的提示工程(Prompting)和训练策略,可以充分挖掘 MLLM 在数量感知(Quantity Awareness)方面的潜力,使其从“稀疏理解”扩展到“密集感知”。
- 通用性:该方法不依赖特定类别的视觉特征,能够处理任意类别的目标计数,为开放世界(Open-world)场景下的目标分析提供了新的解决方案。
总结:WS-COC 通过巧妙的策略设计,成功将 MLLM 的通用推理能力转化为高精度的弱监督计数能力,在保持低标注成本的同时,实现了与全监督方法相当甚至更优的性能,特别是在极具挑战的密集场景下表现突出。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。