← 最新论文
🤖 AI

Depth-Guided Video Object Counting in Crowded Scenes

本文提出了一种具有统一去重框架的深度引导检测器(DG-Det)以及一个新的 RGB-D 数据集,通过将深度线索与多尺度 RGB-D 交叉注意力机制相结合,显著提高了拥挤和遮挡场景下的视频目标计数准确度。

原作者: Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图数清一个杂乱拥挤的烤盘上每一块饼干的数量。如果你只看饼干的顶部,很容易产生混乱。两块饼干可能会挨在一起,或者一块饼干可能躲在另一块后面,使它们看起来像是一个大饼干而不是两块。在计算机视觉的世界里,这是一个巨大的问题。科学家们教计算机使用捕捉颜色和纹理的摄像头来“看”,这就像我们的眼睛一样。这被称为 RGB 数据。但当物体变得拥挤或发生遮挡时,标准摄像头会被欺骗。它无法分辨两个看起来相似的物体实际上是独立的个体,还是仅仅是一个大的色块。为了解决这个问题,研究人员开始为计算机的视觉增加一种新的感官:深度。把深度想象成一把 3D 尺子,它能告诉计算机每个像素点距离有多远,从而创造出一种前后感。这篇论文深入探讨了一个特定的挑战:在物体紧密堆叠且不断互相遮挡的视频中进行物体计数,比如繁忙的仓库货架或拥挤的商店过道。

来自哈尔滨工业大学和香港城市大学的研究人员意识到,仅仅添加深度信息是不够的;计算机需要一种更聪明的方式来使用它。他们发现,简单地将彩色图像和深度图堆叠在一起(就像把两张纸叠放在一起)效果并不好,因为计算机会被两种不同类型数据之间的差异所困扰。相反,他们构建了一个名为 DG-Det(深度引导检测器)的新系统,作为统一框架的一部分。

以下是他们的发明是如何运作的,我们用一个有趣的类比来解释:想象计算机是一名正在试图统计拥挤房间里人数的侦探。

  1. 深度引导侦探 (DG-Det): 在第一阶段,侦探不仅观察人们穿着什么(颜色/RGB),还会使用特殊的 3D 扫描仪(深度)来观察谁站在谁的前面。论文引入了一个巧妙的技巧,叫做“深度亲和力偏差”(Depth Affinity Bias)。你可以把它理解为一条规则:“如果两个东西看起来非常相似,但处于不同的距离,那么它们一定是不同的人!”这有助于计算机分离那些接触或重叠的物体,而这些情况通常会导致计数遗漏。他们还增加了一个特殊的“遮挡头”(occlusion head),它就像一个信心计,用来猜测:“嘿,这个物体现在可能正被遮挡着呢,”这样计算机就不会因为物体被挡住而放弃计数。

  2. 记忆守护者 (DG-Track): 计数不仅仅是关于一个瞬间,而是关于整个视频。如果计算机在第 1 帧看到一个红色的盒子,在第 2 帧看到同一个红色盒子,它需要知道这是同一个盒子,而不是一个新的。旧的方法在盒子短暂消失时经常会产生混乱。新系统利用 3D 深度数据来追踪盒子的旅程。即使盒子在货架后面消失了一秒钟,深度信息也能帮助计算机记住它在哪里以及它应该在哪里重新出现。他们还使用了一种“投票”系统,该系统会根据物体的隐藏程度进行调整,确保他们不会因为物体忽隐忽现而错误地重复计数。

为了测试他们的想法,团队不能只使用旧视频,因为那些视频只有彩色图像。因此,他们创建了一个全新的数据集,名为 RGBD-VideoCount。这是一个包含 195 个视频片段的集合,涵盖了 6 种不同类型的物品(如书本、包和瓶子)在拥挤场景中的表现,所有片段都同时使用彩色摄像头和深度传感器进行记录。这就像是给了计算机一整套全新的 3D 谜题去解决。

结果非常令人振奋。当他们将这种方法与现有技术进行对比测试时,发现他们的深度引导方法带来了巨大的变化。具体而言,他们报告称,与现有基准模型相比,其 MAE(平均绝对误差,基本上就是计算机犯错的平均次数)降低了 62.01%。他们也看到了 RMSE(均方根误差,另一种衡量计数偏差程度的方法)的提升。论文指出,虽然单纯添加深度会有帮助,但真正的魔力在于他们如何将深度数据与彩色数据进行融合,以及如何利用它来预测物体何时被遮挡。

有趣的是,论文还测试了如果深度数据不完美会发生什么。他们模拟了“噪声”(就像电视上的雪花点)和“模糊”(就像透过雾蒙蒙的窗户看东西)。他们发现,即使深度图存在一些缺失的空洞或有些模糊,他们的系统在计数方面仍然表现得相当出色,尽管随机的静态噪声会让它变得有些吃力。这表明该方法对于现实世界的使用具有足够的鲁棒性,因为在现实中,传感器并不总是完美的。

简而言之,这篇论文不仅仅是在说“让我们使用 3D 摄像头”。它展示了通过教计算机理解颜色与深度之间的关系,并赋予它一种猜测物体何时被隐藏的能力,我们终于可以在最混乱、最拥挤的场景中实现准确计数。这是迈向让计算机能够像我们一样,拥有空间感和深度感,而不仅仅是看到一张平面图像,从而真正“看见”世界的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →