想象你走进一家繁忙的咖啡店。你看到人们坐在桌旁、排着队,或围成小圈聊天。你的大脑瞬间完成两件事:它判断谁属于哪个群体,并推测该群体正在一起做什么(例如“学习”、“争吵”或“排队”)。
这篇名为ProGraD的论文,旨在教会计算机做到完全相同的事情。这是一种帮助人工智能理解“群体活动检测”(GAD)的新方法——即识别视频中的社交群体并推断其活动的能力。
以下是他们构建该系统的故事,使用了简单的类比:
1. 问题:那位“错过重点”的“超级专家”
研究人员从一个非常强大的 AI 工具——视觉基础模型(VFM)——开始。可以将这个模型想象成一位超级专家艺术评论家,他研究过数百万幅画作。它在识别单个物体(如椅子、杯子或人脸)方面非常出色。
团队试图直接将这位“超级专家”接入现有的群体理解系统中。他们心想:“如果 AI 在识别物体方面如此聪明,那它在识别群体方面也应该很出色,对吧?”
令人惊讶的是: 这实际上让情况变得更糟。
- 类比: 想象聘请一位世界级的艺术评论家来管理一个混乱的游乐场。这位评论家擅长识别球的颜色或滑梯的形状,但他无法理解正在玩捉人游戏的孩子是一个“团队”,或者因争夺玩具而争吵的孩子构成了“冲突”。这位评论家过于关注物体,而忽略了社交故事。
- 结果: 当他们用这位新的“超级专家”替换旧系统时,AI 变得困惑了。它意识到,拥有更敏锐的“物体之眼”是不够的;真正的问题在于系统如何解读人与人之间的关系。
2. 解决方案:“群体侦探”(ProGraD)
为了解决这个问题,团队构建了ProGraD。他们没有尝试重新训练整个“超级专家”(这既昂贵又缓慢),而是保持专家部分冻结,并在其上方添加了一个小型、智能的层。
将 ProGraD 想象成一位与艺术评论家协作的专业侦探。
- 冻结的骨干(艺术评论家): 这部分保持完全不变。它只是观看视频并指出:“这里有个人,这里有一张桌子,这里有一个杯子。”
- 可学习的群体提示(侦探的笔记): 团队给侦探提供了一组“便利贴”(称为提示)。这些笔记向评论家提出具体问题,例如:“这个人属于某个群体吗?”或“这两个人正在互动吗?”这引导评论家去关注它通常忽略的社交线索。
- 群体上下文 Transformer(侦探的大脑): 这是 ProGraD 的核心。它是一个轻量级的、两步走的推理引擎:
- 分组注意力: 它询问:“谁和谁在一起?”它观察所有人,并根据他们的行为(而不仅仅是站立的距离)开始组建团队。
- 上下文注意力: 它询问:“整个场景是关于什么的?”它观察背景(如排队区域或冲突地带),以帮助确认群体的活动。
3. 为何它独具特色
- 效率: 旧系统试图重新训练 AI 的整个“大脑”,这就像为了修复一个漏水的水龙头而重建整栋房子。ProGraD 只是更换了水龙头(解码器),并添加了一些智能指令(提示)。它使用的计算能力不到先前方法的一半。
- 准确性: 在一个名为"Café"的测试数据集上(其中充满了在咖啡店做各种事情的人),ProGraD 的表现显著更好。它正确识别群体及其活动的频率远高于之前的最佳方法。
- 理解“异常值”: 有时,一个人站在群体附近但并不属于该群体(也许他只是在等朋友)。旧系统经常错误地将他们拉入群体。ProGraD 更擅长判断:“嘿,那个人是个异常值;他不属于这个群体。”
4. 实际运行效果
论文展示了“注意力图”(显示 AI 关注位置的 heatmap)。
- 旧系统: AI 四处张望,被桌子或墙壁等背景物体分散注意力。
- ProGraD: AI 锐利地聚焦于人物及其互动。如果一群人在争吵,AI 会关注他们的手和脸。如果一群人在学习,它会关注他们的书本和共享空间。它忽略了无关的背景。
总结
该论文证明,仅仅给 AI 一双“更敏锐的眼睛”不足以理解人类群体。你还需要一种更好的思维方式来理解人与人之间的关系。
ProGraD 是一个新框架,它利用一个强大的预训练 AI,添加一些“智能笔记”来引导它,并使用一个轻量级的“侦探”层来推断谁属于哪个群体以及他们在做什么。它比以前更快、更便宜、更准确,特别是通过关注人与人之间的关系,而不仅仅是人本身。
技术摘要:ProGraD 用于群体活动检测中的结构化关系推理
1. 问题定义
群体活动检测(GAD) 扩展了传统的群体活动识别,要求模型在场景中同时定位多个社交群体、推断群体成员关系(谁与谁一起行动),并分类集体活动。由于交互重叠、遮挡以及需要动态推断群体结构而非依赖固定的空间聚类,该任务极具挑战性。
本文指出了将视觉基础模型(VFMs)(例如 DINOv2)适配到 GAD 任务时的一个关键瓶颈。尽管 VFMs 提供了卓越的特征表示,但将其简单地替换到现有的 GAD 流程中(这些流程原本是为 CNN 骨干网络设计的)会导致性能下降。例如,在“实用 GAD(Practical GAD)”框架中,将 ResNet-18 骨干网络替换为冻结的 DINOv2 骨干网络,导致 Group mAP@1.0 从 10.85 下降到 9.46。作者认为,主要限制因素并非特征质量,而是缺乏能够在冻结 VFMs 的表示空间内对“演员 - 群体”关系进行建模的结构化、群体感知解码机制。
2. 方法论:ProGraD
作者提出了 ProGraD(基于提示的群体活动检测),这是一个利用**参数高效微调(PEFT)**和专用关系解码器来适配冻结 VFMs 的框架。该架构由三个主要组件构成:
A. 基于 PEFT 条件化的特征提取
- 冻结骨干网络: 模型利用冻结的 VFM(具体为 DINOv2-Base)提取图像块级 token 和演员 token(通过 ROI Align)。
- 可学习群体提示: 与全量微调或重型适配器不同,ProGraD 将可学习群体提示(Gprompt)注入到 VFM 输入序列中。这些提示充当特定任务的查询,使冻结的骨干网络能够揭示与社会相关的语义(例如交互中的演员、群体的空间排列),而无需改变骨干网络的权重。
- Token 生成: 演员 token 通过 1×1 RoI 池化从经提示条件化的特征图中提取,生成保留空间精度的紧凑表示。
B. GroupContext Transformer (GCT)
核心创新是一个轻量级的两层 GroupContext Transformer,旨在显式地将“演员 - 群体”形成与全局上下文聚合分离开来。它分两个阶段运行:
- 分组注意力层: 该层初始化可学习的群体 token,并对演员 token 执行交叉注意力。它从可能相距甚远或时间上分离的演员处聚合信息,以形成连贯的群体组成表示(Ggrp)。
- 上下文注意力层: 该层通过关注全局场景上下文(图像块 token)来丰富更新后的群体 token 和演员 token。这注入了关于空间排列、背景物体和交互相关区域的线索,从而实现更准确的活动检测。
C. 预测头
经过增强的演员(Actx)和群体(Gctx)嵌入被传递到轻量级前馈网络,用于:
- 群体活动分类: 预测集体行为。
- 演员活动分类: 预测个体动作。
- 成员关系推断: 将 token 投影到共享空间以计算亲和力,并将演员分配给群体(或识别异常值)。
D. 训练目标
模型使用多任务损失进行端到端训练,该损失结合了:
- 个体动作分类损失(Lind)。
- 群体活动分类损失(Lgroup)。
- 使用匈牙利匹配的演员 - 群体成员关系预测损失(Lmem)。
- 对比群体一致性损失(Lcon),以强制同一群体内的演员之间保持一致性。
3. 主要贡献
- 瓶颈识别: 本文证明了在现有的 GAD 解码器中简单地用冻结 VFM 替换 CNN 骨干网络会降低性能。它确立了解码器与表示的对齐是关键因素,而不仅仅是特征质量。
- GroupContext Transformer (GCT): 一种新颖的轻量级两层关系解码器,显式地将演员 - 群体关联的推理与全局上下文聚合分离开来。
- ProGraD 框架: 一个集成系统,将冻结 VFM 与最小化的 PEFT 条件化(可学习提示)及 GCT 相结合。它仅使用约 1000 万可训练参数(少于先前方法的一半)即实现了最先进的性能。
4. 实验结果
作者在两个基准测试上评估了 ProGraD:Café(多个并发社交群体)和 Social-CAD(稀疏交互,主要是个体)。
- Café 基准测试:
- ProGraD 在“按地点划分(Split-by-Place)”设置下,实现了 17.03 的 Group mAP@1.0 和 39.11 的 Group mAP@0.5。
- 与之前的最先进方法(Practical GAD)相比,mAP@1.0 提高了 6.2%,mAP@0.5 提高了 8.2%。
- 该模型使用了 1074 万 可训练参数,而 Practical GAD 使用了 2277 万。
- 即使是“仅解码器”配置(不含 PEFT 提示)也优于现有方法,证实了 GCT 架构的强度。
- Social-CAD 基准测试:
- ProGraD 实现了 70.00% 的社交准确率和 88.33% 的成员关系准确率,在参数更少的情况下优于先前的方法。
- 消融研究:
- 移除分组注意力层或上下文注意力层中的任一层都会导致性能显著下降,证实了它们的互补作用。
- 将群体提示的数量设置为与数据集的最大群体数量(7)相匹配,产生了最佳结果,这表明将 token 数量与数据结构对齐是一种原则性的设计选择。
- 定性分析:
- ProGraD 生成的注意力图更清晰,聚焦于人物和交互相关区域(例如桌子),而 naive 的 VFM 骨干网络则广泛地关注背景物体。
- 该模型能正确识别空间上非常接近但不属于同一群体的异常值,而基线方法往往仅基于 proximity(邻近度)错误地分类它们。
5. 意义与局限性
意义:
本文认为,GAD 的未来在于结构化关系解码,而不仅仅是扩大骨干网络规模。ProGraD 证明了通过最小化条件化和专用解码器,冻结的 VFMs 可以有效地适配复杂的社交推理任务,为达到最先进性能提供了一条参数高效的路径。该模型还提供了可解释的注意力图,揭示了演员 - 群体推理过程,这对于技能评估和反馈生成等应用具有重要价值。
局限性:
作者承认存在以下局限性:
- 对真实标注的依赖: 当前框架假设提供真实标注的演员检测结果;它不执行联合检测和分组。
- 固定提示数量: 群体提示的数量(K)被固定为数据集的最大群体数量,限制了其在群体大小变化的场景中的灵活性。未来的工作可以探索自适应 token 分配。
- 推理效率: 虽然参数高效,但推理仍需要通过大型冻结 VFM 骨干网络进行完整的前向传播。未来的工作可能会探索特征重用或自适应 token 选择以提高可扩展性。
- 失效模式: 在严重遮挡或镜像反射的场景中,该模型表现不佳,因为这些情况下的空间线索具有歧义性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。