COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection
COPRA 是一个新颖的框架,它利用强化学习为冻结的视觉 - 语言模型生成特定于输入的参数更新,有效解决了训练与推理之间的不匹配问题,并在视频异常检测及其他视频理解任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名安保人员来监视数千小时的监控录像以发现异常。这就是**视频异常检测(VAD)**的工作。
长期以来,完成这项工作的最佳方法是训练一个超级智能的 AI(视觉 - 语言模型)来观看视频,并判断:“这看起来正常”或“这看起来像事故”。
然而,本文的作者COPRA注意到,目前训练这些 AI 安保人员的方法存在一个重大缺陷。他们称之为**“共享参数瓶颈”**。
问题: “一刀切”的制服
想象一下,你有一名安保人员,无论执行什么任务,都必须穿着同一套静态制服。
- 如果他们在银行执勤,需要寻找携带包裹奔跑的人。
- 如果他们在公园执勤,需要寻找打架斗殴的人。
- 如果他们在道路执勤,需要寻找车祸。
目前,大多数 AI 模型试图学习一套单一规则(即一套单一的“制服”),以同时适用于所有这些不同的场景。结果呢?AI 试图寻找一种“折中方案”。它在发现银行抢劫方面表现尚可,在发现公园斗殴方面也尚可,但在任何一种情况下都表现不出众。当它看到以前从未见过的新型异常时,它会感到困惑,因为它的“制服”并不适合那种具体情况。
此外,它们的训练方式与工作方式之间存在不匹配:
- 训练: AI 被展示长视频中的几个随机帧,并被告知:“这一整小时内某处出了问题。”
- 测试: AI 被要求逐秒查看微小且密集的视频切片,以精确找出问题何时发生。
这就像给厨师看一张成品蛋糕的照片并说“做这个”,然后却要求他们一粒面包屑一粒面包屑地烤蛋糕。指令与任务并不完全匹配。
解决方案:COPRA(“量身定制”的西装)
作者提出了一种名为COPRA的新系统。COPRA 不再强迫 AI 穿着同一套静态制服,而是赋予 AI 一位魔法裁缝,为它看到的每一个视频片段定制一套服装。
简单来说,其工作原理如下:
- 冻结的大脑: 主 AI(即“大脑”)保持冻结且不变。它已经对世界有了很多了解。
- 魔法裁缝(生成器): 一个微小、轻量级的辅助网络观察特定的视频片段(例如,交通场景与商店场景)。
- 即时定制: 基于所见内容,裁缝立即生成一套专门针对该片段的微小“调整”(称为LoRA 权重)。
- 如果片段是交通视频,裁缝会调整 AI 的注意力,使其关注车辆和行人。
- 如果片段是零售视频,裁缝会调整 AI,使其关注盗窃行为。
- 结果: AI 仅在那一刻穿上这套“定制西装”,做出判断,然后将其脱下。它不必记住一套适用于所有情况的折中规则;它能够即时适应。
他们如何训练裁缝(强化学习)
你可能会问:“裁缝如何知道该做什么调整?”
作者使用了一种称为强化学习的技术。这就像用零食训练狗:
- AI 猜测视频是正常的还是异常的。
- 如果它答对了(基于视频级别的标签),它就会得到一份“零食”(奖励)。
- 如果它答错了,它就得不到零食。
- 随着时间的推移,“裁缝”学会了生成能带来最多奖励的完美定制调整。
他们的发现
论文声称,这种“量身定制”的方法比旧的“一刀切”方法效果好得多:
- 更高的准确率: 在标准测试中(例如在监控视频中识别犯罪),COPRA 比以前的方法发现了更多的异常,并减少了错误。
- 更好的泛化能力: 当他们在 COPRA 从未见过的视频上进行测试时(例如用交通事故代替商店犯罪),它仍然表现良好。因为它学会了如何适应,而不仅仅是死记硬背,所以它能够处理新情况。
- 超越警报: 他们还表明,这种方法有助于 AI 写出更好的事件描述(例如“一辆车撞到了行人”),并回答有关视频的问题,证明“定制西装”有助于 AI 更好地理解上下文。
总结
简而言之,COPRA不再试图强迫单个 AI 模型同时成为所有领域的专家。相反,它赋予 AI 针对其观看的每一个特定视频即时重新配置自身的能力。这之间的区别在于:是一名安保人员穿着僵硬、不合身的制服应对所有工作,还是一名安保人员能立即换上最适合其所面临特定情况的装备。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。