On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
本文通过引入五个新的基准数据集,研究了遮挡对视频动作检测的影响,并证明了通过引入符号组件和特定训练方案增强后的模型,在处理静态和动态遮挡方面显著优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在电视上看一场足球赛,突然,一只巨大的、毛茸茸的狗直接跑到了屏幕前,挡住了你的视线,让你看不清前锋。如果你是人类,你仍然可以根据对比赛规则的了解来推测前锋的位置。但如果你问一台计算机去“看”这个动作,它往往会陷入恐慌并说:“我找不到这个球员!”
这正是这篇论文所研究的内容:当障碍物出现时,目前的视频检测 AI 表现到底有多糟糕。
核心问题:AI 极易分心
研究人员设置了一系列“玩具实验”来测试这些 AI 模型到底有多强。他们拍摄了人们做动作(如跳跃或奔跑)的视频,并在上面以数字方式粘贴了其他物体——比如公交车或猫。
结果令人警醒。当他们遮挡住动作执行者的仅仅一小部分(20%)时,AI 的性能就下降了 20% 到 50%。如果他们遮挡了整个背景,情况甚至更糟。这证明了即使是当今最聪明、最“尖端”的模型,在面对现实世界的遮挡时也并不鲁棒。它们并非天生强悍,只是没有经过处理遮挡情况的训练。
新的游乐场:五个新数据集
为了进行深入研究,团队不能仅仅使用旧视频。他们从头开始构建了五个新的基准数据集:
- O-UCF & O-JHMDB: 这些像是“辅助轮”,通过以受控的方式添加静态(静止)或移动物体,来测试特定的遮挡程度。
- OVIS-UCF & OVIS-JHMDB: 这些使用了“半写实”的移动物体,模拟现实世界中物体的实际运动方式。
- Real-OUCF: 这是“最终 Boss”关卡。这些是来自 YouTube 的真实视频,在这些视频中,人们在混乱的现实场景中真实地互相遮挡。
出人意料的英雄:Transformer vs. CNNs
长期以来,AI 界一直认为,如果仅仅教模型学会忽略被遮挡的部分(通过使用“数据增强”——即通过大量被遮挡的图像进行训练),它就会变得强韧。论文指出,这并不是故事的全貌。
他们发现,Transformer(一种 AI 架构)天生比旧的 CNN 模型更擅长处理这种情况,即使这些 Transformer 在训练过程中从未见过任何被遮挡的图像!
- 代价: 这些 Transformer 只有在先在海量数据集上进行预训练后,才会变得超级鲁棒。如果从头开始训练一个 Transformer 而没有那个庞大的起步阶段,它的表现会很差。这就像一个学生需要读完一座图书馆的书籍才能解开谜题;他们并非天生就知道答案,但他们拥有能够快速学习的正确“大脑结构”。
秘密武器:胶囊(Capsules)与“共识岛屿”
研究人员不仅发现了问题,还研发了一套修复方案。他们将 Transformer 主干与一种称为**胶囊(Capsules)**的技术结合了起来。
把胶囊想象成一支专业的侦探小组。
- 在普通的 AI 中,如果一把椅子挡住了一个人,AI 会对什么是人、什么是椅子感到困惑。
- 在这个新模型中,“胶囊侦探”可以自发地判断出:“好吧,这一组像素是人,而那一组是椅子”,即使它们以前从未见过椅子遮挡人的情况。
- 论文指出,这些模型会形成**“共识岛屿”(Islands of Agreement)**。想象在一间嘈杂的房间里的一群朋友;即使他们听不清整个对话,他们也能对谁是谁达成共识。AI 的内部 Token(微小的数据片段)开始在关于动作执行者位置的讨论中达成一致,从而在遮挡带来的噪声中创造出一个稳定的“真相岛屿”。
获胜配方:Token 掩码(Token Masking)
为了让这些模型更加强韧,作者尝试了一种简单的技巧,叫做 Token 掩码。
- 类比: 想象你正在学习一首歌,但每次练习时,你都会随机遮住乐谱上的几个音符。你必须根据剩余的旋律来猜出缺失的音符。
- 结果: 通过在训练期间随机“抹黑”视频数据的某些部分(甚至不需要添加虚假物体),模型学会了更好地填补空白。
计分板:表现提升了多少?
数据本身说明了一切。这个新配方(Transformer + 胶囊 + Token 掩码)以巨大的优势击败了旧的冠军:
- 在合成数据集上,性能提升了 32.3% 和 32.7%。
- 在棘手的现实世界视频中,它依然成功地超越了现有方法 2.6%。
他们排除了哪些因素
值得注意的是,这篇论文明确指出了哪些做法无效或不是答案:
- 仅仅增加参数并不是灵丹妙药。 虽然更大的模型通常会有帮助,但一个具有正确架构的小型 Transformer 击败了规模大得多的 CNN。
- 静态训练是不够的。 仅在静态图像上训练的模型在遮挡物开始移动时会表现挣扎。论文显示,模型在处理动态遮挡(移动的遮挡物)时,表现明显逊于处理静态遮挡。
- 预训练对于 Transformer 来说不是可选的。 论文明确展示了,如果没有在大规模数据集上进行预训练,Transformer 会失去其优势。
底线结论
作者总结道,虽然我们还没有完美地“解决”遮挡问题(仍有差距需要弥补),但我们已经找到了一种更好的处理方式。通过使用经过预训练的 Transformer,加入“胶囊”层来帮助正确分组像素,并使用“猜缺失部分”的策略进行训练,我们可以构建出对现实世界的混乱情况具有更强韧性的视频检测器。
他们甚至发布了代码和数据集,以便任何人都可以尝试在此基础上进行开发,因为目标是确保当一只狗跑到行人面前时,自动驾驶汽车不会仅仅是死机——而是继续行驶。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。