EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
本文提出了 EgoAction,这是一个面向 EPIC-KITCHENS 挑战的以自我为中心的动作检测统一框架,它通过解耦动词与名词的时序建模,并采用一种新颖的动态加权融合策略,根据各流特定的可靠性自适应地融合其预测结果,从而提升了定位精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一段未经剪辑的长视频,内容是某人在厨房做饭,画面由佩戴在其头部的摄像头拍摄。视频画面晃动,镜头随头部移动,且视野中充斥着大量杂物。你的任务是扮演一位超级精准的剪辑师:你需要准确找出特定动作(例如“打开冰箱”或“搅拌平底锅”)的开始和结束时间,并正确标注。
本文题为EgoAction,介绍了一个专为赢得特定挑战(EPIC-KITCHENS 动作检测挑战)而构建的系统,该系统通过解决通常会让计算机陷入困境的三个主要问题来实现这一目标。
以下是他们解决方案的分解,使用了简单的类比:
问题:两位专家,一项混乱的任务
研究人员意识到,识别“正在发生什么”(即“名词”,如“杯子”)和“正在做什么”(即“动词”,如“拿取”)是两种不同的技能,它们往往以不同的方式失败。
- “名词”专家:这位专家擅长识别物体。但如果杯子被手遮挡或埋在碗碟堆里,这位专家就会困惑,可能会错误地猜测动作发生的时间。
- “动词”专家:这位专家擅长识别运动。但如果运动非常细微或发生得很慢,这位专家就会困惑,可能会错误地猜测开始或结束时间。
旧方法:以前,系统只是简单地取两位专家猜测结果的平均值。如果“名词”专家很有信心,但“动词”专家完全迷失了方向,平均值就会将正确答案拉向错误的一方,从而破坏时间定位的准确性。
解决方案:“可靠性感知”管理者
EgoAction 系统就像一个聪明的管理者,它不只是简单地对两位员工的意见取平均值;相反,它会倾听谁在特定时刻更有信心。
1. 两个独立的团队(解耦检测)
系统不再强迫计算机将“打开冰箱”作为一个巨大而复杂的概念来学习,而是训练两个独立的团队:
- 名词团队:只寻找物体(冰箱、杯子、刀)。
- 动词团队:只寻找动作(打开、拿取、搅拌)。
它们独立工作,使用一个强大的视觉大脑(称为 VideoMAE-L),该大脑已在数千个厨房视频上进行了预训练。
2. “动态加权融合”(聪明的管理者)
这是本文最大的创新。当两个团队完成工作后,它们会提出一个动作的开始和结束时间。
- 旧规则:“让我们取你们两个时间的平均值。”
- 新规则(DWF):系统查看每个团队的置信度分数。
- 如果名词团队有 99% 的把握看到了杯子,但动词团队对“拿取”动作只有 50% 的把握,系统会说:“好吧,我们将信任名词团队关于此片段开始和结束的时间定位。”
- 如果动词团队大喊:“我绝对看到了搅拌!”但名词团队因为平底锅模糊而不确定,系统则信任动词团队的时间定位。
这就像比赛中的裁判说:“站在原地看着球的球员有权决定比赛何时开始,而不是那个四处乱跑、困惑不解的球员。”
3. 拼合拼图(组合)
一旦系统从最可靠的团队获得了最佳时间定位,它会将最佳的“动词”和最佳的“名词”结合起来,生成最终标签(例如,“拿取” + “杯子” = “拿取杯子”)。它对最有可能的 10 个动词和名词执行此操作,创建一个候选列表,然后使用过滤器(Soft-NMS)去除重复猜测,以免对同一动作出现十个“拿取杯子”的标签。
结果
该系统在庞大的厨房视频数据集上进行了测试。
- 它在官方排行榜上取得了25.94% 的分数(称为"mAP"),在所有竞争者中排名第 3。
- 它证明了通过让“名词”和“动词”专家分别工作,仅在其中一个明显更可靠时才将它们结合,系统可以减少关于“何时”发生事情的错误。
总结
将 EgoAction 想象成一个由两位专家(一位负责物体,一位负责运动)组成的团队,正在处理一段晃动的视频。系统不是盲目地对它们相互冲突的意见取平均值,而是充当一位聪明的主管:“此刻谁更有信心,就由谁来决定确切的时间。” 这种策略上的简单转变,使它们能够在比赛中击败许多其他复杂系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。