Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies
本文提出了一种基于 Mamba 的跨模态架构用于第一人称视角动作识别,该架构融合了 RGB 视频与手部骨骼数据,并证明平均 CLS 令牌混合策略在 H2O 数据集上显著优于单模态基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教计算机仅通过观看从人眼视角(例如绑在额头上的 GoPro)录制的视频来理解一个人在做什么。这被称为第一人称视角视频识别。
问题在于,这类视频往往杂乱无章。相机剧烈晃动,双手经常遮挡视线,有时人还会将目光从正在做的事情上移开。这就像在试图拼拼图时,有人不断摇晃桌子,并用双手遮住一半的拼图块。
为了解决这个问题,研究人员利用一种名为Mamba的技术,为计算机构建了一个新的“大脑”。可以将 Mamba 想象成一位超级高效的图书管理员,它能比旧方法(如 Transformer)更快地阅读一本很长的书(长视频),而不会感到疲倦或迷失故事脉络。
双流方法:眼睛与手
研究人员意识到,要理解动作,计算机需要两种不同类型的线索,就像侦探既需要证人证词,也需要物证:
- “眼睛”(RGB 视频): 这是标准的视频流。它显示颜色和形状,但当双手遮挡视线时会感到困惑。
- “手”(骨架数据): 这是人手部的数字线框图。即使双手被杯子遮挡,计算机也能确切知道手指应该在什么位置。这就像拥有一层永远不会被遮挡的手部幽灵轮廓。
计算机首先分别处理这两股数据流,然后尝试将它们融合成单一的理解。
秘密武器:"CLS Token"
在这个过程的中间,有一个特殊的数据块称为CLS Token。你可以将这个 Token 想象成一份“摘要笔记”或“船长日志”。
当计算机观看视频并追踪手部动作时,它会为视频流写一份摘要笔记,同时为手部流写一份单独的摘要笔记。最后,它需要将这两份笔记合并成一份最终报告,以决定:“这个人是在倒咖啡还是在切三明治?”
该论文的主要发现是如何合并这两份笔记。研究人员测试了四种不同的混合方式:
- “天真”方法(白板): 丢弃两份旧笔记,从头开始写一份全新的笔记。
- 结果: 这失败了。这就像无视侦探的笔记,试图在没有线索的情况下猜测案情。
- “加权”方法(谈判者): 给视频笔记赋予一定的重要性百分比,给手部笔记赋予不同的百分比(例如 60% 视频,40% 手部)。计算机在训练过程中会学习这些百分比。
- 结果: 这效果不错,但计算机最终发现 50/50 的分配比例最佳。
- “基于上下文”方法(动态管理者): 计算机观察当前场景,并即时决定在多大程度上信任视频与手部数据。
- 结果: 令人惊讶的是,这种复杂的方法并没有比简单的方法表现更好。这就像雇佣了一位对每个决定都过度思考的管理者。
- “平均”方法(平等伙伴): simply 将视频笔记和手部笔记取平均值,平等混合(50/50)。
- 结果: 这是获胜者。 事实证明,最简单的方法——即给予两个线索相等的权重——是最有效的。
结果
当他们在名为H2O的数据集(包含人们执行倒水、切割和组装等日常任务的视频)上测试时,“平均”策略取得了巨大成功。
- 在较小的计算机模型中,准确率提升了10%。
- 在较大的模型中,准确率提升了25%。
这意味着,通过简单地平等结合“眼睛”和“手”,计算机在理解正在发生的事情方面变得更为出色,即使相机在晃动或双手遮挡了视线。
下一步是什么?
研究人员现在正在关注未来的两个主要方向:
- 在更大的数据集上测试: 以观察“基于上下文”的方法(动态管理者)在计算机拥有更多学习数据时是否表现更好。
- “特权信息”技巧: 他们希望利用视频和手部骨架数据来训练计算机,但随后仅使用视频进行测试。这就像使用教科书和导师进行学习,但仅凭教科书参加考试。这将使该系统在现实生活中更有用,因为在现实生活中我们可能并不总是拥有可用的“手部骨架”数据。
简而言之,该论文表明,对于第一人称视频理解,最佳策略往往是最简单的:平等地听取“眼睛”和“手”的意见,然后让计算机高效的"Mamba"大脑完成其余工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。